Problem

現有的注意力稀疏化方法多採用 Top-K 選取,並透過蒸餾原始模型的注意力權重來訓練選取器。然而,高注意力權重並不等同於對預測結果的高貢獻度,這種不一致性導致在有限的計算預算下,模型容易將資源浪費在次要的資訊上,限制了稀疏化後的模型效能。

Method

研究團隊提出「簡單注意力稀疏化」(SAS),核心概念是將選取器的連續分數以對數形式注入注意力 Softmax 中,使語言建模損失能透過標準反向傳播直接優化選取器。此外,SAS 採用標準化閘道校準歷史上下文,並開發了記憶體高效的 Triton 核心,將此機制無縫整合至 FlashAttention 的運算流程中。

Results

在推理、長文本理解及代理人(Agentic)任務的實驗中,SAS 在各種注意力預算下均優於現有的可訓練稀疏化基準模型。特別是在資源極度受限的緊湊預算下,SAS 展現出更顯著的效能增長,證明其能更精準地識別並保留對下游任務關鍵的上下文資訊。

Significance

這項研究解決了注意力稀疏化中選取器與預測目標失衡的核心難題。SAS 不僅簡化了訓練流程,更透過精準的上下文排序,在維持強大語言處理能力的同時,大幅降低了處理長序列資料的運算成本,為高效能大語言模型的佈署提供了新路徑。