Problem
檢索增強生成(RAG)系統正面臨日益嚴峻的投毒攻擊,惡意文件會被注入檢索庫以操縱模型輸出。現有的偵測技術多仰賴困惑度(Perplexity)或一致性檢查,但精密的攻擊往往會誘發模型的「假性自信」,使受污染輸出的困惑度甚至低於正常生成,導致傳統的不確定性偵測手段徹底失效。
Method
研究團隊深入分析生成器的內部動態,發現了關鍵的「注意力崩塌」(Attention Collapse)現象。相對於正常生成時分散的注意力分佈,受攻擊的生成過程會展現出較低的熵值,注意力會異常集中於特定的投毒文件。基於此發現,研究者提出了 D-SCAN(文件級訊號崩塌分析)輕量級偵測框架,專門監控注意力動態以識別受攻擊的生成行為。
Results
在多個攻擊基準測試中的實驗證明,D-SCAN 能有效識別多種類型的投毒攻擊,表現優於傳統方法。值得注意的是,即使在攻擊未能成功改變最終答案的情況下,該方法依然能捕捉到內部異常的注意力分佈,顯示其具備極高的偵測靈敏度與前瞻性。
Significance
此研究揭示了 RAG 系統在安全性上的內在脆弱性,並從模型內部的注意力機制出發,提供了一套無需高昂運算成本且更具強健性的防禦方案。這為未來建構安全、可信賴的大型語言模型應用提供了關鍵的技術路徑與偵測標準。