Problem
目前的自我進化代理人(Self-evolving agents)會將過去的互動紀錄轉換為可重複使用的「技能」。傳統攻擊主要集中於檢索污染,僅在惡意資料被當作上下文讀取時才生效。然而,這類代理人的學習機制存在更深層的風險:惡意經驗可能被代理人自身固化為持久的行為偽裝,即使原始的污染資料被刪除,惡意行為仍會存在於技能庫中。
Method
研究團隊開發了 SkillJack,這是首個利用「經驗到技能」轉換管道的攻擊方法。該攻擊具備三大特性:首先是「清理漂白」(Sanitization whitewashing),在提取技能時掩蓋惡意意圖以規避偵測;其次是「跨層級提升」(Cross-layer promotion),將暫時的經驗轉化為永久能力;最後是「持久隔離」(Persistence isolation),確保攻擊在來源紀錄遭刪除後依然存續。
Results
在 SkillX 與 Anything2Skill 兩個系統的實驗顯示,技能提取過程大幅降低了攻擊的可偵測性。以 SkillX 為例,安全偵測率從中毒軌跡的 98.5% 驟降至提取技能後的 11.4%,而攻擊成功率最高可達 89.2%。此外,高達 80.0% 的技能介導攻擊在刪除原始中毒紀錄後仍能正常運作,部分技能甚至會在良性查詢中被意外觸發。
Significance
這項研究證明了技能演化過程是一個全新的攻擊面,現有的靜態防禦機制難以應對這種「演化式」的威脅。研究結果促使人工智慧社群必須重新思考代理人的安全架構,並強調了建立具備來源追蹤(Provenance-aware)能力的技能生命週期防護機制之急迫性。