Problem
現行的 AI 安全規範過度聚焦於模型訓練階段(如 RLHF 或 DPO),對於能自主執行程式碼、修改檔案與操作資料庫的代理人而言,這類結構性限制並不完善。僅依賴模型內化的安全性,無法有效攔截執行過程中的危險行為或驗證行動的真實性。
Method
研究提倡將安全視為由執行環境框架強制的「執行時期契約」,分為兩大面向:預防面透過沙盒、權限閘門與輸出過濾器攔截動作;證據面則要求提供測試紀錄、檔案差異(diffs)與引用來源等可驗證證據。團隊並透過 52 起安全事件分析、軌跡綱要審核,以及對 28,560 篇頂尖 AI 論文的發表趨勢進行量化統計。
Results
審核顯示,NeurIPS、ICML 與 ICLR 等頂尖會議中,關於訓練時期的安全論文數量比部署時期高出 8 至 12 倍,存在嚴重的資源失衡。此外,透過 32 個核心案例的稽核,證明了現有代理人系統在防止「虛假完成」與維護執行軌跡完整性上的顯著缺陷。
Significance
此研究借鑑資訊安全與實驗科學的演進經驗,主張 AI 安全的單位應從「模型」轉向「附帶可檢核證據的執行軌跡」。這為自主代理人的開發提供了具備操作性的形式化綱要與研發議程,是確保 agentic AI 在現實環境中安全運作的關鍵轉型。