Problem
現有的大型語言模型(LLM)防禦機制仍易被惡意提示詞繞過,且可解釋性分析產生的內部訊號缺乏標準化的整合方式。目前的部署方案往往將特定訊號與其驗證邏輯、策略代碼緊密耦合,導致每次新增安全組件都需重新開發系統架構,難以形成協同防禦。
Method
開發受 Linux 安全模組(LSM)啟發的 LMSM 框架,實現「中介正確性」與「策略有效性」的解耦。系統包含三個核心組件:提供校準證據的安全後端、評估動態規則的版本化策略,以及控制緩衝輸出釋放的閘門機制,並在 vLLM 平台上支援稀疏自動編碼器(SAE)與密集探針等技術。
Results
在 Qwen3-4B 模型測試中,LMSM 成功將 HarmBench 攻擊成功率從 39.20% 大幅降至 3.32%,同時維持了 98.14% 的原始推論吞吐量。實驗證明,該框架能在不更動推論基礎設施的前提下,彈性組合多重安全規則並精確處理併發請求,且僅微幅增加 XSTest 的誤判率。
Significance
本研究為模型內部分析與執行期防禦(Runtime Enforcement)之間架起了標準化橋樑。它允許開發者在不重構系統的情況下,動態更新安全後端與防禦策略,讓可解釋性研究的最新進展能更快速、低成本地轉化為實際的 LLM 安全防護能力。