Problem

現有的大型語言模型(LLM)安全性對齊通常採用全域微調,這種做法往往會導致模型在處理一般無害指令時的實用性受損,即所謂的「對齊稅」(alignment tax),使安全性與模型效能難以兼顧。

Method

研究團隊開發了 CLEAR 框架,這是一種條件式安全性適配方案。它在凍結的模型骨幹上加入安全低秩適配器(LoRA),並透過一個輕量級的隱藏狀態門控(hidden-state gate)來連續控制適配器的激活強度,僅在偵測到潛在風險時才介入安全防護。

Results

實驗證明,CLEAR 在 Llama-3-8B-Instruct 上將 HarmBench 的攻擊成功率(ASR)從 32.3% 顯著降低至 0.5%。同時,其 GSM8K 數學運算準確度比傳統的全域 SFT 或 LoRA 微調高出 7.1 個百分點,展現出極佳的效能保留能力。

Significance

此項研究為 LLM 對齊提供了更精細的控制機制,證明了透過動態路由技術可以有效優化安全性與實用性之間的權衡,對於開發兼具安全性與高效能的生成式人工智慧具有重要的實踐價值。