Problem
現有的基礎模型在處理長程複雜任務時,安全性多依賴外部防護或事後微調(SFT),缺乏內生的狀態維護能力。這使得模型在持續互動中難以維持穩定的行為約束,且難以在不更動模型核心權重的情況下,針對特定任務進行動態的安全狀態調整。
Method
研究團隊開發了 Safin-1 模型族,採用核心架構「跨上下文歷史之記憶錨點路由(MARCH)」。此架構透過內容條件路由來維護結構化的記憶狀態,並實現「安全狀態(Safety State)」介面。這讓模型能在測試時(test-time)針對特定能力狀態進行適應與演化,而無需反覆修改基礎模型的主幹參數。
Results
實驗結果顯示,Safin-1 在下游安全任務中展現了顯著的狀態適應能力,大幅提升了模型的安全性表現。此外,在通用能力測試、長文本理解、資訊檢索效率等指標上,Safin-1 亦展現出優異的競爭力,證實了路由狀態介面能有效統一上下文記憶與持續性的能力適應。
Significance
這項研究重新定義了模型記憶的功能,將其從單純的歷史記錄轉化為驅動模型行為演化的「主動基質」。透過「內生安全(Safety from Within)」的架構探索,本論文為基礎模型提供了一條通往具備原生安全性、且能自主維護狀態的新路徑,對長程人機互動的安全性具有重要影響。