Problem
目前的顯式鏈式思考(CoT)推理高度依賴文字解碼,導致測試時擴展(Test-time Scaling)的運算成本極高。雖然隱含推理(Latent Reasoning)使用連續向量進行運算,速度更快且效率更高,但因缺乏可處理的每步似然值(Likelihood)與適應性停止機制,難以應用結果獎勵(Outcome-reward)強化學習來提升推理能力。
Method
研究團隊提出「代理潛在策略優化」(Surrogate Latent Policy Optimization, SLPO),為自動回歸隱含推理器引入兩項核心技術:首先是透過潛在轉移的經驗代理策略密度,實現軌跡層級的信度分配(Credit Assignment);其次是開發受正確性監督的停止頭(Stopping Head),藉由結果獎勵優化將其轉化為可調整推理長度的變長策略。
Results
實驗證明,SLPO 在連續與軟性思維設定下,顯著提升了並行採樣的 Pass@k 表現。該方法能自動辨識題目難度,為困難問題分配較長的隱含運算資源,從而提高確定性推論的準確度,使潛在推理模型得以突破過往僅能依賴模仿學習的限制。
Significance
此研究成功將強化學習引入隱含推理領域,證明模型不需要透過昂貴的顯式解碼,也能實現高效的思維擴展。這為開發兼具低延遲與高推理能力的次世代人工智慧模型提供了關鍵的技術路徑,對於資源受限下的高效能推論具有重大影響。