Problem

線上策略蒸餾(OPD)通常假設教師模型提供的獎勵等同於推理進度。然而實務上,即使學生的推理步驟在邏輯上有實質進展,只要其輸出路徑與教師的原始內容稍有偏離,仍可能獲得較低的蒸餾獎勵。這種不一致的回饋會迫使模型盲目模仿教師語句,而非學習真正的推理邏輯。

Method

研究團隊開發了「推理進度感知獎勵過濾」(R2-OPD)技術。該方法在單一推理軌跡中,針對不同的推理片段建立兩種排名:一種基於教師提供的蒸餾獎勵,另一種則是獨立估算的進度獎勵。當兩者的排名出現衝突時,系統會自動抑制該教師獎勵,藉此保留有效的指導並剔除會干擾推理邏輯的雜訊。

Results

實驗結果顯示,R2-OPD 在多項推理任務的表現均優於傳統的 OPD 方法。透過過濾掉與推理進度相左的監督資訊,學生模型展現出更強的邏輯推演能力,並能更有效地學習如何解決複雜問題,而非僅僅是模仿教師模型的特定表現形式。

Significance

這項研究揭示了知識蒸餾中「過度模仿」對邏輯訓練的負面影響,並提供了一種更靈活的優化機制。這對於開發需要高度精準邏輯的生成式 AI 模型具有重要意義,特別是在科學運算、程式碼生成等高度依賴推理進度的應用場景。