Problem

現有的 GRPO 強化學習框架在處理基於準則(Rubric)的訓練時,習慣將單一的總分獎勵均勻分配給所有 Token。這種做法導致模型無法辨識哪些特定片段、格式或語意選擇真正符合評分要求,在回覆內部的信用分配(Credit Assignment)上缺乏精確機制。

Method

研究團隊提出「反事實回放」(CoRT)技術,無需額外訓練評分模型。CoRT 透過對比同一回覆在「含準則提示」與「無準則提示」下的 Token 對數似然值(Log-likelihood),計算各 Token 對準則的依賴程度。這些對比值被轉換為歸一化權重,用以重新分配 GRPO 的優勢函數值。

Results

實驗顯示,CoRT 在多種指令微調模型與獎勵粒度下,表現平均優於傳統 GRPO 約 4.4 個百分點。該方法在不增加輔助評分器或改變總體獎勵的情況下,效能足以媲美需要額外學習階段的 Token 級別歸因基準模型。

Significance

CoRT 證明了利用策略內部的反事實似然對比,能有效解決回覆內的信用分配問題。這不僅保留了 GRPO 的簡潔與訓練穩定性,更為大型語言模型在細粒度對齊與複雜任務評估下的優化,提供了一套高效且易於實作的解決方案。