Problem
目前大型語言模型的強化學習多採用如 GRPO 等群體方法來避免訓練評論員模型(Critic),但這類方法對每個提示詞(Prompt)需進行多次採樣,效率較低。雖然標準評論員訓練能實現 Token 層級的優勢估計,卻常面臨訓練過程極度不穩定與價值估計失準的問題。
Method
研究團隊開發了「最佳實踐評論員優化」(Best Practice Critic Optimization, BPCO)。此方案整合了 DPPO、受限於獎勵範圍的價值預測、蒙地卡羅價值目標、未歸一化的策略優勢值,以及長度自適應的廣義優勢估計(GAE)。此外,BPCO 允許評論員在訓練期間存取模型本身不可見的隱藏資訊,如參考答案或評分準則。
Results
在數學推理任務的對照實驗中,BPCO 在從 1.5B 到 30B MoE 等不同規模的模型上,表現皆穩定優於傳統的評論員基準。值得注意的是,BPCO 僅需針對每個提示詞採樣一次,其結果便能比肩甚至超越需要多次採樣的群體相對優勢估計方法,並在準則式獎勵任務中展現更佳的學習成效。
Significance
這項研究證明了只要經過精心設計,評論員模型可以成為群體相對優勢估計的強大替代方案。BPCO 不僅解決了強化學習的不穩定性,更顯著提升了訓練效率,為未來結合複雜輔助資訊與細粒度回饋的語言模型優化路徑提供了關鍵技術指引。