Problem
現有的基準導向強化學習(Rubric-based RL)面臨兩大核心挑戰:一是「未探索準則(UC)」,即因缺乏探索導致部分準則無法獲得優化訊號,且現有解決方案常因訓練與推理不一致導致錯誤累積;二是「受抑制準則(SC)」,即模型雖達成了特定準則,其學習訊號卻因標量獎勵聚合後的負值優勢而被抵銷,分析顯示超過 57% 的樣本受此問題影響。
Method
提出「準則蒸餾策略優化」(CriPO),採用同策略自我蒸餾技術。針對 UC,設計準則注入自我導師並計算局部前向 KL 散度,將缺失行為植入策略中;針對 SC,則透過反事實自我導師定位負值優勢樣本中的關鍵標記(tokens),將其優勢值翻轉為正值,藉此保留並強化原先會被抑制的有用行為模式。
Results
在醫學與科學領域的基準測試中,CriPO 的表現一致優於傳統基準導向強化學習方法。實驗結果顯示,CriPO 不僅達成更強的最終效能,且達到相同性能水準所需的優化步數減少了約兩倍,顯著提升了訓練效率與收斂速度。
Significance
此研究揭示了獎勵聚合過程中訊號流失的關鍵缺陷,並提供了一套不需引入額外推理偏差的解決方案。這對於優化大型語言模型在複雜、多準則任務中的表現具有高度實務價值,也為提升強化學習的樣本效率與精確度提供了全新的路徑。