Problem
在具備可驗證獎勵(RLVR)的強化學習中,傳統的群體相對策略優化(GRPO)對所有採樣(rollouts)使用固定的重要性採樣剪裁邊界。這導致在處理困難問題時,少數成功樣本所帶來的強烈學習訊號,會與簡單問題的平庸訊號以相同比例被剪裁抑制,限制了模型從罕見成功經驗中學習與探索的能力。
Method
研究團隊提出「群體自適應剪裁策略優化」(GAPO),這是一種針對 GRPO 的隨插即用改進方案。GAPO 基於逆向 KL 信任區域視角,將剪裁門檻與樣本的優勢值掛鉤,讓具有較高優勢值的樣本獲得更大的更新空間。此方法無需額外的獎勵塑形,僅需在現有的 PPO 或 GRPO 代理目標函數中調整剪裁閾值即可實作。
Results
實驗結果顯示,在 Qwen 與 Llama 系列模型的測試中,GAPO 在數學推理與程式碼編寫的基準測試上,其 Pass@1 與 Pass@k 指標皆穩定優於固定剪裁及優勢塑形等基準方法。特別是在基準模型初始通過率較低的具挑戰性任務中,GAPO 展現出顯著的效能增長。
Significance
這項研究為強化學習中的探索與穩定性平衡提供了新思路。透過動態調整剪裁邊界,GAPO 能夠更有效地利用珍貴的成功訊號,對於開發具備高難度問題解決能力的大語言模型具有重要的參考價值,尤其是在需要精準邏輯推理的應用場景中。