Problem
目前的強化學習(RL)研究大多與預訓練階段脫節,導致兩個核心問題懸而未決:預訓練的選擇(如模型大小、資料量)如何影響 RL 的回報,以及 RL 究竟對模型內部機制產生了什麼實質改變。由於標準語言模型的預訓練資料過於龐大且難以控制,學界亟需一個受控的環境來釐清這兩者間的因果關係。
Method
研究團隊採用西洋棋作為受控測試場景,模擬標準的大型語言模型訓練流程。實驗涵蓋了從 5M 到 1B 參數的模型,先以人類對局進行預訓練,再透過合成推理軌跡進行監督式微調(SFT),最後在具有可驗證獎勵的西洋棋謎題上執行 RL。此外,團隊亦將此框架延伸至數學領域,驗證其發現是否具備通用性。
Results
實驗顯示,RL 後的性能與預訓練損失(loss)高度相關,且 RL 獎勵曲線的斜率隨預訓練標記數(tokens)呈線性增長。更重要的是,RL 的作用不只是精煉 SFT 的策略:在簡單任務中,RL 會強化 SFT 原本就偏好的正確答案;但在困難任務中,RL 能挖掘並激發出 SFT 階段幾乎從未出現過的正確推理路徑。
Significance
本研究建立了「預訓練至 RL」界面的量化帳目,證明了充足的預訓練是提升 RL 效率的關鍵。這不僅為推理能力的科學研究提供了受控的測試平台,也為未來開發者在配置預訓練與後訓練資源時,提供了具備預測能力的理論框架。