Problem

現有的具驗證獎勵強化學習(RLVR)雖能提高單次樣本準確率,但受限於訓練時的探索能力不足,難以擴展模型的內在推理覆蓋率(pass@k)。這導致模型在面對複雜問題時,往往只能產出相似的錯誤路徑,無法有效探索多樣化的解題邏輯。

Method

提出 DATPO(難度自適應句子熵引導樹狀策略優化)框架。該方法捨棄傳統的平行採樣,改採樹狀卷積結構,並利用「句子級熵值」來引導分叉,以克服標記級分支產生的局部化現象。此外,DATPO 引入了同層多樣性優勢項(sibling-diversity advantage),在訓練期間顯式鼓勵語義多樣性。

Results

在數學推理基準測試中,DATPO 在 pass@k 指標上顯著超越現有基準模型。實驗數據證實,訓練階段推理覆蓋率的提升,能直接轉化為更強的測試時縮放(test-time scaling)效能,使模型在應對高難度題目時展現更高的正確率。

Significance

此研究重新定義了強化學習中訓練卷積結構的重要性。DATPO 不僅突破了 RLVR 的探索瓶頸,也為提升大型語言模型的推理廣度與深度提供了創新的技術路徑,對開發具備自主糾錯與多路徑思考能力的 AI 模型具有關鍵影響。