Problem
傳統的合成環境在模型能力提升後,往往因過於簡單而無法提供有效的學習訊號。現有的共演化方法(co-evolution)過度依賴在策(on-policy)採樣,導致模型在變強的過程中難以維持泛化能力,且容易面臨訓練訊號枯竭的瓶頸。
Method
研究團隊開發了「環境進化」機制,從多輪學習目標中推導出影響環境難度的三個演化維度。該方法透過多代理人協作架構(multi-agent harness)以離策(off-policy)方式,分代生成難度遞增的環境序列,確保模型在訓練過程中始終能接觸到具挑戰性的任務。
Results
定量實驗顯示,該方法能穩定產出比現有模型更高難度的環境。在 Qwen3.6-27B 與 Qwen3.6-35B-A3B 模型的長時程強化學習測試中,Terminal-Bench 2.1 的效能表現分別大幅提升了 14.4 與 18.0 個百分點。
Significance
此項研究為訓練高階終端代理人提供了一套可擴展且具備持續挑戰性的環境生成方案。它成功克服了模型能力擴張時缺乏有效學習資料的困境,對於開發具備複雜推理與長時程執行能力的 AI 代理人具有關鍵影響力。