Problem

現有終端任務(Terminal Tasks)的生成往往僅關注可行性,即任務是否可執行與驗證。然而,僅具備可行性並不代表任務對於特定模型具備學習價值。若任務過於簡單或過於困難,將無法有效驅動模型成長,導致現有的訓練資料擴充方式缺乏效率。

Method

研究團隊開發了 CalibForge 系統,採用「對抗式求解器校準」(Adversarial Solver Calibration)技術來修正候選任務。該方法包含兩種核心策略:第一是「多求解器校準」,鎖定異質求解器群體中的意見分歧點;第二是「對比求解器校準」,精準設定強、弱模型間的表現差異。透過這兩種方式,系統能錨定出具備訓練價值的「可學習區域」。

Results

利用 CalibForge 成功建構了 5,431 個校準後的終端任務。實驗顯示,使用校準資料訓練的模型在 Terminal-Bench 2.0 上的表現提升了 24.71 個百分點,並在 SWE-bench Pro 與 Doc2Repo 基準測試中分別獲得 27.68 與 30.04 分的成長,成效遠優於傳統的手動編寫或單一模型回饋。

Significance

這項研究證明了「求解器相對可學習性」(Solver-relative learnability)是建構高品質 AI 代理訓練資料的關鍵目標。CalibForge 提供了一套自動化且可擴展的框架,不僅優化了訓練效率,也為開發能應對複雜真實環境的高性能終端代理提供了新路徑。