Problem
在模型與測試框架(Harness)共同演化的趨勢下,持續更新底層框架既耗時又耗費大量運算資源。如何讓使用者端能以輕量化、低迭代次數的方式優化特定任務的執行框架,並生成高品質的執行軌跡以供未來模型訓練使用,是目前 AI 代理開發的一大挑戰。
Method
研究團隊開發了「遞迴式 Harness 自我改良(RHI)」演算法。該方法將執行框架定義為提示層級(Prompt-level)的代理流程規範,並利用其自身修訂歷史中的成對回饋(Pairwise Feedback)進行迭代精煉,從而在不修改模型權重的前提下,優化代理的運作邏輯。
Results
在涵蓋計量金融、機器人與製藥等 30 項機器學習研究任務中,RHI 僅需少數迭代即可顯著提升低推理強度代理的表現,甚至超越了最高推理強度的基準設定,並降低高達 60% 的推理成本。研究顯示,效能增益主要源於更有效的跨代理資訊流與上下文管理,而非單純增加推理長度。
Significance
RHI 為模型與框架的協同演化提供了實用的持續學習框架。它證實了優化執行流程(Harness)與資訊管理,能比盲目增加運算量更有效地提升 AI 代理效能,為開發高效能、低成本的專業領域 AI 系統開闢了新路徑。