Problem
目前提升大型語言模型(LLM)代理能力的方法多依賴單線程的自我改進,容易陷入局部最佳解並產生路徑依賴。當優化特定任務時,常會導致其他任務表現退化,導致改進過程缺乏穩定性與廣泛的適用性。
Method
DarwinX 將代理的「裝備」(Harness,包含提示、工具、技能與控制流)視為演化種群。核心機制包含「保留與擴展」合約,確保新變體僅在不造成效能退化的前提下增加覆蓋率;同時利用存檔機制保留不同譜系進行重組,並透過統一介面整合失敗案例、導師回饋與自我導向的編輯證據。
Results
在四項基準測試中,DarwinX 平均提升約 17 個百分點。在 Terminal-Bench 達到 84.7% 的頂尖表現,而 WebArena-Infinity 的任務通過率更從 43.5% 飆升至 93.0%。演化出的能力展現出高度通用性,能無縫轉移至不同模型與 SWE-bench 等全新測試環境。
Significance
本研究證實了即便不更動模型權重,僅透過對代理裝備進行天擇演化也能大幅強化能力。這成功將評估階段的運算資源轉化為持久的代理技能,為開發具備自我進化能力的通用人工智慧提供了一套強大的框架。