Problem

目前的搜尋代理人多依賴最終結果進行監督,卻難以在搜尋過程中即時定位中間步驟的錯誤。當錯誤不斷累積時,終端獎勵(terminal rewards)無法引導代理人即時修正路徑;此外,固定的反饋機制無法隨代理人能力的提升而動態調整,導致模型優化容易陷入瓶頸。

Method

提出 CAFE(耦合代理人與反饋演化)框架,讓單一模型交替擔任「搜尋代理人」與「評論者」角色。在線上強化學習中,利用「調用與跳過」的反饋成功率差距來重塑回報,並進行反饋感知的優勢函數調整;在線下則透過成對的成功與失敗軌跡進行偏好優化,使反饋機制能隨策略更新而共演化。

Results

CAFE 在七項搜尋基準測試中表現優於現有的強化學習代理人,並在六項域外測試中維持穩定增益,有效減少了答案層級的幻覺現象。消融實驗證實,單獨提升代理人或評論者都會導致性能停滯,唯有讓兩者交替更新才能使模型效能持續成長。

Significance

這項研究揭示了自我改進型代理人的關鍵:反饋機制必須與其指導的策略同步演化。CAFE 證明了耦合優化路徑的有效性,為開發更可靠、具備自我修正能力的大型語言模型代理人提供了重要的技術框架。