Problem
目前的強化學習(RL)搜尋代理人通常將檢索視為自由格式的自然語言生成,導致訓練中出現「檢索等價崩潰」(retrieval-equivalence collapse)。意即代理人雖生成不同的查詢字串,卻得到高度重疊的資訊證據,使不同軌跡之間的獎勵值過於接近,導致模型難以區分決策優劣,缺乏有效的檢索對比學習訊號。
Method
提出 Harness-G 圖形結構框架,將檢索介面從自由生成重新設計為「有限動作選擇」。代理人需從環境提供的清單中選擇證據句子、實體或決定回答,而非自行撰寫查詢。此外,結合「結構化非近視信用分配」(SNC)機制,利用固定評分器比較當前動作與替代方案的潛在收益,將下游收益精確回饋至關鍵的早期動作。
Results
在六項問答基準測試中,Harness-G 在不同規模下均取得最佳的平均 F1 分數。相較於目前最強的基底模型 Graph-R1,Harness-G 在 1.5B 參數規模下效能大幅領先 10.74 分,在 3B 規模下則領先 3.98 分,證明了該框架在處理複雜檢索任務上的優越性。
Significance
此研究重新定義了搜尋代理人與環境的互動介面,有效解決了語言歧義導致的訓練瓶頸。透過結構化動作空間與前瞻性信用分配,為開發高效能、具備精密推理能力的自主搜尋代理人提供了全新的技術範式。