Problem

在 Agentic Search 領域,強化學習常面臨監督訊號稀疏的問題。雖然能從強大的封閉原始碼模型進行知識蒸餾,但因無法取得機率分布(logits)且 Tokenizer 不一致,傳統方法往往使模型只能模仿表面的語氣風格,而非真正的邏輯推理能力。

Method

本研究提出「多智能體協定蒸餾」(MAPD)框架。該框架利用多智能體系統(MAS)將搜索過程轉化為包含任務類型、推理計畫與事實依據的結構化 JSON 協定。在訓練過程中,此協定作為中間表示提供給學生模型的特權分支,藉此產生稠密的蒸餾訊號,並與強化學習目標(RL objective)共同優化。

Results

在七項問答基準測試中,MAPD 表現顯著優於傳統的蒸餾與強化學習方法。在 Qwen3-1.7B 與 Qwen3-4B 模型上分別達到了 39.4% 與 44.4% 的平均成功率。此外,該框架能有效防止學生模型出現風格漂移(style drift)或過度冗贅的問題,展現出強大的泛化能力。

Significance

這項研究成功克服了封閉與開源模型間的分佈差異,為提升小型語言模型的專業搜索能力提供了新典範。透過協定標準化的設計,證明了結構化知識比單純的文字模仿更能有效傳遞核心推理能力,對於資源受限環境下的模型部署具有高度價值。