Problem
訓練 API 調用型 Agent 需要大量高品質的操作軌跡,但建構包含可執行 API 與真實預填資料庫的後端環境極為耗時,且難以針對不同應用場景進行大規模擴展,成為開發過程的主要瓶頸。
Method
採用「無環境合成資料生成」法,將大型語言模型視為即時數位世界模型。首先由模型根據 API 規格生成多樣化任務,再由 Teacher Agent 嘗試解題,過程中由 LLM 模擬器根據任務上下文與歷史紀錄,產生具連貫性的虛擬 API 回應。最後,透過 LLM 評審機制過濾並確保資料集的品質。
Results
在 AppWorld 與 OfficeBench 等包含資訊檢索與狀態變更任務的複雜基準測試中,使用此合成資料微調的模型性能獲得顯著提升。實驗結果證實,即使完全沒有實體執行環境,也能生成足以強化 Agent 能力的有效監督訊號。
Significance
此研究確立了基於 LLM 的 API 模擬是一種實用且具備高度擴展性的解決方案,讓開發者能跨越多元的 API 生態系訓練智慧代理人,大幅減少對複雜模擬環境或後端工程的依賴。