Problem
隨著大型語言模型(LLM)代理的技能庫不斷擴大,如何精準檢索相關技能成為難題。現有方法如向量檢索忽略了技能間的獨立性與先後關係,而傳統圖譜檢索則常因邊緣關係(Edges)不夠可靠,導致無法在複雜工作流中正確捕捉技能間的相依性與上下文資訊。
Method
提出「反事實因果技能圖譜」(CaSKG)框架。首先結合語義、詞彙、輸入/輸出及結構資訊建立高召回率的候選圖,並輔以 LLM 評判進行修正。接著利用「反事實探測」技術,藉由移除、替換或重新排序技能對來校準因果權重,最後搭配貝氏平滑與狀態過濾,在不改變代理策略的前提下,實現離線構建與任務導向的精準擴展。
Results
在 ALFWorld 與 ScienceWorld 基準測試中,CaSKG 搭配六種主流 LLM 均取得最佳表現。與現有技術 Graph-of-Skills (GoS) 相比,ScienceWorld 平均分數從 72.62 提升至 80.50,ALFWorld 成功率從 80.01% 升至 86.79%,且顯著減少了達成目標所需的環境執行步驟,有效保留了前置條件與驗證程序。
Significance
本研究證明了「邊緣置信度校準」是實現大規模且可執行技能檢索的有效路徑。CaSKG 不僅優化了檢索結果的精簡性,更確保了技能銜接的因果邏輯,為開發具備長期記憶與複雜決策能力的自治代理提供了關鍵技術支持。