Problem
現有的大語言模型代理評估大多將模型視為固定的策略器,缺乏對其動態學習能力的檢視。研究者尚不清楚代理是否能主動測試自身行為、判斷產生的經驗,並利用這些經驗來優化未來的決策,進而達成真正的自我改進。
Method
研究團隊引入了互動式基準測試 S3Gym,將「自我測試」、「自我判斷」與「自我改進」三種能力耦合。該框架包含七款具備執行驗證器的文字遊戲,並評估了三種整合互動經驗的路徑:直接的歷史脈絡學習(History ICL)、分數引導的摘要記憶(Summary Memory)以及參量化訓練(Training)。
Results
實驗顯示自我改進並非自動發生且不具一致性。脈絡層級的經驗確實能提升效能,但成效取決於任務性質:摘要記憶在經驗可轉化為重複性策略規則時表現較佳,而當任務依賴精確的狀態資訊時,原始歷史紀錄則更有效。此外,參量化訓練在某些任務雖有顯著進展,卻也表現出改進不穩定與嚴重的負遷移現象。
Significance
本研究的重要性在於證明了僅能識別正確行動是不夠的,代理必須具備將反饋轉化為可執行且具遷移性策略的能力。S3Gym 提供了一個統一框架,用於診斷此轉化過程中的瓶頸,為開發能從錯誤中學習的可靠 AI 代理提供了理論支撐與評估工具。