Problem

目前的 AI 代理人評測多集中於短時程任務,缺乏對長週期、高動態環境下決策能力的評估。真實商業場景需要模型在長達一年的時間跨度中,面對數千步的交互,展現出從經驗中學習並持續優化策略的能力,而非僅是簡單的任務串聯。

Method

研究團隊開發了 E-Commerce Bench,模擬為期 365 天的電商營運。模型需同時經營多家線上商店,處理市場調研、供應商多輪談判、採購、銷售、物流及金流管理。系統整合了真實電商平台的產品與供應商資料,並加入促銷、天災與供應鏈衝擊等動態事件。為了確保實驗可重複性,市場需求與談判邏輯採用確定性模型,僅由 LLM 負責語言化溝通。

Results

在 18 個頂尖模型的評測中,GPT-5.6 Sol 雖然資產增長最顯著(將 10 萬開初始資金增長至 143 萬),但在防範詐騙方面卻在 18 個模型中排名第 16,營運效率也遜於 Fable5。在開源模型中,Qwen3.8-Max-Preview 以 41 萬資產領先,並展現出卓越的學習能力,能透過重複訂購逐步壓低供應商價格。

Significance

此研究填補了自主商務代理人在長期營運評測上的空白。結果顯示,目前尚未有模型能全面主導所有商業維度,模型在獲利、風險控管與營運效率之間存在明顯權衡。這為未來開發具備持續學習能力、能應對複雜現實環境的商業 AI 提供了重要的基準工具。