Problem

目前 AI 編碼代理人的評測基準多集中在「依規格開發」的工程任務,缺乏能衡量 AI 是否具備自主研究能力的測試場景。由於世界模型(World Models)領域的架構與訓練目標極其複雜且缺乏統一最優解,成為測試 AI 自動化研究能力的理想場域。

Method

研究團隊開發了 AutoWorldModel-Bench 閉環基準測試。該系統涵蓋八種遊戲環境,並採用統一的結構化狀態表示法,將動態建模與感官知覺分離,讓 AI 代理人能在固定的運算預算下,專注於改進初始世界模型的代碼邏輯。

Results

在 64 次實驗中,Codex-5.4 與 Claude Opus 在 63 次任務中成功提升了初始模型效能。值得注意的是,高達 91% 的獲勝編輯屬於非顯而易見的研究型修改,例如開發新的目標函數、狀態表示法或架構調整,而非單純的超參數微調。

Significance

此基準測試成功將 AI 代理人的評估維度從「執行既定規格」提升到「開放式科學研究」。這為未來開發能自主發現新知識、優化複雜演算法的自動化 AI 科學家提供了關鍵的衡量工具與發展方向。