Problem
目前對 AI 研發自動化的評估方法存在缺陷:不是過於局限在簡單、可驗證的任務,就是依賴品質不穩定且隨機性高的匿名同儕審查,難以準確衡量 AI 代理人在面對高難度、開放式科學研究時的真實能力。
Method
研究團隊提出「影子評估」(Shadow Evaluations)法,選定兩篇 NeurIPS 2026 等級的未發表論文,讓頂尖 AI 代理人在六天內動用數千美元的運算資源,嘗試解決其中的核心研究問題。最後,由原論文作者根據專業學術標準,對 AI 產出的結果進行評分與回饋。
Results
實驗發現,AI 代理人雖能在無人協助下完成所有底層工程開發與實驗執行,卻無法在核心研究問題上取得實質進展,最終兩項任務均遭原作者判定不合格。研究歸納出五大失效模式:學術價值判斷力不足、應對設計缺陷缺乏創意、無法有效從死路回溯、資源調度意識低落,以及指令執行產生漂移。
Significance
此研究為 AI 自動化的現狀提供了關鍵的早期證據,證實當前的 AI 代理人雖然是優秀的工程執行者,但在科學研究生命週期中最核心的決策、創意與批判性判斷環節仍存在顯著鴻溝,對 AI 進展的過度樂觀預期提供了現實的修正參考。