Problem
目前的基準測試大多僅針對單一開發階段或最終產出進行評估,無法捕捉遊戲開發中邏輯、視覺、音訊與互動性必須高度整合的複雜本質。這使得開發者難以全面衡量大型語言模型(LLM)代理人在處理完整開發生命週期時的真實能力。
Method
研究團隊推出 GameXpert-Bench,將開發流程拆解為三大互補賽道:GameGen(從零開始生成完整遊戲)、GameFix(診斷並修復已知或潛在錯誤)以及 GameOpt(透過多輪需求鏈進行持續優化)。該框架包含 11 種遊戲類型、97 個生成任務、100 個修復任務及 17 條優化鏈,並結合即時互動、行為測試與回歸檢查進行嚴謹評估。
Results
實驗結果顯示,目前的 AI 代理人在建立具可玩性的基礎架構與執行明確需求方面表現穩定,但在主動發現缺陷、驗證執行階段(runtime)行為,以及在多次迭代修改中確保既有功能不失效(功能保全)等任務上仍面臨巨大挑戰。
Significance
此研究建立了一套更貼近專業開發實務的評測標準,不僅量化了 AI 與專業遊戲開發者之間的技能差距,也為未來自動化程式碼代理人的優化方向提供了明確的科學指引。