Problem
現有的 AI 代理基準測試多由研究者自行定義任務,難以反映真實世界中使用者對 AI 的實際需求與付費意願,導致學術進展與市場應用間存在認知斷層,無法確定 AI 是否真能處理具備商業價值的複雜工作。
Method
研究團隊系統性分析已獲市場採納的 AI 新創產品及其背後的使用者工作流,將其轉化為以「成果產出」為導向的端到端任務,並建立 StartupBench 評測基準。此框架採用細粒度的評分準則,用以精確評估模型在不同專業領域中處理複雜要求的表現。
Results
實驗顯示,即便是當前最強大的通用 AI 模型,在 StartupBench 上的任務完全達成率也僅約 30%。儘管模型在許多任務中能取得部分進展,但在遵循複雜指令與展現特定領域專業知識方面仍存在明顯短板,導致難以達到商業級的交付標準。
Significance
StartupBench 為 AI 代理的發展提供了具備實證意義的衡量標準。它揭示了通用 AI 模型與現實市場需求之間的技術鴻溝,有助於研究社群鎖定關鍵失敗原因,推動 AI 朝向能真正解決現實專業問題的目標邁進。