Problem

企業自動化流程高度依賴 AI 代理根據自定義架構(Schema)提取資訊,但現有評測缺乏能同時衡量數值準確度、長列表提取完整性、來源證據追溯(Grounding)以及運算成本的綜合性基準,導致開發者難以在性能與支出間取得平衡。

Method

開發 ExtractBench 基準測試,包含 4,869 頁文件,橫跨 8 個商業領域與 67 種文件類型。其建置流程結合了多系統一致性檢驗、合成資料驗證與人工審核,並採用對順序不敏感的數值 F1 分數,以及針對來源可追溯性的字詞與頁面級別評分指標。

Results

測試結果顯示,商用視覺語言模型(VLM)在處理短文件時表現優異,但在長文件中常有列表遺漏的問題;程式碼代理雖然準確度最高,但成本極其昂貴。而 LlamaExtract Agentic Plus 在各項指標均名列第一,能以極低成本達成媲美程式碼代理的提取精度。

Significance

本研究為企業級文件提取提供了標準化的評估工具與數據集,不僅填補了長文件提取品質評測的空白,更證實了代理型架構在自動化文件處理中,能同時達成高效能與經濟可行性,對推動智慧化辦公具有重要參考價值。