在大型語言模型(LLM)驅動的 AI 浪潮中,如何將雜亂的 PDF、PPTX 或圖檔精準轉換為機器可理解的 Markdown 或 JSON 格式,一直是開發者面臨的痛點。Datalab 近期發表的 Marker v2,正是為了解決這個難題而生的重量級更新。這套完全重寫的開源轉換工具,整合了最新的 Surya OCR 2、僅 2,000 萬參數的高速版面配置模型,以及效能提升三倍的 pdftext 引擎,試圖在精準度與運算效率之間取得最佳平衡。

根據 Allen AI 釋出的 olmOCR-bench 第三方評測數據,Marker v2 在「均衡模式(Balanced Mode)」下的表現令人驚艷。它不僅在綜合得分上拿到 76.0%,在處理原生數位 PDF 時準確度更高達 83.5%。更關鍵的是效能表現,在單張 NVIDIA B200 GPU 上,Marker v2 每秒可處理 2.9 頁,這比競爭對手 MinerU 的 0.54 頁快了超過 5 倍,也顯著優於 IBM 開源工具 Docling 的 50.3% 準確度。

Marker v2 的影響力在於其靈活的分層處理機制。它提供三種路徑:追求極致品質的「均衡模式」、平衡成本與速度的「快速模式」,以及完全依賴 CPU 運行的「純文本提取」。這種設計讓企業能根據預算與應用場景(例如:需要精準圖表解析的學術論文,或是只需文字摘要的商務合約)自由切換。這對於正在建構 RAG(檢索增強生成)系統的技術團隊來說,大幅降低了資料清理(Data Cleaning)的門檻與運算成本。

為什麼這項發展值得關注?在當前的 AI 領域,高品質的訓練資料被視為「數位黃金」。Marker v2 的出現,代表開源社群現在擁有一套效率足以與商用方案抗衡的工具,能將堆積如山的非結構化文件轉化為高品質的訓練資料集。它不只提升了處理速度,更透過優化模型架構降低了對頂級 GPU 資源的過度依賴,讓大規模的文件轉檔變得更具經濟效益。這不僅有助於 RAG 技術的普及,也為後續模型微調提供了更紮實的資料基礎。