Problem
開發大型語言模型(LLM)與 AI 系統時,研究人員難以在海量資訊中精準檢索相關的評測指標、獲取原始資料集與程式碼,且往往難以理解各項模型評分背後的具體設定、來源背景與比較標準。
Method
本研究開發 Benchmark Radar 動態資料庫,每日自動從 37 個學術與技術來源抓取最新的評測報告。系統收錄了 1,283 筆來源記錄與近 1.3 萬筆數值觀測數據,並提供視覺化網頁儀表板、排行榜、Pareto 前緣分析工具及指令列介面(CLI),支援離線查詢與可重複性分析。
Results
透過對目錄的全面審核,研究團隊分析了基準測試的飽和度、社群採用趨勢以及分數比較的侷限性。此外,論文展示了完整的技術搜尋案例,指引研究者在設計新評選方案時,如何高效檢索並驗證現有的基準測試證據與引用來源。
Significance
Benchmark Radar 為 AI 社群提供具備高度時效性且可溯源的資源中心,範疇涵蓋推論、程式碼、安全性及特定領域評測。它不僅顯著提升了基準測試的透明度,更為模型效能的長期追蹤與科學化對比提供了關鍵的基礎設施。