Problem
現有評測基準難以區分多模態模型的「感知錯誤」與「推理失敗」。許多研究將兩者混為一談,且應用導向的測試範疇過於狹窄且零碎,導致開發者無法精確判斷模型究竟是視覺辨識失誤,還是後端的邏輯推斷或領域知識不足。
Method
採用由下而上的診斷方法,分析 16 個尖端模型在 42 個現有基準中的失敗案例,歸納出包含十項原子感知能力的分類體系。據此建構 3,000 個經人工驗證、答案簡短明確的測試問題,每個題目僅鎖定單一感知能力,刻意排除複雜推理與專業知識的干擾。
Results
測試結果顯示原子感知能力仍未被攻克,目前尚無任何模型準確度達到 60%。其中「感知相關幻覺」是平均表現最弱的項目。研究更發現,即便總分相近的模型,其感知能力的具體分布也大相徑庭,顯示現有模型在基礎感知能力上存在顯著的異質性。
Significance
此研究為多模態模型的視覺感知邊界建立了標準化的診斷尺度。透過精確定位感知失效點,PerceptionBench 不僅能協助辨識模型缺陷,更為未來優化圖像底層理解能力、減少模型幻覺提供了關鍵的指導方向。