Problem
現行的多模態大型語言模型(MLLM)常採用「圖像思考」範式,賦予模型如裁剪與縮放等主動視覺操作能力。然而,這些操作往往伴隨高昂的 Token 成本,卻僅能帶來微小甚至負面的效能增益。研究者觀察到模型常反覆裁剪無關區域,甚至在直接推理能答對的問題上出錯,因此必須釐清回傳的視覺證據是否真的對最終答案產生因果影響。
Method
研究團隊將視覺工具的使用建立為因果圖模型,將「觀測中介路徑」與「動作誘導捷徑」分離。接著透過三個層次的干預進行審計:策略層級(對比工具使用與直接推理)、軌跡層級(在推理過程中破壞所有觀測值)以及步驟層級(對特定單一觀測值進行反事實替換)。此外,研究提出「視覺證據增益」(Visual Evidence Gain)指標,用以量化每一項回傳觀測值的具體貢獻。
Results
在針對六種代表性模型與五個感知基準測試的分析中,研究揭露了兩種主要的「策略失調」模式:首先是「呼叫而不觀看」,即回傳的視覺資訊對答案完全沒有因果影響;其次是「觀察而無規劃」,即資訊雖具啟發性,但調用時機與邏輯並不連貫。實驗顯示,整體的準確率提升僅集中在少數「已校準」的樣本中,在廣泛的路徑中,視覺工具的使用並不具備因果效力。
Significance
這項研究挑戰了目前多模態模型具備主動視覺推理能力的假設,並將此現象定義為「視覺工具使用的幻覺」。此發現對於開發更高效且具備因果邏輯的視覺推理系統至關重要,同時也提供了一套開源工具,幫助開發者精確評估多模態模型在複雜任務中的決策品質。