Problem
現有的視覺語言模型(VLM)常依賴語言先驗或資料集中的統計捷徑,而非圖像中的具體證據來回答問題。目前的後訓練(post-training)方法主要透過全域擾動來提升感知,但缺乏測試機制來驗證模型的回答是否真正與支持該論點的局部影像證據具有因果關係。
Method
研究團隊提出「反事實證據解耦」(CED)稽核機制。在訓練過程中,CED 會中和特定的目標證據區域,並將其產生的支持度下降程度與對比的非證據區域進行比較。此訊號隨後與 GRPO 演算法結合,獎勵那些依賴正確證據路徑而非無關路徑的回答。該方法僅需弱目標建議,無需手動標註,且不會增加推理負擔。
Results
在九個公開基準測試與四種模型骨幹的實驗中,CED 的表現均優於現有的強化學習後訓練方法。針對性分析進一步證實,該機制能有效強化模型對目標物件的關注,顯著提升模型推論的視覺在地化準確度。
Significance
此研究為提升視覺語言模型的可靠性提供了重要突破,確保模型的決策過程源於真實的視覺證據。由於其無需額外的人工標註且不影響推理速度,對於開發高效、可信賴且具備因果推論能力的 AI 視覺系統具有高度實務應用價值。