Problem

現有的多模態大型語言模型(MLLM)在進行策略自蒸餾(OPSD)時,常面臨「模態失衡」的挑戰。當模型推理過度依賴文本資訊而忽略視覺輸入時,即便有精細設計的特權資訊,也難層次地被有效利用,導致模型無法充分整合多模態內容並限制了自蒸餾的成效。

Method

研究團隊提出 OPD-V 視覺策略自蒸餾範式。透過構建具備「縮放圖像」的正向教師與「遮罩圖像」的負向教師,觀察其推理正確性與 Token 機率值的變化,證實模態平衡本身即為一種關鍵的特權資訊。該方法利用「正向模態平衡對數邊際」定義出「模態平衡信任區域」,用以篩選用於自蒸餾的策略標記。

Results

在跨越 6 項基準測試、4 種 MLLM 骨幹網路以及 5 種後訓練方法的實驗中,OPD-V 一致性地提升了推理性能。與現有方法相比,OPD-V 不僅在準確度上有顯著進步,同時還能有效減少運算資源,降低整體的訓練成本。

Significance

這項研究突顯了模態平衡在多模態推理中的核心地位,並提供了一種創新的視覺自蒸餾機制。OPD-V 的成功證明了透過優化視覺與文本資訊的整合比例,可以克服傳統自蒸餾技術的局限性,為開發更強大且高效的多模態 AI 模型開闢了新路徑。