Problem

現有的多模態模型常產生不符合視覺證據的回答。傳統強化學習依賴純量獎勵(Scalar Reward),僅能告知回答是否正確,卻無法精確指出是哪個視覺事實、推理步驟或指令約束出現錯誤,導致多模態訓練中的「信用分配」失效。

Method

研究團隊研發 V-Rubrics 框架,將參考答案拆解為原子命題,並針對視覺忠實度(VF)、推理一致性(RC)與指令遵循(IF)進行結構化評分。團隊建構了包含 5 萬筆資料的 V-Rubrics 50K 資料集,並結合 GRPO 演算法對 Qwen3-VL 模型進行組件式、定位化的後訓練優化。

Results

實驗結果顯示,採用評分規程的 GRPO 在知識導向與視覺推理基準測試中,表現優於傳統的 SFT 基準模型及純答案導向的 GRPO。特別是在處理視覺定位與複雜推論任務時,細粒度的評分機制帶領模型取得顯著的性能增長。

Significance

此研究證明了「評分規程」是多模態模型後訓練中極為有效的獎勵抽象化手段。透過提供結構化的局部信用分配,能有效解決視覺推論中的幻覺問題,為提升大型語言模型的視覺事實性與邏輯嚴謹度開闢了新路徑。