Problem
混合思考多模態大型語言模型(MLLM)能在深思熟慮與快速推理模式間切換,但兩者常出現反應模式不一的問題。僅靠正確率無法捕捉如思維鏈洩露、重複、邏輯矛盾或表演性推理等行為缺陷,導致非思考模式下的反應品質顯著下降,產生系統性的行為失準。
Method
研究團隊推出包含 2,415 個提示的 PatternEval 診斷基準,涵蓋視覺感知與知識推理等領域,專門偵測四類常見的反應失敗。同時開發 PatternRM 獎勵模型,並透過 PatternRL 在強化學習過程中引入針對特定失敗模式的懲罰機制,用以優化 Qwen3-VL 系列模型。
Results
實驗顯示,非思考模式的失敗率普遍高於思考模式。透過 PatternRL 的優化,Qwen3-VL-4B 與 8B 模型在維持任務準確度的前提下,成功緩解了跨模式的行為不對齊現象,顯著降低了反應模式的失敗率,使兩種模式的輸出更趨於一致。
Significance
隨著模型推理模式趨於多樣化,確保不同運算成本下的反應行為符合使用者預期至關重要。本研究為混合思考模型建立了首個完整的評估與訓練框架,對於開發可靠且行為一致的 AI 應用提供了實質的技術指導與檢測工具。