Problem
多參考圖形編輯在維持不同參考圖間的視覺一致性與整體畫面和諧感上仍面臨巨大挑戰。現有的強化學習方法缺乏能精準捕捉多圖關聯約束的獎勵模型,且直接使用多模態大型語言模型(MLLM)作為評估者時,常面臨幻覺推理或邏輯判斷力不足的兩難困境。
Method
研究團隊提出「多維度評估驗證獎勵(EVR)」框架,將評估拆解為獨立的視覺準則。系統由 MLLM 評估器生成多個候選假設,再由驗證器根據具體視覺證據核實主張,產生可靠的細粒度獎勵訊號。配合可擴展的資料管線,此方法能在不改動模型架構的情況下,對現有編輯器進行強化學習微調。
Results
實驗結果顯示,該方法顯著提升了基礎模型 Qwen-Image-Edit 的表現,在視覺一致性與畫面和諧度指標上,已達到甚至超越了 NanoBanana 模型。這證明了 EVR 產生的獎勵訊號能有效引導模型掌握複雜的多圖關聯性。
Significance
此研究突破了傳統 MLLM 評估的侷限性,提供了一種無需修改模型架構即可大幅提升編輯品質的通用方案,為多參考圖形生成與複雜影像編輯任務開拓了更具可靠性的技術路徑。