Problem

現有多模態大型語言模型(MLLM)雖然能利用視覺中間產物來輔助空間推理與狀態更新,但影像編輯器能否精準執行所需的圖像轉換仍缺乏系統性評估,這使得研究者難以判斷推理失敗的原因是來自於邏輯缺陷,還是影像生成的品質不足。

Method

提出名為 Aphanta 的自動化任務發現與閉環診斷框架,針對「直接推理」、「使用編輯器生成的圖像推理」以及「使用理想參考圖像推理」三種情境進行對比實驗。透過這種方式,研究能分離出視覺改善的潛在空間,並量化當前編輯工具在不同任務中的實際效用。

Results

在 20 項候選任務中,研究發現影像編輯的效用高度取決於任務性質。於視覺提示注入、定位(Grounding)及反事實狀態實現等任務中,效能顯著提升,使 Qwen 模型流水線的平均分數從 0.343 增加至 0.445(相對提升 29.7%);然而在需要精密符號建構或結構推斷的任務上,可靠性則大幅下降。

Significance

這項研究重新定義了影像編輯在 AI 推理中的角色,將其視為「特化的視覺工作空間」而非通用推理機制。Aphanta 框架提供了一套可重複使用的協定,用於衡量任務與表徵之間的對齊程度,為優化 MLLM 與影像編輯器的協作流程奠定了基礎。