Problem

科學方法論圖表對結構保真度要求極高,任何組件錯位、箭頭方向錯誤或文字模糊都會導致研究邏輯失效。現有的開源模型在監督式微調(SFT)下難以確保留結構正確性,而傳統的標量獎勵強化學習則無法明確指出是哪一個結構維度出錯,導致生成結果不穩定。

Method

研發 SciForma 框架,將圖表品質歸納為組件、箭頭與文字三個結構軸,並建立包含 70 萬筆資料的 SciFormaData 與驗證邏輯的 SciFormaBench。核心技術為「多維度連言偏好優化(M-DPO)」,強制模型在所有維度上同步達成正確性,並在推論階段導入迭代編輯機制以修正殘餘錯誤。

Results

SciForma-9B 在 SciFormaBench-2K 與 AIBench 基準測試中,表現不僅超越所有開源模型,更勝過專有的 GPT-Image-1.5。實驗證明該模型能精確處理複雜的定向關係與學術標註,顯著縮小了開源工具與商用軟體之間的差距。

Significance

此項研究為科學圖表的自動化生成提供了標準化的評估基準與高效的優化路徑。透過開源模型達到商用等級的結構保真度,將能大幅協助科研人員精確傳達複雜的研究邏輯,並促進結構化視覺生成技術的進步。