Problem
在視覺生成領域,擴散損失(diffusion loss)過去難以隨提示詞標記數量縮放,導致開發者缺乏量化文字條件化(text conditioning)效果的標準,難以有效提升模型對複雜文字描述的理解與執行力。
Method
研究團隊引入 GPG(白盒似然)與 ED(黑盒屬性)兩種指標來量化提示詞的結構化程度。透過整合圖像的語義與幾何標註來構建結構化提示詞,並運用監督式微調(SFT)、冷啟動以及驗證器門控的同策蒸餾(on-policy distillation)技術,訓練出高效的提示詞(Prompt)產生器。
Results
實驗證實收斂後的擴散損失與 GPG 呈線性下降關係,並與 ED 遵循冪律(power law)規律。該系統在幾乎所有組合性、推理及世界知識基準測試中均優於現有的開源模型,表現甚至超越或與頂尖的閉源模型持平。
Significance
本研究揭示了文字結構化程度與生成品質間的關鍵聯繫,為未來視覺生成技術的縮放提供了理論依據與實踐路徑,顯著提升了模型的可擴散性與提示詞響應力(Promptability),對縮短開源與商業模型間的技術差距具有重大貢獻。