Problem
目前的動作引導影片世界模型(Video World Models)面臨低延遲生成與操作精確度的權衡。雖然因果蒸餾技術可縮減生成步數,但在因果訓練與自迴歸滾動過程中,難以讓離散的鍵盤狀態及連續的滑鼠動態,在時間壓縮的潛在空間中與影像內容保持精確同步。
Method
研究團隊開發了名為 ForgeWM 的漸進式框架,將雙向動作引導影像產生器轉化為高效的少步數模型。該流程包含領域適應、教師引導的因果訓練、因果一致性蒸餾,以及與雙向教師進行的策略分布匹配。此外,該模型支援雙路徑部署,結合了對延遲要求極高的即時互動,以及可在事後利用一步模型重新加噪並精煉畫面的重播機制。
Results
在 Minecraft 軌跡測試中,ForgeWM 在影像品質、動作輪廓一致性、按鍵與滑鼠控制準確度及 LPIPS 指標上均優於現有系統,且能穩定運行於 1、2、4 步去噪預算下。同樣的流程也成功遷移至手把控制的 FPS 遊戲。其重播精煉模式僅需極少步數即可達到高品質標準,且比從噪聲重新生成更貼近原始體驗軌跡。
Significance
此項研究為即時互動式世界模型提供了高效的解決方案,能在極低計算成本下達成高品質且高精準度的控制生成。這對開發低延遲雲端遊戲、自動化 AI 代理人訓練環境以及虛擬世界模擬具有重大的應用價值。