Problem
傳統的互動式遊戲世界模型大多直接在像素或潛在空間進行自回歸,這使得姿勢、幾何形狀及遮擋等結構化屬性被迫隱含在生成序列中。隨著生成時程增加,這些潛在屬性的誤差會不斷累積,導致視覺一致性崩潰且難以精確操控。
Method
研究團隊開發了 Marionette 模型,將生成過程拆分為三個階段:首先,由兩階段自回歸動力學模型預測具備可解釋性的 276 維 3D 世界狀態(含骨架與軌跡);其次,利用零參數圖形橋接器計算幾何與遮擋關係;最後,透過影片擴散模型將這些結構化控制轉化為光影擬真的 RGB 影像。
Results
實驗證實預測狀態具備直接可控性,變更動作流會導致 31% 的關節誤差變化。在長時程生成中,透過在 3D 狀態層面加入地形碰撞與距離限制規則,能將地面穿透率降低 66% 並維持實體互動,且視覺保真度(FVD 831)與使用真實錄製姿勢生成的影像品質相仿。
Significance
這項研究展示了將明確的圖形學幾何運算與神經生成模型結合的潛力,證明了透過中介的 3D 狀態層,可以有效解決生成式 AI 在物理規則維護上的弱點,為開發具備物理常識且高度可控的虛擬世界模型開闢了新路徑。