Problem
在遊戲或沈浸式渲染中,自回歸模型常因 KV 快取空間有限而「忘記」過去場景。當攝影機重新回到曾造訪過的地點時,即便輸入的深度圖完全相同,模型仍會生成與先前外觀不符的影像,導致 3D 世界的視覺表現缺乏持久性與連貫性。
Method
研究團隊開發了名為「Closing the Loop」的技術,利用 3D 引擎既有的幾何資訊來達成閉環一致性:首先透過時間關聯性,將歷史場景的特徵重新擷取至快取中作為記憶;接著利用位姿與深度重投影的空間關聯性,引導注意力機制精準對齊幾何對應區域,確保新舊影像特徵同步。
Results
在 TartanAir 與 TartanGround 資料集的循環軌跡測試中,該方法證明能在不損及影片整體畫質的情況下,於重複造訪一致性指標上顯著優於現有的「無需訓練」基準模型,成功在複雜的真實世界應用場景中維持穩定的視覺呈現。
Significance
此研究為長效影片生成提供了高效解決方案,無需昂貴的後置訓練成本即可直接應用。這對開發具備長期持久性的虛擬世界、提升 3D 遊戲寫實度以及沈浸式內容創作具有重大的技術貢獻。