Problem

社群媒體上常見的單目影片與影像,在缺乏足夠視角資訊的情況下,難以生成高品質的新視角。現有的重建技術如 NeRF 或 3DGS 在稀疏輸入下容易崩潰,而生成式模型則常面臨大基線移動時幾何不一致及相機控制不精確的挑戰。

Method

UniWorld-View 引入一套統一框架,將顯式 3D 引導與生成式影片擴散模型相結合。核心技術包含「遮擋感知點雲渲染策略」,能有效解決視覺歧義並提供準確的幾何先驗。透過將此渲染策略與強大的影片擴散主幹網路耦合,確保模型在極端相機運動下仍能生成連貫的影像。

Results

在 WorldScore 及多項零樣本新視角合成(NVS)基準測試中,該模型展現了卓越的可控性、幾何一致性與視覺逼真度。實驗證明其能應對劇烈的相機位置變化,並可產出高品質多視角影片,進一步支援下游的動態 3DGS 重建任務。

Significance

這項研究突破了從極度受限的單目資料生成沉浸式內容的限制。藉由銜接幾何導向與生成模型,為未來內容創作、虛擬實境及從日常影像重建動態 3D 場景提供了關鍵的技術路徑。