Problem
目前的室內場景生成面臨規模化瓶頸:基於視覺語言模型(VLM)的代理人流程雖然生成品質高,但迭代過程耗時且成本昂貴;而參數化影像轉 3D 模型雖具備效率,卻常導致物理不合理或精確度不足。此外,現有模型難以針對單一輸入產出具備多樣性的結果,無法反映現實場景的動態變化。
Method
SceneMosaic 框架結合了上述兩者的優點:首先從學習到的影像先驗獲取初始候選佈局,隨後利用 VLM 代理人進行演化,確保物理有效性與效率。該方法利用自然場景的局部性特徵,將場景分解為獨立的局部單元,在各單元分別演化後,透過笛卡兒積(Cartesian product)組合出完整且多樣化的全域場景。
Results
在 SceneEval-100 評測中,SceneMosaic 在語義佈局品質上媲美最強大的代理人基準模型,但生成速度提升了 24 倍。實驗結果顯示該框架能大幅減少物理穿插違規情形,並在人類主觀評比中獲得最高分,證明其生成的場景既真實又實用。
Significance
此研究為具身智慧(Embodied AI)與互動娛樂產業提供了高效且高品質的環境生成方案。透過兼顧生成效率與物理合理性,SceneMosaic 能夠快速產生大量可直接用於模擬訓練的多元場景,對於開發更具適應性的 AI 代理人具有重要價值。