Problem

現有影片編輯系統普遍缺乏顯式的圖層化表示法,導致在進行物件插入或影片分解時,僅能依賴隱式推論或針對特定場景進行優化。由於缺乏前景圖層的監督資訊,系統難以達成擬真的合成效果,也限制了物件的重複利用性與一致的後製操作。

Method

研究團隊開發了 TriLayer 大型資料集,包含成對的複合影片、背景與包含視覺特效的前景圖層。基於此資料集,團隊提出 DBL-Diffusion 雙分支擴散框架,透過共享去噪機制與分支間的交互作用,同步建模 RGB 複合影像與 RGBA 前景圖層,並將其應用於 DBL-Insert(物件插入)與 DBL-Decompose(影片分解)兩項任務。

Results

實驗結果顯示,顯式圖層建模顯著提升了插入物件的忠實度與分解品質。該方法能生成帶有透明通道(Alpha Channel)的高品質前景,不僅讓合成影像更加自然,也為後製編輯提供了更大的靈活性,在多項指標上均優於僅依賴隱式學習的現有方法。

Significance

這項研究為影片編輯領域導入了關鍵的顯式圖層監督概念,打破了過去依賴隱式推論的限制。這不僅提升了自動化剪輯的擬真度,更為專業影音製作提供了可重複利用且易於調整的圖層化流程,對於高品質影片合成技術的發展具有重要影響。