Problem

現有的影片編輯模型多採用「原地編輯」假設,要求輸出與輸入在固定時間跨度內逐幀對齊。這種模式無法處理直播或長鏡頭等開放式流媒體,因為當編輯需求必須隨時間延續至未來幀,而非僅限於靜態片段時,傳統方法將難以維持生成的連貫性與穩定性。

Method

研究團隊開發了 InfinityEdit,這是一種輕量化的「編輯觸發適配器(Edit-Ignition Adapter)」。該適配器包含三種核心模組:歷史交叉注意力用以引導去噪過程、時間因果自注意力確保資訊僅由過去流向未來,以及編輯交叉注意力負責注入指令。推論時僅在編輯請求到達的片段啟動適配器,隨後恢復原始模型生成,藉此保留無限生成的潛力。

Results

實驗結果顯示,InfinityEdit 在處理多樣化的編輯指令時,能確保影片流的忠實延續。相較於傳統方法,它在面對無邊界的編輯序列時表現極為穩定,生成品質不會隨著編輯次數增加而衰減,成功達成隨時、隨地且無止盡的影片修改。

Significance

這項研究定義了「無限影片編輯」的新範式,並提供配套的資料收集流程。其技術貢獻在於能將編輯能力賦予串流影片生成器,且不破壞其原始的生成穩定性,為即時遊戲風格變換、動態長鏡頭處理等應用情境開拓了全新的可能性。