Problem

目前影片基礎模型的預訓練高度依賴大規模資料,但其背後的資料管線多屬封閉狀態,導致外界難以審視或重複使用。研究者若想探討特定的「資料食譜」如何影響預訓練效果,往往必須先耗費鉅額資源建立龐大的基礎設施,這極大地阻礙了影片預訓練數據相關的科學假設驗證。

Method

研究團隊開發了名為 VidaForge 的開源基礎設施,將影片資料食譜定義為從原始影片到訓練資料集的五階段可執行工作流。此架構允許研究者在保持生成過程一致的前提下,靈活調整工作流中的單一決策以構建對比資料集。此外,團隊同步釋出了 VidaForge-3M 資料集,包含 314 萬段、總計 6,475 小時的場景級影片剪輯,並附帶細粒度的標註與篩選訊號。

Results

透過 Wan 2.1 與 V-JEPA 2.1 的從頭預訓練實驗證明,涵蓋範圍較廣的資料食譜在下游基準測試中獲得最高分。研究同時發現,若僅以損失函數(loss-based)作為評估指標,則會偏好不同的資料食譜。這顯示 VidaForge 能有效揭示資料食譜選擇與模型最終性能之間的直接關聯。

Significance

VidaForge 的重要性在於其為影片預訓練提供了透明、可重現且標準化的研究框架,打破了大型模型開發中的數據黑箱。透過開源的工具與大規模高品質資料集,該研究顯著降低了學術界探索影片資料策略的門檻,對提升影片生成與表徵學習模型的效率具有長遠影響。