Problem

多模態模型預訓練長期面臨高品質影音資料集稀缺、現有資源規模受限且缺乏開源途徑的問題,這嚴重限制了影音跨模態學習與大規模模型演化的發展潛力。

Method

從 CommonCrawl 篩選 13 億個網址並下載 8,000 萬部影片(總長 1,000 萬小時)。利用內容感知場景偵測擷取精準片段,並為影像與音訊自動生成合成標註;同時提取場景變換畫面作為圖文配對資料,以擴充不同於傳統網路圖庫的視覺分布。

Results

受測模型在標準影音與音文基準測試中取得具競爭力的成果,且效能隨資料量與模型規模增加而穩定提升。此外,利用影片格提取的圖文資料在檢索任務表現強勁,證實了影片作為圖文學習來源的優異性。

Significance

LAION-BVD 的發布為研究社群提供了前所未有的大規模影音資料存取權,不僅打破了資料取得的門檻,更為影像、音訊及文字的統一多模態預訓練奠定了關鍵的基礎設施。