Problem

現有的多模態嵌入模型難以同時滿足工業級的檢索需求。傳統的對比學習模型雖然效率高,但因監督信號過於粗糙,導致無法處理細粒度的語義辨識;而基於思維鏈(CoT)的生成式模型雖能精確辨析,卻因計算開銷過大而無法應用於大規模的即時搜尋與索引情境。

Method

研究團隊開發了「抖音多模態嵌入模型」(DME),採用兩階段訓練框架。第一階段進行大規模對比預訓練以建立統一的多模態空間;第二階段則透過「證據導向的類型化隱空間推理」與「跨條件重建」機制,在不增加推理負擔的情況下,讓向量能捕捉更深層的細節語義。這種設計讓 DME 具備標準編碼器的高效率,同時擁有生成式模型的精準度。

Results

DME 在 MMEB-v2 基準測試中展現了卓越性能,其 2B 與 9B 版本分別獲得 74.8 與 78.4 的高分,尤其在影片與視覺文件任務中表現優異。在抖音實際生產環境的測試中,DME 使離線評估指標提升 2.92%,並在線上 A/B 測試中為搜尋業務帶來 0.1% 的用戶生命週期價值(LT)增益。

Significance

本研究突破了大規模多模態檢索的效能瓶頸,證明了透過隱空間推理技術,可以在維持工業級低延遲的前提下提升模型性能。這項成果不僅為 AI 代理與智慧搜尋提供了強大的技術底層,也為處理複雜多模態資料的平台提供了具備實戰價值的解決方案。