Problem

現有的學習型稀疏檢索(LSR)主要侷限於雙向編碼器架構,且在擴展至多模態環境時,往往需要依賴複雜的輔助跨模態模組,導致系統架構碎片化,且難以在單一流程中達成高效的語義匹配。

Method

研究團隊開發了 UEmbed,這是一款採用僅解碼器(decoder-only)架構的多模態嵌入模型。它透過在輸入序列附加 N 個可學習的特殊標記,並將詞表劃分為 N 個子集,讓模型在單次因果前向傳遞中,能同時預測稀疏權重向量與密集表徵。

Results

實驗結果顯示 UEmbed-9B 在 MMEB-v2 評測中,密集與稀疏表徵分別達到 71.8 與 71.0 的優異成績,顯著超越 RzenEmbed 等基於公開資料訓練的模型。此外,該模型在 BEIR 基準測試中也展現出能與強大基準模型媲美的競爭力。

Significance

UEmbed 建立了一種全新的典範,成功在單一模型中統一了稀疏與密集嵌入,並將稀疏檢索技術有效擴展至文字與多模態輸入。這不僅提升了搜尋系統與檢索增強生成(RAG)的運作效率,也為未來 AI 代理應用的發展提供了更穩健的技術基礎。