Problem

現有 3D 多模態大語言模型多採用固定的模態組合,忽略了不同查詢對於幾何或視覺資訊的需求差異。這種僵化的設計容易引入無關模態產生的語義雜訊,並造成運算資源浪費,最終導致模型的推理能力被稀釋。

Method

提出名為 SmartMage 的統一框架,整合兩大核心技術:首先是「語義引導模態自適應路由」(SMART)模組,根據語義先驗與文本對齊篩選任務相關模態;其次是「模態感知門控專家」(MAGE)模組,利用模態先驗引導專家激發,實現專業化的多模態推理。

Results

在五項 3D 場景理解基準測試中,SmartMage 均取得當前最先進(SOTA)的效能,並在 RGB 影片理解任務展現強大的競爭力。透過診斷測試 ScanFacet,研究進一步證實模型能針對不同細粒度語義類別,精準選擇最匹配的模態組合。

Significance

該研究為體現智能(Embodied Intelligence)提供了更靈活且高效的感知架構,成功克服異質資訊整合的瓶頸。這不僅優化了 3D 環境下的語義推理品質,也為未來多模態大模型的動態資源分配提供了重要範例。