Problem

現有的視覺語言動作(VLA)模型雖然繼承了預訓練 MLLM 的特徵表示,卻往往未能有效利用其處理長序列視覺歷史與情境推理的能力。為了補足這項缺口,傳統做法通常需要額外開發複雜的記憶機制,這不僅增加了架構複雜度,也難以在即時機器人控制中兼顧長程運算與反應速度。

Method

研究團隊開發了 PonderPounce 架構,將控制過程分為兩個系統。負責深度推理的「Ponder」(System 2)將過往觀察、示範及推理結果累積於其原生的因果脈絡中,並產出認知標記;負責即時反應的「Pounce」(System 1)則結合當前感測資料與 Ponder 提供的最新認知標記來決定動作。兩者透過非同步介面運作並進行端到端訓練,無需額外的記憶模組或獨立的橋接預訓練。

Results

在 RoboMME 基準測試中,PonderPounce 展現出卓越性能,其 9B 模型在基礎資料量下成功率達 60.83%,擴大資料量後更提升至 75.54%,遠優於現有基準模型(57.88%)。此外,系統優化後的認知更新延遲僅 78 毫秒,動作模型調用僅 25 毫秒,足以支援 20Hz 的流暢動作播放。

Significance

本研究證明了僅需利用 MLLM 原生的脈絡處理能力,即可建構出具備強大情境感知的機器人記憶系統。這項成果不僅簡化了 VLA 模型的架構設計,更為開發兼具高層次推理與低延遲反應的具身智慧系統(Embodied AI)提供了一條極具潛力的新路徑。