Problem
具身視覺追蹤(EVT)要求機器人僅靠機載相機追蹤特定自然語言描述的目標。現有的視覺語言動作(VLA)模型常在抽象空間進行推理,導致決策難以監督,且與實際影像中的目標偵測結果缺乏明確關聯,容易在複雜場景中失去目標。
Method
ReferTrack 採用「先指引再追蹤」範式。模型首先從一組索引邊界框中選定目標,再根據此影像基準決策解碼追蹤路徑點。為保留目標的運動規律,系統透過滑動窗口維護歷史邊界框佇列,並利用「時空視角框指標」(TVBI)標記注入幾何特徵,同時結合自製的 Refer-QA 資料集進行協同訓練。
Results
在 EVT-Bench 基準測試中,ReferTrack 於單目標、干擾及歧義追蹤場景的成功率分別達到 89.4%、73.3% 與 74.1%,其單視角效能甚至超越了部分多鏡頭模型。此外,該模型已成功部署於四足機器人與人形機器人,驗證了優異的模擬轉真實(sim-to-real)遷移能力。
Significance
這項研究解決了具身追蹤中語義理解與空間動作脫節的難題。透過將目標識別過程顯性化,不僅大幅提升模型的可解釋性與監督效率,更證明了單一前向鏡頭即可在複雜環境下實現高度穩定的跟隨任務,對機器人自主導航具備重要參考價值。