Problem
微調大型視覺語言動作(VLA)模型學習新任務時,手動收集遠端操作示範資料的成本極高,且傳統強化學習在處理複雜的長程任務時效率低下,難以直接應用於具備數十億參數的巨型模型。
Method
提出 EXIMO 演算法,將流程分為三個階段:首先透過視覺語言模型(VLM)作為規劃器,將挑戰性高的長程任務拆解,並引導 VLA 探索以收集編排資料(Explore);接著利用該資料對 VLA 進行模仿學習(Imitate);最後採用殘差離策強化學習(Residual Off-policy RL)進行最終的策略優化(Optimize)。
Results
實驗數據顯示,EXIMO 在各個階段的消融測試中均表現優異。在樣本效率與最終任務達成率上,EXIMO 顯著超越了現有的基準方法,證明了透過 VLM 引導能有效提升 VLA 在新任務上的學習品質。
Significance
此研究克服了機器人學習新技能時的資料獲取瓶頸,並有效解決了大規模基礎模型在物理世界訓練中樣本不足的問題,為開發高效能、能快速適應新環境的自動化機器人系統提供了新技術路徑。