Problem
傳統機器人世界模型難以將底層物理動作與大量影片中的視覺先驗知識有效對齊。如何建立一個既能理解複雜視覺互動,又能精確執行物理操控的介面,是目前通用機器人學習的主要挑戰。
Method
研究團隊引入「遮罩視覺動作(MVA)」,這是一種像素空間的控制介面,將動作表達為影片中實體的部分顯露軌跡。透過揭露機器人運動來預測環境反應(前向動力學),或揭露物體預期運動來推導機器人行為(逆向建模),並僅需 15 小時的標記資料進行微調。
Results
單一模型在多種場景與不同機器人形態下,展現出極高的視覺逼真度與可控性。在操作任務中,該模型生成的模擬結果能有效評估策略表現,並透過篩選候選路徑來優化模型預測規劃(MPC),成功從物體目標運動合成出對應的機器人動作。
Significance
此研究證明了動作與視覺空間的高度對齊,能讓模型更有效地吸收影片中的豐富動態知識。這大幅降低了開發高性能機器人世界模型的門檻,為跨任務、跨機體的通用型基礎模型提供了更具擴展性的路徑。