Problem
目前的機器人抓取技術在處理語言指令時,面臨視覺語言模型(VLM)空間感知能力有限,或端到端訓練需要極高運算資源與資料量的困境,這限制了模型在複雜場景下的表現,也難以擴展至不同的機器人硬體(多樣化機身)。
Method
提出 SeededGrasp 框架,將高階語義推理與低階幾何執行解耦。模型首先利用 VLM 預測一個種子點作為導引條件,再由後續的輕量化抓取生成模型執行精確動作。此外,研究團隊釋出了首個包含超過 250 萬筆抓取資料的多機身桌面抓取資料集,用於模型訓練。
Results
實驗結果顯示 SeededGrasp 顯著優於現有的基準模型,在模擬環境中達到 72% 的成功率,在真實世界的機器手臂測試中更達到 78% 的成功率,證實了該架構在複雜場景下的有效性。
Significance
此研究成功降低了開發語言引導抓取系統的門檻。透過解耦架構,開發者無需進行昂貴的端到端訓練即可讓機器人具備空間意識,且能輕易部署於多種不同的機器手臂平台,為自動化任務提供了更具彈性且高效的解決方案。