Problem

機器人視、語、動(VLA)模型的後訓練(如 SFT 或強化學習)受限於模擬器與機器人硬體的多樣性。傳統雲端服務採用獨佔式 GPU 分配模式,導致短期或突發性的工作負載成本極高,且用戶必須負擔繁雜的基礎架構配置與維護成本。

Method

提出 JoyNexus 統一服務架構,將訓練、推論與環境服務解耦並透過 API 存取。系統在共享的基座模型中為各租戶保留獨立插槽,並導入「群組批次處理(Group Batching)」技術,讓不同格式的 VLA 資料能共享骨幹網路運算。所有工作負載透過全域佇列進行排程,確保多租戶環境下的資料隔離與資源最佳化。

Results

在工作負載模擬與真實具身智慧場景測試中,JoyNexus 展現出優異的效能。相較於單租戶獨立執行的傳統模式,此架構顯著降低了總體 GPU 耗時,並透過跨租戶的資源排程大幅提升了硬體服務的利用率。

Significance

本研究為大規模機器人學習提供了高擴展性的基礎設施方案。透過服務化與資源共享,JoyNexus 不僅降低了開發者調校 VLA 模型的技術與財務門檻,也為未來具身智慧的大規模協作與部署奠定了高效的算力支撐基礎。