JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models
JoyNexus 是一个用于后训练视觉-语言-动作(VLA)模型的统一多租户服务,它通过解耦训练、推理和环境组件,来实现高效的资源共享、跨租户调度和组批处理,从而与传统的隔离式单租户执行相比,降低了总计 GPU 时间并提高了利用率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人可以像人类一样学习的世界:看到一个凌乱的房间,理解“收拾干净”这一指令,然后弄明白如何捡起玩具。这就是视觉-语言-动作(VLA)模型这一令人兴奋的领域。可以将这些模型想象成机器人的大脑,它结合了眼睛(视觉)、声音(语言)和肌肉(动作)。为了让机器人真正能够做一些有用的事情,科学家必须对其进行“后训练”(post-train)。这就像是带一个拥有通用知识的聪明学生去学习特定的技能,比如系鞋带或打开罐子。
然而,教导这些机器人大脑是非常昂贵且复杂的。目前,如果研究人员想要训练一个机器人,他们通常需要租用一台属于自己的、极其昂贵的大型计算机(GPU)。这就像是为了做几次俯卧撑而租下一整个私人健身房;当你加载重量或休息时,机器就在那里闲置着,而你仍然要支付整整一小时的费用。这种“一个机器人,一个健身房”的方法既浪费又让许多人难以同时进行机器人学习实验。
于是,来自 JD AI Infra 以及多所大学的研究人员提出了一个新想法:JoyNexus。他们提出了一个机器人的“共享健身房”。与其租用一整台计算机,不如让多位研究人员安全且高效地共享同一台强大的机器。该论文介绍了一个系统,它就像一位超级聪明的教练,让许多不同的团队可以在互不干扰的情况下同时训练他们的机器人。通过巧妙地组织工作,Joy besides JoyNexus 表明,我们可以降低训练这些机器人所需的总时间和能量,让先进的机器人学习对每个人都变得更快、更便宜。
机器人大脑的“共享健身房”
那么,JoyNexus 究竟是如何工作的呢?想象一个繁忙的高科技健身房。在旧的方法中,如果你想锻炼,你会租下一个包含跑步机、哑铃和镜子的整个房间,并且只有你被允许进入。如果你停下来喝水或看手机,房间就会空置,但你仍需支付全额费用。
JoyNexus 改变了规则。它将健身房变成了一个繁忙的共享空间,拥有三个主要区域:
- 大脑区(训练模型服务): 这是重体力活发生的地方。机器人的“大脑”(理解图像和文字的复杂核心部分)被保存在一个中央共享的位置。它就像一个巨大的、昂贵的跑步机,每个人都可以使用。
- 肌肉区(动作模块): 每个机器人都有自己独特的“肌肉”或特定技能(比如抓取器的夹爪或汽车的轮子)。在 JoyNexus 中,这些特定部分是为每个团队单独保留的。你带着自己独特的配重来到共享的跑步机旁。
- 障碍赛道(环境服务): 这是机器人练习的模拟器。它可以是一个虚拟厨房、工厂车间或客厅。
JoyNexus 的魔力在于它如何管理流量。它使用一个“主服务”(Master Service,就像一位组织极其严密的健身房经理)来决定谁在什么时候使用跑步机。如果 A 团队正在等待他们的机器人完成模拟,而 B 团队已经准备好进行数学更新,经理会立即切换他们,这样跑步机就永远不会停下来。
“组批处理”的小技巧
其中一个最酷的特性是作者称之为**组批处理(group batching)**的功能。想象你在一家咖啡店。如果一个人点了一杯拿铁,咖啡师必须启动机器、研磨豆子并蒸奶,仅仅为了这一杯。如果十个人同时点了拿铁,咖啡师可以为所有人研磨足够的豆子并蒸一大壶奶,这使得每杯咖啡的处理速度大大加快。
JoyNexus 对机器人训练也做了同样的事情。通常,不同的团队会向共享的“大脑”(VLA 模型)发送小的请求。如果系统逐个处理这些请求,计算机就会在启动和停止之间浪费时间。相反,JoyNexus 会等待极短的一瞬间,看看是否有其他团队也有请求。如果有,它会将它们组合在一起。它会为所有人运行一次“共享大脑”的部分,然后将结果拆分回每个团队,以完成他们各自的“肌肉”训练。
论文显示,当许多团队发送小批量数据时,这种方法效果非常好。在他们的模拟中,当他们将 8 个不同团队的请求分组时,共享部分的“前向传播”(即大脑观察数据的过程)的速度显著提高了。对于某些模型,这使得共享部分的训练速度比逐一处理快了 2.21 倍。
他们的发现(以及没能发现的)
研究人员通过模拟一个场景来测试 JoyNexus,该场景涉及四个不同的团队:三个团队在虚拟环境(如 LIBERO 或 ManiSkill 模拟器)中训练机器人执行任务,还有一个团队仅使用静态数据集进行练习(监督微调)。
他们将这种“共享健身房”方法与旧有的“私人健身房”方法(即每个团队先后运行各自的任务)进行了对比。结果非常令人振奋:
- 更少浪费: 通过重叠工作,JoyNexus 将总的“GPU 时间”(昂贵计算机运行的时间)减少了 28.3%。
- 更高效率: 在多租户设置下,共享计算机的忙碌时间为 41.3%,而在隔离设置下仅为 20.8%。这几乎是效率翻倍!
- 没有混乱: 至关重要的是,系统保持了安全性。尽管团队共享了那个“大脑袋”,但他们的特定“肌肉”、数据和进度是完全隔离的。论文表明,每个团队的学习曲线(机器人进步的速度)与他们单独训练时完全一致。
需要注意的是,这些结果来自于模拟和工作负载测试,而非来自成千上万台机器人的真实世界部署。作者指出,这种方法可能会节省资金和时间,但他们尚未证明它能在每一种可能的现实场景中都完美运作。他们还指出,虽然该系统擅长共享资源,但目前它依赖于用户遵守关于如何格式化数据的特定规则。如果一个团队想要使用一种完全奇特、不符合标准“健身房”规则的自定义机器人设计,那么融入其中可能会更加困难。
机器人训练的未来
论文总结道,JoyNexus 是迈向让机器人学习变得触手可及的重要一步。研究人员不再需要花费一百万美元来租用一台私人的超级计算机,而是可以只为他们实际使用的时长付费,与其他人在成本上进行分摊。
然而,作者也是现实的。他们承认,要让这在现实世界中发挥作用,我们需要更好的安全机制(防止一个团队意外破坏另一个团队的机器人)、定价机制(如何为共享时间收费)以及灵活性(让用户自带各种奇特的模拟器)。他们建议,未来的系统可以变得更加聪明,根据健身房的繁忙程度自动调整资源。
简而言之,JoyNexus 表明,机器人训练的未来不在于为每位研究人员建造一座庞大且孤立的堡垒,而在于建立一个繁荣、高效的社区中心——在那里,大家可以共同学习,共享昂贵的设备,让他们的机器人比以往任何时候都更快地动起来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。