想象一个机器人不再仅仅是遵循严格指令的盲目机器,而是能够理解你的话语、看见你所见,并能弄清楚如何移动自身身体以完成任务的、充满好奇心的学习者的世界。这就是**视觉-语言-动作(Vision-Language-Action, VLA)模型激动人心的前沿领域。可以将这些模型视为机器人的“大脑”,它们通过海量的互联网数据进行训练,以理解语言和图像。但问题在于:仅仅知道什么是杯子以及听到“拿起杯子”并不意味着机器人知道如何抓取它而不至于将其撞倒的最佳方式。为了精通物理任务,这些机器人需要练习、犯错并从结果中学习。这就是强化学习(Reinforcement Learning, RL)**发挥作用的地方。你可以将 RL 想象成一个视频游戏训练循环:机器人尝试一个动作,如果成功则获得一个“分数”(奖励),并学习重复好的动作同时避免坏的动作。科学家们正在提出的重大问题是:我们如何构建一个足够快且足够智能的训练系统,让这些机器人能够在不耗费过长时间的情况下学习复杂的技能?
于是有了 RLinf-VLA,这是一个全新的框架,它充当了这些机器人大脑的超高效“训练健身房”。该论文背后的研究人员意识到,虽然我们拥有强大的机器人模型和优秀的训练算法,但“健身房”本身往往是破损的。之前的系统就像是背着沉重的背包跑马拉松;它们既缓慢又笨重,且无法很好地处理不同类型的训练环境。有时机器人的大脑(模型)在等待模拟器(虚拟世界)赶上来,而有时模拟器又在等待大脑,导致昂贵的计算机芯片处于闲置状态。
团队构建了 RLinf-VLA 来解决这个交通堵塞问题。他们创建了一个统一的系统,可以同时接入不同的机器人模拟器、不同的脑架构和不同的学习算法。但真正的魔力在于他们如何管理计算能力。他们引入了一种巧妙的“混合”模式,其作用就像一场编排精妙的舞蹈。他们没有让机器人的大脑和虚拟世界互相等待,而是对过程进行了流水线化处理:当大脑正在思考模拟器某一部分的下一个动作时,模拟器已经在运行另一部分的上一个动作了。这让一切都能全速运转。
这个新系统的结果令人印象深刻。在他们的模拟实验中,该框架使训练速度比以往的方法提高了多达 2.27 倍。当他们对训练好的模型进行测试时,结果非常强劲。使用 RLinf-VLA 训练的单个模型在 LIBERO 基准测试的 130 个不同任务中达到了 98.11% 的成功率,并在 ManiSkill 的 25 个任务中达到了 97.66%。即使是在涉及双手操作的复杂 RoboTwin 任务中,模型的平均成功率也达到了 84.63%。研究人员还在现实世界中测试了一个版本,即使用一个物理机械臂关闭抽屉。虽然成功率与标准模型持平(10 次尝试中成功 8 次),但经过 RL 训练的机器人动作更加平滑高效,避免了未经训练版本那种尴尬、僵硬的动作。
论文指出,这个新框架不仅仅是一个速度提升工具;它是一个基础性的工具,使得在更大规模上训练这些复杂的机器人大脑成为可能。通过标准化这些系统之间的通信方式并优化它们对计算资源的使用,RLinf-VLA 为机器人快速、可靠地学习新的物理技能提供了一条路径,让我们离机器人真正能在日常生活中帮助我们的那一天又近了一步。
技术总结:RLinf-VLA
问题陈述
视觉-语言-动作(VLA)模型的最新进展展示了通过交互增强任务性能的强化学习(RL)潜力。然而,当前该领域的研究面临三个主要挑战:
- 碎片化: 现有的工作缺乏一个统一的平台,难以在多样化的 VLA 架构、RL 算法和模拟器之间进行公平比较。
- 低效性: 由于系统设计未考虑到具身智能设置中特定的资源竞争问题,大规模 RL 训练受到了阻碍。与大语言模型(LLM)不同,VLA 训练涉及模型推理、模拟器渲染和优化之间的紧密耦合,这往往会导致显著的 GPU 空闲时间和流水线气泡(pipeline bubbles)。
- 缺乏标准化: 统一接口的缺失使得提取基于 RL 的 VLA 训练的一般性原则变得困难,因为现有工作依赖于各异的协议和代码库。
方法论
作者提出了 RLinf-VLA,这是一个旨在通过系统级抽象和算法优化来解决上述挑战的统一且高效的框架。
1. 统一系统抽象
RLinf-VLA 提供了一个集成了以下内容的标准化接口:
- 多种模拟器: 支持异构环境,包括 CPU 并行化的环境(如 LIBERO)和 GPU 并行化的环境(如 ManiSkill, RoboTwin)。
- 多样化架构: 容纳各种 VLA 模型(如 OpenVLA, OpenVLA-OFT, π0)和动作表示形式(单步动作 vs. 动作块/action chunks)。
- RL 算法: 支持像 PPO 和 GRPO 这样的在策略(on-policy)算法,并具备对离策(off-policy)方法的扩展性。
2. 灵活的 GPU 分配策略
为了最大化资源利用率,该框架引入了三种执行模式:
- 同位置模式(Collocated Mode): 所有组件(生成、模拟器、训练)共享相同的 GPU。作者修改了标准方法,通过将这些操作限制在 Rollout 阶段的开始和结束,来最小化卸载/加载(offload-onload)开销。
- 解耦模式(Disaggregated Mode): 组件被分配到不同的 GPU 分区。虽然这种方式简单,但由于组件间的依赖关系(例如 GPU 等待数据),通常会导致利用率低下。
- 混合模式(Hybrid Mode,创新点): 该模式结合了前两者的优点。它将生成(Generation)和模拟器(Simulator)分配到不同的 GPU 分区,同时允许训练(Training)利用所有 GPU。至关重要的是,它引入了细粒度流水线(fine-grained pipelining),将模拟器实例划分为子模拟器(S(1),S(2),…)。这使得模拟器和生成组件能够并发运行,在不产生频繁数据卸载开销的情况下,缓解了由顺序依赖引起的“GPU 气泡”。
- 自动放置(Auto-Placement): 一种轻量级算法,根据运行时分析自动确定最优的 GPU 分配和流水线深度(k=1 或 k=2),以最小化 Rollout 时间。
3. 算法设计选择
该框架提炼了用于将 RL 扩展到 VLA 的特定设计选择:
- 多粒度支持: 支持在块(Chunk)、动作(Action)和 Token 级别进行优势(advantage)和对数概率(log-probability)计算。
- PPO 增强:
- 部分重置(Partial Reset): 在任务终止时立即重置子环境,而不是等待固定的回合长度,从而提高样本效率。
- 参数共享评论家(Parameter-Sharing Critic): 在 Actor 的语言模型上附加一个轻量级的价值头(value head),以避免使用独立的评论家网络带来的计算成本。
- 动作级价值估计: 实验证明,对于动作块(action chunks),动作级估计的表现优于块级估计。
- GRPO 增强:
- 有效动作掩码(Valid Action Mask): 屏蔽掉任务完成后发生的时刻,以专注于相关的步骤。
- 轨迹长度归一化: 按有效时间步长对损失进行归一化,以防止较长的轨迹主导梯度。
- 成功率过滤器: 丢弃所有结果完全一致(全成功或全失败)的轨迹组,以确保有效的优势计算。
关键结果
该框架在三个基准测试中进行了评估:LIBERO(130 个任务)、ManiSkill(25 个任务)和 RoboTwin(6 个任务)。
性能提升:
- LIBERO: 一个统一的模型在 130 个任务中实现了 98.11% 的成功率(高于约 42% 的基线)。
- ManiSkill: 一个统一的模型在 25 个任务中实现了 97.66% 的成功率(高于 OpenVLA-OFT 的 ~18% 基线)。
- RoboTwin: 六个特定任务的模型平均成功率为 84.63%(比基础模型提高了 63.75%)。
- RL 训练的模型在分布外(OOD)泛化方面持续优于监督微调(SFT)基线。
系统效率:
- 采用细粒度流水线的混合模式在 ManiSkill 上比解耦基线实现了 1.61×–1.88× 的加速。
- 总的来说,通过优化 Rollout 和训练阶段,RLinf-VLA 比现有框架(如 SimpleVLA-RL)实现了高达 2.27× 的加速。
现实世界迁移:
- 在一个拉抽屉任务上的初步现实世界实验表明,经过 RL 优化的策略比仅使用 SFT 的基线完成任务更高效,尽管主要在模拟器中训练,但表现出了更直接、更流畅的行为。
重要性与主张
作者将 RLinf-VLA 定位为具身智能领域的基石框架。其重要性在于:
- 统一性: 它提供了第一个支持多样化模拟器、模型和算法的统一接口,从而实现了公平的比较和可复现性。
- 高效性: 通过解决具身 RL 特有的资源竞争问题(模拟器 vs. 推理 vs. 训练),它提供了一个可扩展的解决方案,显著缩短了训练时间。
- 最佳实践: 本文提炼了可操作的设计选择(如动作级价值估计、部分重置、有效动作掩码),为未来基于 RL 的 VLA 训练提供了指导。
- 开放性: 作为开源且积极维护的平台,它旨在加速并标准化该领域的研究。
文章得出结论,虽然基于模拟的 RL 在现实世界部署方面展现出前景,但其主要贡献是建立了一个稳健、高效且可扩展的基础设施,这对于通过强化学习提升 VLA 能力至关重要。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。