想象一下,你正在试图教一个机械臂做家务。在过去,如果你想让机器人学会倒咖啡,你就得为“咖啡”进行训练。然后,如果你想让它学会开抽屉,你必须擦掉它的记忆,并为“抽屉”开启一个全新的训练阶段。这就像是为每一项不同的工作都聘请了一位不同的专家。
这篇论文介绍了一种新的机器人训练方式,它更快、更聪明、也更通用。它主要做了两件事:构建了一个大规模、高速的训练“健身房”,并发明了一种新的教学方法,利用人类的“演示”作为引导,但又不会强迫机器人只是盲目地模仿我们。
以下是使用简单类比对他们方法的拆解:
1. 问题所在:“一次只能做一个任务”的瓶颈
把目前的机器人训练想象成一条单车道公路。你一次只能发送一辆车(一个正在学习一项任务的机器人)。尽管我们拥有强大的计算机(GPU),能够处理数千辆车,但我们却被迫一次只能发送一辆。这既缓慢又低效。
2. 解决方案第一部分:MT-Libero(“超级健身房”)
作者构建了 MT-Libero,这就像是将那条单车道公路变成了宽阔的多车道超级高速公路。
- 类比: 想象一个巨大的健身房,里面有 40 种不同类型的机器人在同一个房间里同时进行训练。他们并没有建造 40 个独立的健身房,而是建造了一个巨大的共享健身房,每个机器人都有自己的工位,但它们共享相同的设备、相同的教练和相同的进度表。
- 运作方式: 他们采用了标准的机器人任务集(如堆叠积木、打开抽屉或移动物体),并通过程序控制计算机在单个显卡上同时运行所有这些任务。
- 结果: 他们可以同时在 40 个不同的任务上训练机器人,速度比以前快 1,600 倍,且仅占用极小部分的计算机内存。这就像是在训练一个了解各种事物的“通才”机器人,而不是只精通一件事的“专才”机器人。
3. 解决方案第二部分:DGPO(“聪明的导师”)
同时在 40 个任务上训练机器人是很困难的,因为有些任务很简单(比如拿起一个轻巧的积木),而有些则很难(比如打开一个很紧的抽屉)。如果机器人变得擅长简单的任务,它可能会停止尝试学习困难的任务。此外,有时机器人会陷入困境,不知道该做什么。
这就是 DGPO 发挥作用的地方。把它想象成一位观察人类专家执行任务的 “聪明导师”。
- 旧方法: 有些方法只是简单地说:“完全模仿人类。”如果人类犯了错,机器人也会模仿这个错误。其他方法则说:“忽略人类,靠你自己去摸索吧,”但这需要耗费极长的时间。
- DGPO 的方式: 导师会说:“我会观察人类的操作来帮你入门,但我会让你自己去摸索剩下的部分。”
- 当机器人遇到困难时: 导师会凑近观察并说:“嘿,看看人类在这里是怎么做的。就这样做。”(这被称为 自适应行为克隆/Adaptive Behavior Cloning)。
- 当机器人表现良好时: 导师会退后一步并说:“做得好!现在试着靠你自己改进。”(这是标准的 强化学习/Reinforcement Learning 部分)。
- “公平”规则: 导师还会记录积分榜。如果机器人在“困难”任务上表现不佳,但在“简单”任务上表现出色,导师会强制机器人把更多时间花在练习困难任务上。这确保了机器人能掌握所有技能,而不仅仅是擅长简单的东西。
4. 结果:一个“类 VLA”机器人
论文在多种任务(目标类、物体类、空间类和长程任务)上测试了这个系统。
- 成果: 使用 MT-Libero 和 DGPO 训练的机器人成为了一个真正的“通才”。它在单次训练过程中就学会了所有 40 个任务。
- 对比: 它的表现优于没有人类帮助的机器人(那些机器人训练速度慢)以及仅仅通过模仿人类进行训练的机器人(那些机器人过于僵化,无法自我改进)。
- 现实世界检验: 他们甚至将这个在计算机模拟中训练好的机器人应用到了真实房间里的真实机械臂上。效果出奇地好,这表明在“超级健身房”中学到的技能可以迁移到现实世界中。
总结
简而言之,这篇论文指出:
- 不要一个接一个地训练机器人。 要建立一个共享的高速环境,让它们一起学习许多任务(MT-Libero)。
- 不要只是模仿人类;要向他们学习。 将人类演示作为一种灵活的引导,在机器人遇到困难时提供帮助,但在准备好时让机器人能够自主改进(DGPO)。
其结果是,这种机器人学习速度更快,能处理更多样化的工作,并且能在不需要为每项新家务重新从头开始训练的情况下,更好地应对困难任务。
技术摘要:基于演示引导策略优化的 GPU 并行多任务强化学习
问题陈述
虽然大规模 GPU 并行的强化学习(RL)已将机器人仿真转变为高吞吐量的训练基座,但目前的系统主要优化的是“专家型”策略——即一次一个目标、一个策略、一次训练运行。这种方法无法利用单个策略获取广泛结构化操控技能的潜力。向多任务强化学习(MTRL)的转型在引入了除了样本收集之外的新算法挑战,特别是在价值稳定性、任务不平衡以及有效利用先验演示数据方面。此外,现有的基准测试(如 LIBERO)虽然具有丰富的结构化任务变化(物体、空间、目标和长程任务),但最初是为基于 CPU 的模仿学习设计的,缺乏训练单个通用策略所需的异构、GPU 并行执行基座。
方法论
本文提出了一个两部分的解决方案:一个基准构建方法(MT-Libero)和一个新型优化算法(DGPO)。
1. MT-Libero:一种 GPU 并行的基准构建方法
MT-Libero 是使用 Isaac Lab 和 LIBERO 资产实现的一种可扩展构建方法的实例化。它通过以下方式解决了结构化任务定义与 GPU 并行执行之间的差距:
- 分离语义与执行: 将任务描述符、可重用资产(转换为 USD)、重置规则、成功谓词和奖励接口编译进一个单一的向量化训练循环中。
- 异构并行性: MT-Libero 不是为每个任务启动独立的模拟器,而是在一个向量化环境中执行异构任务组(目标、物体、空间、长程任务)。这允许共享的模拟器、渲染器、展开缓冲区(rollout buffer)和策略更新栈同时处理 40 个不同的任务。
- 输入灵活性: 该框架支持状态输入策略(使用任务嵌入和本体感知数据)以及视觉输入策略(使用用于第三人称和腕部摄像头的冻结 ViT 编码器)。
- 课程学习与随机化: 它结合了物理随机化和夹持器课程学习,最初遵循演示指令,随后过渡到学习控制。
2. DGPO:演示引导的策略优化
为了解决稀疏成功信号和有限先验数据的问题,作者引入了 DGPO,这是一种结合了自适应行为克隆的 PPO 在线方法。与将演示视为固定模仿目标或离线回放数据的算法不同,DGSO 将其作为任务感知的引导,同时保留在线改进的能力。
- 重要性加权 PPO (IW-PPO): 为了管理任务不平衡,DGPO 根据每个任务的成功率重新分配 PPO 梯度预算。它使用成功率的指数移动平均(EMA)来分配权重 (wt)。表现低于多任务平均水平的任务会获得更高的权重,而较简单的任务则获得较低的权重。这避免了基于损失函数的加权(如 FAMO)可能存在的缺陷,因为后者容易受到奖励规模或在在线 RL 中评论家(critic)拟合程度的影响。
- 自适应行为克隆 (ABC): DGPO 在 Actor 端增加了一个正则化项,惩罚偏离当前展开状态 (ot) 对应的匹配演示动作 (at⋆) 的行为。至关重要的是,这种模仿强度 (βk) 是自适应的:
- 它由任务当前的成功率 (τk) 决定。
- “弱”学生(低成功率)接受更强的演示压力 (β≈βmax)。
- “精通”任务(高成功率)接受极小的压力 (β≈βmin)。
- 这使得策略能够在有益之处利用演示进行专业化,同时随着能力的增长通过在线 RL 继续优化。
- 统一目标函数: 总损失结合了加权 PP 目标(策略、价值和熵)与自适应 BC 项,确保策略保持在策略内(on-policy)的同时受到演示的引导。
核心贡献
- MT-Libero 基准: 作者提出并实例化了一种用于结构化多任务机器人 RL 的 GPU 并行构建方法。它能够在单个循环中针对异构任务集(40 个任务)训练通用策略,支持状态和视觉输入、多样化的奖励以及课程学习。
- DGPO 算法: 他们引入了一种演示引导的 PPO 方法,该方法将跨任务重要性加权与自适应行为克隆相结合。这种方法允许先验数据引导专业化,同时不牺牲在线学习的稳定性及在线改进的优势。
- 实验验证: 论文证明 DGPO 在状态输入和视觉输入设置下,均优于无先验 RL 以及现有的基于演示的基准方法(包括 MT-RLPD、MT-RFCL、MT-DAPG 和 MT-DeepMimic),实现了更高的平均成功率和更好的任务分布覆盖率。
实验结果
实验评估了构建方案、DGPO 的有效性以及演示压力的权衡。
- 基准性能: 在单块 L20 GPU 上使用 1,600 个并行环境时,MT-Libero 达到了 3,825 步/秒 (SPS),显著超过了 MuJoCo CPU 基准(2,274 SPS),同时使用的显存更少(8.2 GB VRAM 对比 2.3 TB RAM)。端到端 PPO 训练在 8 个 GPU 上可扩展至约 26,800 SPS。
- 方法对比:
- 状态输入: DGPO 在所有套件中实现了 85.2% 的平均成功率,显著优于次优基准(MT-PPO 为 42.5%)。这种优势在“长程”(long-horizon)套件中尤为明显(59.1% 对比 19.8%)。
- 视觉输入: DGPO 实现了 69.8% 的平均成功率,同样优于所有基准。值得注意的是,由于内存限制,离策(off-policy)基准(MT-RLPD、MT-RFCL)在相同的视觉设置下未能收敛。
- 消融实验:
- 移除 IW-PPO 会显著降低困难“尾部”任务的表现(第 20 百分位成功率从 4.3% 下降到 1.9%),证实了其在平衡梯度分配方面的作用。
- 移除 Adaptive BC 会导致学习发生灾难性崩溃(平均成功率降至 5.1%),凸显了演示引导对于初始收敛的必要性。
- 泛化能力: 与专业化程度较低的策略相比,DGPO 在演示范围内的泛化能力表现出轻微的权衡,但这被其在名义任务成功率上的收益所抵消。
意义与主张
论文声称,当使用所提出的基础设施和算法进行带有人类演示的训练时,紧凑型 RL 策略已经可以达到类 VLA(视觉-语言-动作)的多任务广度。
- 基础设施: 这项工作证明了结构化操控分布可以被编译成异构 GPU 并行基座,从而超越了孤立的任务运行,转向联合多任务学习。
- 算法效率: DGPO 证明了演示不仅可以作为固定的目标或离线数据,还可以作为有效的、任务相关的自适应引导,从而保留了在线学习的稳定性。
- 未来展望: 作者指出,相同的训练接口(MT-Libero + DGPO)可以扩展到更大的模型,特别是用于 VLA+RL 的后训练(post-training),利用该基准获取大规模交互数据,并利用 GPU 并行基础设施进行高效的多任务微调。
论文对局限性保持了适度的审慎,承认 MT-Libero 目前仅限于具有固定形态的模拟桌面操控,且接触密集型任务的 sim2sim 迁移仍不完美。然而,它为可扩展的通用机器人学习奠定了基础性的步骤。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。