想象一下,你正在尝试教一个机器人成为“全能大师”。你希望它能够烹饪、清洁、修理漏水的水龙头,并搭建一个架子,所有这些都使用同一个“大脑”。这正是VLA(视觉 - 语言 - 动作)模型的目标:让机器人能够看见、理解语言,并移动手臂去执行任务。
然而,存在一个巨大的问题。当研究人员尝试使用强化学习(RL)——一种机器人通过试错学习、成功时获得“奖励”的方法——来提升这些机器人的性能时,他们常常陷入一个悖论。
问题所在:“专家”陷阱
将机器人的大脑想象成一个知识库。当你最初训练它时,它学习的是通用规则(例如“抓取物体”)。但当你开始使用强化学习来教它执行特定任务(例如“堆叠红色积木”)时,机器人会变得如此专注于这一项工作,以至于开始重写它自己的知识库。
这就像一名学生为了数学考试如此刻苦学习,以至于忘记了如何阅读。论文将这种现象称为**“灾难性遗忘”**。
- 旧方法: 如果你让机器人在 10 个不同的任务上进行训练,它会在其中一项任务上表现出色,却忘记了其他九项。你添加的任务越多,它的整体表现反而越差。这就像试图同时抛接 20 个球;最终,你会因为大脑试图同时成为太多领域的专家而把所有球都弄丢。
解决方案:DyGRO-VLA
作者提出了一种名为DyGRO-VLA的新方法。要理解其工作原理,可以想象一位主厨在经营一家繁忙的厨房。
第一阶段:“主厨”(离线预训练)
首先,机器人从一个展示人类执行各种任务的庞大视频库中学习。
- 技巧: 机器人并非简单地死记硬背每一个视频,而是学会过滤掉“噪声”。它忽略那些对动作无关紧要的内容(如墙壁的颜色或灯光),只关注关键信息(杯子在哪里、它有多重)。
- 类比: 这就像主厨学习烹饪的基础。无论制作披萨还是汤,他们都明白“热量会融化奶酪”以及“刀具用于切割”。这建立了一个适用于所有任务的共享基础。
第二阶段:“专家团队”(在线微调)
现在,机器人需要在现实世界中更好地完成特定任务。DyGRO-VLA 不会重写主厨的大脑,而是添加一个由专业助手组成的团队(称为“残差专家”)。
- 工作原理: 主厨(基础模型)对如何操作做出初步判断。然后,一个“路由器”(像行政总厨一样)观察当前任务并询问:“谁最适合处理这项具体工作?”
- 如果任务是“堆叠碗”,路由器就会呼叫“堆叠助手”。
- 如果任务是“钉钉子”,路由器就会呼叫“钉钉子助手”。
- 神奇之处: 这些助手仅对主厨的计划进行微小的修正(残差)。它们不会重写整本书,只是添加一张便签,写着“将手向左移动 2 英寸”。
- 为何有效: 因为主厨的大脑基本保持原样,机器人就不会忘记如何执行其他任务。“堆叠助手”不会干扰“钉钉子助手”。它们协同工作,互不越界。
结果
研究人员在两个主要的机器人挑战中测试了这种方法:
- LIBERO: 一个包含 130 种不同任务(如移动物体、堆叠和长序列动作)的数字测试套件。
- RoboTwin2: 一个使用双臂机器人的现实世界测试。
结果如下:
- 优于其他方法: DyGRO-VLA 击败了所有其他顶级方法。在最困难的任务(长序列动作)上,它将成功率提高了近 10%。
- 现实世界成功: 当他们将机器人从计算机模拟转移到真实的物理机器人上时,其表现依然优于竞争对手,成功完成了诸如拿起瓶子和堆叠碗等任务。
总结
简而言之,以往的方法试图将机器人变成针对每一项任务的“超级专家”,这导致它遗忘了其他所有技能。DyGRO-VLA 将机器人保持为“通才”(即主厨),仅在需要时动态聘请一支专家团队提供帮助。这样,机器人在提升所有任务表现的同时,不会遗忘任何已有的技能。
技术摘要:DyGRO-VLA
1. 问题陈述
本文针对通用机器人操作视觉 - 语言 - 动作(VLA)模型训练中的关键可扩展性瓶颈。尽管强化学习(RL)的最新进展提高了单个任务的控制精度和成功率,但在多任务设置中应用 RL 进行后训练往往会导致灾难性遗忘和跨任务干扰。
在 LIBERO 基准上的实证分析表明,随着任务数量的增加,标准 RL 优化器(例如 Soft Actor-Critic)的性能会下降。具体而言:
- 表征扭曲:单任务 RL 微调会扭曲预训练期间学到的共享特征空间,隔离特定任务的体验,并降低与其他任务的对齐度。
- 性能下降:针对特定任务优化的模型往往在不相关任务上遭受显著的性能下降,且随着任务数量的增加,多任务 RL 训练变得愈发不稳定。
- 权衡困境:在特定任务上实现高灵巧性与维持通用机器人所需的跨任务泛化能力之间,存在根本性的冲突。
2. 方法论:DyGRO-VLA
为了解决灵巧性与泛化性之间的权衡,作者提出了DyGRO-VLA(动态分组残差优化),这是一个两阶段优化框架。
阶段 1:基于信息瓶颈(IB)的离线预训练
第一阶段侧重于从离线演示中学习鲁棒的共享跨任务潜在表征 p(z∣o)。
- 架构:利用 VLM 骨干网络(DINOv2、SigLIP、Qwen2.5-0.5B)对视觉观测和语言指令进行编码,并与本体感知数据融合。
- 目标:模型使用**变分信息瓶颈(VIB)**目标进行训练。其目标是最大化潜在表征 Z 与动作 A 之间的互信息(I(Z;A)),同时最小化观测 O 与 Z 之间的互信息(I(O;Z))。
- 机制:这迫使编码器仅保留任务相关信息(例如物体几何形状、空间关系),同时丢弃无关因素(例如背景杂乱、光照),从而创建一个适合泛化的紧凑潜在空间。
- 损失函数:推导了一个变分下界以使 IB 目标可处理,其中涉及一个神经评论家 Tψ 来估计互信息项。
阶段 2:通过 RL 残差混合(MoRR)进行在线微调
第二阶段优化策略以实现多任务性能,同时不破坏第一阶段学到的共享表征。
- 残差学习:RL 优化器不直接更新基础策略,而是预测一个残差(Δa)来细化基础动作块(abase)。这在允许特定任务修正的同时,保留了预训练的先验知识。
- 动态路由(MoE):为了处理多个任务,该框架采用具有 N 个残差专家的混合专家(MoE)架构。
- 任务嵌入:一个对比学习目标(LCL)学习任务嵌入(z~T),这些嵌入编码任务识别模式,与决策相关的潜在变量 z 区分开来。
- 路由器:门控网络以任务嵌入为条件,动态选择并加权给定任务的前 m 个专家。
- 训练目标:总损失结合了:
- RL 损失(LRL):增强策略的标准演员 - 评论家损失。
- 对比损失(LCL):确保任务嵌入具有路由所需的判别性。
- 负载均衡(LLB):基于熵的正则化项,以防止专家坍塌并确保 MoE 的均衡利用。
- 难度感知采样:训练过程偏向于采样未充分解决的任务,以将学习重点放在具有挑战性的场景上。
3. 主要贡献
- RL 局限性的分析:本文提供了实证证据,证明标准 RL 后训练会导致多任务 VLA 设置中的灾难性遗忘和表征扭曲,突显了跨任务特征保留的必要性。
- DyGRO-VLA 框架:引入了一种新颖的两阶段框架,将信息瓶颈预训练与用于在线微调的动态 RL 残差混合相结合。
- 动态分组优化:设计了一种路由机制,根据任务嵌入动态组合专门的 RL 专家,有效缓解了不同任务之间的梯度冲突。
- 全面验证:在 LIBERO(130 个任务)、RoboTwin2(双臂)以及真实世界的 Sim2Real 迁移中进行了广泛评估,证明了其相对于最先进基线的持续改进。
4. 实验结果
作者在 LIBERO 和 RoboTwin2 基准上评估了 DyGRO-VLA,将其与包括 Octo、OpenVLA、π0 以及各种 RL 微调方法在内的强基线进行了比较。
- LIBERO 基准:
- DyGRO-VLA 在所有套件中实现了 97.1% 的平均成功率,比离线基础模型高出 +4.4%。
- 在具有挑战性的 LIBERO-Long 套件中观察到显著改进,成功率从 85.2% 提升至 95.0%(绝对增益 +9.8%)。
- 它优于其他基于 RL 的基线(例如 TGRPO、VLA-RL、RIPT-VLA),后者在多任务协同训练中表现挣扎。
- 梯度冲突分析:梯度余弦相似度的可视化显示,虽然标准 MLP 残差在任务组之间表现出强烈的负相关(冲突),但 DyGRO-VLA 的 MoRR 显著减少了这些冲突,同时保持了组内协同。
- 消融研究:
- 移除 IB 目标或对比学习目标会导致性能下降,证实了共享表征学习和判别性路由的必要性。
- 增加专家数量(从 1 到 8) consistently 提高了性能,其中 8 个专家产生了最佳结果。
- 真实世界(RoboTwin2):
- 在 Sim2Real 迁移中,DyGRO-VLA 取得了最佳的总体仿真成功率(79.2%),并在真实世界试验中超越了 RFT 基线,特别是在复杂的双臂和长视野任务上。
5. 意义与主张
本文声称 DyGRO-VLA 为高效的多任务强化微调提供了一种可扩展且鲁棒的解决方案。其主要意义在于:
- 保持泛化性:通过残差学习将共享表征的学习与特定任务的细化解耦,防止了通常困扰多任务 VLA 训练的 RL 优化器“过拟合”。
- 弥合差距:它成功弥合了高性能单任务控制与通用机器人所需泛化能力之间的差距。
- 实际适用性:该方法证明,复杂的多任务 RL 策略可以有效地迁移到真实世界的机器人系统中,而不会发生灾难性遗忘。
作者承认了局限性,包括在线训练期间对奖励稀疏性的敏感性、对路由所需已知任务身份的依赖,以及需要在多样化实体上进行更广泛的真实世界评估。然而,他们将 DyGRO-VLA 定位为迈向通用机器人系统的基础步骤,该系统能够利用统一模型处理多样化的真实世界任务。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。