← 最新论文
💻 computer science

DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization

本文介绍了 DyGRO-VLA,这是一个两阶段优化框架,通过捕捉跨任务潜在表示并利用混合强化学习残差动态细化策略优化,从而增强视觉 - 语言 - 动作模型在不同任务间的泛化能力,进而减轻干扰并提升在分布偏移下的性能。

原作者: Sixu Lin, Yunpeng Qing, Litao Liu, Ming Zhou, Ruixing Jin, Xiaoyi Fan, Guiliang Liu

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Sixu Lin, Yunpeng Qing, Litao Liu, Ming Zhou, Ruixing Jin, Xiaoyi Fan, Guiliang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人成为“全能大师”。你希望它能够烹饪、清洁、修理漏水的水龙头,并搭建一个架子,所有这些都使用同一个“大脑”。这正是VLA(视觉 - 语言 - 动作)模型的目标:让机器人能够看见、理解语言,并移动手臂去执行任务。

然而,存在一个巨大的问题。当研究人员尝试使用强化学习(RL)——一种机器人通过试错学习、成功时获得“奖励”的方法——来提升这些机器人的性能时,他们常常陷入一个悖论。

问题所在:“专家”陷阱

将机器人的大脑想象成一个知识库。当你最初训练它时,它学习的是通用规则(例如“抓取物体”)。但当你开始使用强化学习来教它执行特定任务(例如“堆叠红色积木”)时,机器人会变得如此专注于这一项工作,以至于开始重写它自己的知识库。

这就像一名学生为了数学考试如此刻苦学习,以至于忘记了如何阅读。论文将这种现象称为**“灾难性遗忘”**。

  • 旧方法: 如果你让机器人在 10 个不同的任务上进行训练,它会在其中一项任务上表现出色,却忘记了其他九项。你添加的任务越多,它的整体表现反而越差。这就像试图同时抛接 20 个球;最终,你会因为大脑试图同时成为太多领域的专家而把所有球都弄丢。

解决方案:DyGRO-VLA

作者提出了一种名为DyGRO-VLA的新方法。要理解其工作原理,可以想象一位主厨在经营一家繁忙的厨房。

第一阶段:“主厨”(离线预训练)

首先,机器人从一个展示人类执行各种任务的庞大视频库中学习。

  • 技巧: 机器人并非简单地死记硬背每一个视频,而是学会过滤掉“噪声”。它忽略那些对动作无关紧要的内容(如墙壁的颜色或灯光),只关注关键信息(杯子在哪里、它有多重)。
  • 类比: 这就像主厨学习烹饪的基础。无论制作披萨还是汤,他们都明白“热量会融化奶酪”以及“刀具用于切割”。这建立了一个适用于所有任务的共享基础

第二阶段:“专家团队”(在线微调)

现在,机器人需要在现实世界中更好地完成特定任务。DyGRO-VLA 不会重写主厨的大脑,而是添加一个由专业助手组成的团队(称为“残差专家”)。

  • 工作原理: 主厨(基础模型)对如何操作做出初步判断。然后,一个“路由器”(像行政总厨一样)观察当前任务并询问:“谁最适合处理这项具体工作?”
    • 如果任务是“堆叠碗”,路由器就会呼叫“堆叠助手”。
    • 如果任务是“钉钉子”,路由器就会呼叫“钉钉子助手”。
  • 神奇之处: 这些助手仅对主厨的计划进行微小的修正(残差)。它们不会重写整本书,只是添加一张便签,写着“将手向左移动 2 英寸”。
  • 为何有效: 因为主厨的大脑基本保持原样,机器人就不会忘记如何执行其他任务。“堆叠助手”不会干扰“钉钉子助手”。它们协同工作,互不越界。

结果

研究人员在两个主要的机器人挑战中测试了这种方法:

  1. LIBERO: 一个包含 130 种不同任务(如移动物体、堆叠和长序列动作)的数字测试套件。
  2. RoboTwin2: 一个使用双臂机器人的现实世界测试。

结果如下:

  • 优于其他方法: DyGRO-VLA 击败了所有其他顶级方法。在最困难的任务(长序列动作)上,它将成功率提高了近 10%。
  • 现实世界成功: 当他们将机器人从计算机模拟转移到真实的物理机器人上时,其表现依然优于竞争对手,成功完成了诸如拿起瓶子和堆叠碗等任务。

总结

简而言之,以往的方法试图将机器人变成针对每一项任务的“超级专家”,这导致它遗忘了其他所有技能。DyGRO-VLA 将机器人保持为“通才”(即主厨),仅在需要时动态聘请一支专家团队提供帮助。这样,机器人在提升所有任务表现的同时,不会遗忘任何已有的技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →