← 最新论文
💻 computer science

SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

本文介绍了 SARM2,一种结合了 SPIRAL 框架的多任务阶段感知奖励模型,该模型通过从自主展开中生成密集且准确的奖励,使机器人操作实现自我改进,从而显著提升视觉-语言-动作(VLA)策略在长程任务中的性能。

原作者: Qianzhong Chen, Hau Zheng, Justin Yu, Suning Huang, Jiankai Sun, Ken Goldberg, Chuan Wen, Pieter Abbeel, Yide Shentu, Philipp Wu, Mac Schwager

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Qianzhong Chen, Hau Zheng, Justin Yu, Suning Huang, Jiankai Sun, Ken Goldberg, Chuan Wen, Pieter Abbeel, Yide Shentu, Philipp Wu, Mac Schwager

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人完成一项复杂的家务,比如折叠一条短裤或擦拭一块白板。这些不仅仅是单一步骤的动作,而是由一系列细小的移动组成的长时间序列。

这篇论文介绍了一种名为 SARM2 的新系统和一个名为 SPIRAL 的学习框架,旨在帮助机器人比以往更快、更好地学习这些任务。以下是其工作原理的简单解释:

问题所在:盲目的机器人

目前,教机器人通常涉及“行为克隆”(Behavior Cloning)。这就像是给机器人看一段人类做任务的视频,然后告诉它:“完全模仿你看到的一切。”

  • 缺陷: 如果机器人在早期犯了一个微小的错误,它就会迷失方向。因为它只是在盲目模仿,所以它不知道自己为什么失败,也不知道如何修复错误。
  • 奖励问题: 要通过“强化学习”来教机器人进行自我改进,你需要一个“计分卡”(奖励模型),在每一个步骤都告诉它做得有多好。
    • 旧的计分卡太模糊(比如只在最后才说“做得好!”)。
    • 其他计分卡又太具体(你必须为每一个全新的任务从头开始构建一个新的计分卡)。

解决方案:SARM2(智能计分卡)

作者构建了一种新型计分卡,称为 SARM2。你可以把它想象成一个通用的机器人任务 GPS。

  1. “动作原语”词典:
    与其试图一次性理解整个复杂的任务,SARM2 将一切分解为微小的、基础的构建模块,称为“原语”(primitives)。

    • 类比: 想象一种语言。你不需要为读过的每一本书都准备一本新词典;你只需要字母表和常用词即可。SARM2 拥有大约 22 种基础动作的词汇量(如“拿起”、“推动”、“旋转”、“夹紧”)。
    • 无论机器人是在折叠一件衬衫还是擦拭一块白板,它都只是以不同的顺序组合这些相同的 22 个基础动作。
  2. “阶段估计器”(GPS):
    SARM2 观察机器人当前正在做什么,并询问:“我们正在做这 22 种基础动作中的哪一个?”

    • 如果机器人当前正在“旋转”一件衬衫,SARM2 就确切知道对于“旋转”而言,什么是“好”的。
    • 如果它切换到“折叠”,SARM2 会立即切换焦点,关注于“折叠”而言什么是“好”的。
  3. “多门控专家”系统:
    这是 SARM2 的大脑。想象一家拥有许多专科医生的医院。

    • 如果病人腿骨折了,你会把他送到骨科医生那里。如果他头痛,你会把他送到神经科医生那里。
    • SARM2 的工作原理也是如此。当它识别出当前的“动作”(例如“抬起”)时,它会为最擅长判断“抬起”动作的特定“专家”AI 打开大门。它不会尝试用一个通用的脑子处理所有事情,而是会在合适的时刻使用合适的专家。

结果: SARM2 为机器人提供了一个非常精确、循序渐进的分数(一种“稠密奖励”),无论任务是什么,都能准确告诉它距离完成任务还有多远。

学习环路:SPIRAL(自我进化的健身房)

一旦机器人拥有了这个完美的计分卡(SARM2),作者就创建了一个名为 SPIRAL 的系统,让机器人可以进行自主练习。

  • 它是如何工作的:

    1. 机器人尝试独立完成任务(一次“试运行”)。
    2. SARM2 观察并对它做的每一个动作进行评分。
    3. 机器人利用这些分数来弄清楚下次该如何做得不同。
    4. 它不断重复这个过程,变得越来越好,而不需要人类在每一秒钟都进行监督。
  • “飞轮效应”:
    通常,机器人需要昂贵的人类演示来学习。SPIRAL 创建了一个“数据飞轮”。机器人生成自己的练习数据,由 SARM2 进行评分,学习,然后生成更好的数据。它形成了一个自我改进的循环。

他们证明了什么?

团队在真实机器人上测试了这两个特定任务:

  1. 折叠短裤: 一项涉及柔软、易变形织物的复杂任务。
  2. 清洁白板: 一项需要一边稳住白板一边擦拭的任务。

结果:

  • 准确度: 在判断进度方面,SARM2 比以往的方法准确率高出 80%。
  • 成功率:
    • 对于折叠短裤,使用该系统的机器人从失败一半的频率提升到了 100% 的成功率。
    • 对于清洁白板,成功率从 50% 提升到了 90%。

简而言之

这篇论文认为,要让机器人真正变得聪明,我们不能仅仅向它们展示视频。我们需要教会它们识别任务中的微小“步骤”,并为每一步提供完美的实时评分。通过将通用的“步骤词典”与专业的“评审团队”相结合,并让机器人在一个自我修正的环路中进行练习,他们创造了一个让机器人能够自主、快速且可靠地学习复杂家务的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →