← 最新论文
💻 computer science

SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation

本文提出了 SARM,这是一种基于视频的、阶段感知的奖励建模框架,它利用自然语言标注为 T 恤折叠等长视野、高接触任务生成一致的监督信号,并通过一种新颖的奖励对齐行为克隆(RA-BC)方法显著增强了下游策略训练。

原作者: Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人折叠 T 恤。这不仅仅是一个简单的“拿起放下”的任务;它是一场漫长而复杂的舞蹈,涉及抓取、抚平褶皱、折叠袖子,并将衣服塞进角落。如果 T 恤是皱成一团的,难度会更大。

这篇论文的作者们面临的问题是:教机器人就像通过视频教孩子,但其中一些视频质量很差。

问题:糟糕的视频与混乱的计时器

过去,为了教机器人,研究人员收集了人类执行该任务数小时的视频。他们会告诉机器人:“完全按照视频中看到的那样做。”这被称为模仿学习。

然而,存在两个大问题:

  1. 视频杂乱无章:有些人类演示是完美的。而另一些则笨拙、耗时过长,甚至中途失败。如果你平等地利用所有视频来训练机器人,它就会感到困惑。它会将坏习惯与好习惯一并习得。
  2. “计时器”陷阱:为了训练机器人,研究人员过去常说:“在第 10 秒,你应该在这里;在第 20 秒,你应该在那里。”但人类并不按严格的计时器工作。一个人可能用 5 秒抚平 T 恤;另一个人可能花 20 秒。如果你只是计算秒数,机器人会得到一张混乱的地图。它可能仅仅因为过了 10 秒,就认为 T 恤是“半折叠”的,即使 T 恤仍然是一团皱巴巴的球。

解决方案:SARM(“阶段感知”教练)

作者们创建了一个新系统,称为SARM(阶段感知奖励建模)。将 SARM 想象成一位聪明的教练,它观看机器人的视频,理解任务的故事,而不仅仅是时钟。

SARM 不再问:“过去了多少秒?”,而是问:“我们处于任务的哪个阶段?”

  • 类比:想象一部电影剧本。一个糟糕的教练说:“在第 5 分钟,英雄必须正在战斗。”而一位优秀的教练(SARM)会说:“英雄目前处于‘战斗’场景中。他们是赢了?输了?还是刚开始战斗?”
  • 工作原理:SARM 查看视频和文本描述(例如“抓起 T 恤”、“抚平 T 恤”)。它将漫长的任务分解为更小的“场景”(阶段)。然后,它在该场景内评估机器人的进展。机器人是否成功抓起了 T 恤?它现在是否正在抚平它?
  • 结果:SARM 可以审视一段机器人犯错的杂乱视频,意识到:“哦,你卡在‘抚平’阶段了”,并给出反映这一现实的评分,而不是仅仅说:“你迟到了,所以你得低分。”

第二步:RA-BC(“智能过滤器”)

一旦 SARM 被训练成一位优秀的评判者,作者们便利用它构建了RA-BC(奖励对齐行为克隆)。

  • 类比:想象你是一名正在备考的学生。你有一叠 100 份练习题。
    • 旧方法(普通行为克隆):你同等地学习每一份试卷,包括那些老师出错或学生作弊的试卷。你在糟糕的例子上浪费时间。
    • RA-BC 方法:你先用你的“智能教练”(SARM)给练习题打分。教练说:“这份试卷完美,要认真学习!这份很杂乱,跳过它。这份还可以,稍微学一下。”
  • 工作原理:RA-BC 查看所有人类视频,利用 SARM 进行评分,然后重新加权训练。它告诉机器人:“要格外关注完美的视频,忽略那些杂乱的。”

结果:折叠 T 恤

团队在真实机器人上测试了这项技术,让它尝试折叠 T 恤,包括从皱巴巴的 T 恤开始这一极具挑战性的任务。

  • 旧方法:没有他们的新系统,机器人在面对平整 T 恤时成功率仅为8%,面对皱巴巴的 T 恤时成功率为0%。它完全迷失了方向。
  • 新方法(SARM + RA-BC):
    • 面对平整 T 恤:83% 的成功率。
    • 面对皱巴巴的 T 恤:67% 的成功率。

为什么这很重要

这篇论文表明,为了让机器人执行复杂、漫长的任务(如折叠衣物或卸载餐具),数据质量比数据数量更重要。你需要的不仅仅是更多的视频;你需要一种方法来理解哪些视频是好的,以及机器人处于过程的哪个位置。

通过使用“阶段感知”教练来理解任务的故事,并利用“智能过滤器”挑选最佳示例,他们教会了机器人完成了一项此前几乎不可能完成的任务。

简而言之:他们教会机器人停止计算秒数,转而理解任务的故事,使其能够从最佳示例中学习,并忽略错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →