← 最新论文
💻 computer science

Adaptation of Generalist Robot Policies with Minimal Data

本文介绍了 MiDAS,一种简单的离线到在线强化学习框架,它使通用机器人策略能够快速适应新任务,并实现从仅需一次人类演示开始的稳健自主提升。

原作者: Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:机器人不再仅仅遵循人类工程师编写的僵化脚本,而是像我们一样能够自主学习和进步。这就是机器人技术的“圣杯”:构建能够走进一个新房间,弄清楚需要做什么,并通过试错不断改进自己的机器。为了理解这是如何运作的,可以将机器人的大脑想象为由两个主要部分组成。首先,它需要一个“通用知识”库,就像一个关于世界运作方式的图书馆,它通过观看数百万段人类做事的视频来学习。其次,它需要学习特定的技能,比如如何打开一个特定的罐子或堆叠一组特定的积木。科学家面临的巨大挑战是,虽然机器人在获取这种通用知识方面已经做得很好,但在自主学习新特定任务方面仍然表现得很糟糕。如果你要求机器人做一件它从未见过的任务,它往往只会原地发呆或胡乱挥舞,因为它不知道从哪里开始。这就像是给一个人一张全世界的地图,却没告诉他现在在哪条街上;他拥有所有的导航工具,但如果没有一点点帮助,他就无法迈出第一步。

这是一个名为 MiDAS 的新方法的故事,它试图解决这个“第一步”问题。研究人员提出了一个简单的问题:如果我们只给机器人一段展示如何成功完成任务的视频,然后让机器人自己去摸索剩下的部分,会发生什么?通常,一段视频是不够的。这就像是看别人解了一次魔方,然后就被要求自己去解;你可能知道大概的意思,但在掌握之前很可能会经历多次失败。论文指出,通过将这段单次视频与一种聪明的从错误中学习的方法相结合,机器人实际上可以学会可靠地完成任务。他们在计算机模拟和一台双臂真实机器人上进行了测试,结果发现,即使只有一次示例,机器人也能在经过几个小时的练习后学会成功,而其他方法则会立即放弃。

问题所在:机器人的“眼神空洞”

想象一下你正在教一个机器人做三明治。你有一个超级聪明的机器人,它已经看过了数百万段人类烹饪的视频。它知道面包长什么样,知道什么是奶酪,也知道刀具是如何工作的。这是它的“预训练”大脑。但如果你走进厨房说:“给我做一个带蓝奶酪的三明治,把奶酪放在左边,”机器人可能会只是盯着你看。它知道食材,但它不知道是“这个”特定的三明治。

如果你让机器人尝试自主学习,它可能会反复失败。它可能会抓错面包,掉落奶酪,或者试图把刀插进烤面包机里。在机器人领域,这些失败被称为“稀疏奖励”(sparse rewards)。这就像玩电子游戏,只有在最后看到“你赢了!”的消息时才会得分,过程中没有任何提示或分数。如果机器人在 100 次尝试中有 99 次都失败了,它就永远拿不到那个“你赢了!”的信号,因此永远学不会。它陷入了一个失败的循环。

解决方案:一段视频和一个“残差”助手

开发 MiDAS(最小数据适配策略)的研究人员提出了一个巧妙的两步配方来打破这个循环。

第一步:“锚定”视频
首先,他们向机器人展示一段完成任务的成功视频。他们不仅仅是让机器人观看;他们使用了一种称为“行为克隆”(behavior cloning)的技术。你可以把它想象成机器人进行了一场快速且高强度的突击学习。它观察这段视频并尝试模仿动作。

  • 发生了什么: 机器人的表现变好了。它不再呆呆地看着。它知道要抓面包,然后是奶酪,最后是刀。
  • 代价: 它仍然很笨拙。它可能正确地抓住了面包,但因为握力太紧而掉落了奶酪,或者因为它稍微偏离了中心而没抓到盘子。它有了任务的“概念”,但缺乏“精度”。在论文的测试中,这个“单视频”机器人可以接近目标,但经常无法完成任务。

第二步:“残差”教练
这是见证奇迹的地方。MiDAS 并没有尝试从头开始重新教机器人,而是在机器人的大脑之上添加了一个轻量级的“教练”。

  • 运作方式: 机器人的主脑(即通过那段视频训练出的脑)会说:“我认为我应该这样移动手臂。”新的“教练”(称为残差策略,residual policy)会倾听这个建议并说:“实际上,再向左移动那么一点点。”
  • 学习过程: 机器人随后尝试这个调整后的动作。如果成功了,教练就会得到一分。如果失败了,教练会学习下次如何进行不同的调整。
  • 为什么它很特别: 主脑保持冻结状态(它不会改变),所以机器人不会忘记从视频中学到的东西。教练很小且反应迅速,它只学习那些能将“尝试得不错”转化为“完美成功”的微小修正。

结果:从尝试到精通

团队在两个不同的虚拟世界(称为 LIBERO-Long 和 RoboCasa)以及一台名为 YAM 的双臂真实机器人上测试了这个想法。

在模拟器中:
结果非常出色。仅凭一次演示:

  • 那些试图从零开始学习或仅仅是复制视频的标准方法几乎完全失败(成功率为 0%)。
  • 其他试图微调机器人行为的高级方法仅能完成约 30% 到 40% 的任务。
  • MiDAS 平均成功完成了 91% 的任务。在某些特定任务中(如将锅放在炉子上),它的成功率达到了 98%

在现实世界中:
他们将该方法应用于一台双臂机器人。

  • 任务 1: 将一个绿块放入一个容器,将一个蓝块放入另一个容器。机器人看完视频后的初始成功率为 40%。经过大约 6 小时 的自主交互练习后,成功率提升到了 67%
  • 任务 2: 将一把刀和一个甜甜圈放在盘子里。这更难。机器人最初的成功率仅为 27%。但在 5 到 6 小时 的自主交互后,成功率跃升至 80%

论文指出,这之所以奏效,是因为机器人的预训练大脑已经知道如何移动手臂以及物体长什么样。单次视频告诉它“要做什么”。而在线学习(教练)则填补了“如何做得完美”的空白。

这意味着什么(以及它不意味着什么)

研究人员谨慎地指出了这种方法能做什么以及不能做什么。

它擅长的地方:

  • 它能将“可能可以”变为“确定可以”,针对的是机器人已有一定通用知识的任务。
  • 它允许机器人进行泛化。如果你移动了物体的位置或改变了光照,机器人仍然可以处理,因为它的大脑足够聪明,可以应对这些变化。
  • 它只需要极少的人类帮助。你不需要记录 100 段视频;一段就足够启动。

它目前还做不到的地方:

  • 它无法教会机器人去做一件它完全没有先验知识的新事物。如果机器人以前从未见过刀或甜甜圈,一段视频是不够的。
  • 如果任务需要一种完全不同的运动方式,它会感到困惑。例如,如果机器人需要以一种与视频相悖的方式交换两个物体的位置,它可能会产生混乱。
  • “6 小时”的练习对于机器人来说仍然很长。论文表明,虽然这是一个巨大的进步,但我们仍需让学习变得更快、更高效。

大局观

把 MiDAS 看作一座桥梁。在此之前,存在着巨大的鸿沟:一边是“拥有广泛通用知识的机器人”,另一边是“能完成特定工作的机器人”。你要么需要人类编写每一个动作,要么需要数百小时的试错。MiDAS 展示了,如果你给机器人一点点人类的引导(一段视频),并让它配备一个聪明的轻量级教练,它就可以靠自己跨越这座鸿沟。

作者认为,这是首次有人证明机器人可以仅通过单次演示就可靠地适应新任务。它不是解决所有问题的万灵药,但它是一个强大的新工具,表明我们正越来越接近于实现那种只需一点点帮助就能真正向我们学习的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →