CORE: Common Outcome Regularities from Action-Free Visual Demonstrations for Robot Manipulation
本文介绍了 CORE,这是一个利用无动作人类视频,通过提取并利用共同的终端结果正则性作为视觉目标原型,以克服具身差异并显著提高模拟及真实世界任务中操控成功率的机器人模仿学习框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人如何堆叠碗。你有两种给机器人下达指令的方法:
- 文本手册: 你告诉机器人,“请堆叠碗。”
- 视频: 你给机器人看一段人类堆叠碗的视频,但你并不告诉机器人应该如何移动它的手臂。你只是让它观察结果。
长期以来,机器人一直难以掌握第二种方法。它们擅长遵循文本指令,但文本往往过于模糊。“堆叠碗”并不会告诉机器人堆叠的高度应该是多少,碗之间应该如何接触,或者最终的形状应该是什么样子的。这就像是告诉一位厨师“做一个蛋糕”,却没向他们展示一个完成的蛋糕长什么样。
另一方面,机器人也一直难以通过人类视频进行学习,因为人类和机器人的样子非常不同。人类使用手;机器人使用夹爪。人类移动整个身体;机器人移动特定的手臂。试图模仿人类精确的手部动作往往会让机器人感到困惑。
核心理念:“关注终点,而非赛程”
这篇论文的作者们提出了 CORE,他们意识到了一件聪明的事情。他们注意到,虽然不同的人可能会以完全不同的方式(使用不同的速度、不同的角度或不同的抓握方式)来堆叠碗,但他们最终都会得到完全相同的结果: 一叠整齐、稳定的碗。
他们将这些共同的结果称为**“共同结果正则性”(Common Outcome Regularities)**。
与其试图教机器人“如何移动”(赛程),他们决定教机器人“终点看起来是什么样的”(结果)。
CORE 是如何工作的(三个步骤)
把 CORE 想象成一个聪明的老师,它观察了一堆视频,然后给了机器人一张“目标图片”。
第一步:侦探(学习结果)
该系统观看许多人们成功堆叠碗的视频。它忽略了视频中混乱的中间过程(挥动的双臂、停顿),而只关注成功尝试的最后一秒。它学会了识别出一个成功堆叠的“指纹”。这就像一个侦探,他只关心破案后的现场,而不关心破案的过程。第二步:艺术家(创造目标)
系统提取所有这些“成功的结尾”快照,并将它们融合在一起,创造出一张完美的、理想的“目标图片”。这不仅仅是一张随机的照片;它是对一个“完美堆叠”的总结,过滤掉了人们完成任务时任何奇怪或偶然的方式。第三步:教练(引导机器人)
现在,机器人开始尝试执行任务。当机器人移动时,系统会不断地将机器人当前看到的画面与那张“目标图片”进行比较。它会告诉机器人:“你正在接近目标图片,”或者“你正在远离它。”这就像一个 GPS,不断纠正机器人的路径,直到它与完美的结局相匹配。
为什么这比文本更好
论文在许多不同的任务上测试了这一点,比如打开抽屉、堆叠积木和移动物体。
- 文本指令就像一张模糊的地图:“去公园。”机器人可能会迷路,因为它不知道公园的长椅具体在哪里,或者如何爬过围栏。
- CORE 的视觉目标则像是一张目的地的照片:“当你看起来正好是这样的时候,就停下来。”
在测试中,使用 CORE 的机器人比使用文本指令的机器人表现得更为成功。
- 在名为 Meta-World 的模拟环境中,机器人的成功率提高了约 4%。
- 在 RoboTwin 2.0 中,它们提高了 11%。
- 在真实世界(使用物理机器人手臂)中,这种提升是巨大的,达到了 17%。
现实世界的证明
研究人员甚至在实验室里将此应用于一个真实的机器人手臂。他们要求机器人打开抽屉并堆叠三个碗。
- 仅使用文本指令的机器人经常在距离目标点稍近的地方停止,或者在堆叠过程中手忙脚乱。
- 使用 CORE “目标图片”的机器人清楚地知道何时达到了完美的位置并成功完成了任务。
核心启示
这篇论文认为,我们不需要教机器人去精确模仿人类的动作。相反,我们应该教它们去识别什么是“做得好”。通过关注结果而非动作,机器人可以从互联网上海量的人类视频中学习,即使这些视频里的动作看起来不像人类。这是一个从询问“我该如何移动?”到询问“成功看起来是什么样的?”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。