Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations
本文介绍了 HERO,一种自我进化的分层具身智能体,它通过编排启发式推理、范例复用和反射式执行,在零人类演示的情况下,自主引导并整合机器人操控能力为高效的闭环策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:机器人不再仅仅是遵循人类程序员编写的严格脚本,而是能够像我们一样学习移动和思考。这就是“具身智能”(Embodied AI)的梦想——给计算机一个身体,让它能与现实世界进行交互。目前,教机器人做一件新事情通常感觉就像教一个蹒跚学步的幼儿系鞋带:你必须牵着他们的手,向他们展示具体该怎么做,并重复数百次,直到他们的肌肉“记住”这种动作。这被称为“从人类演示中学习”。但如果机器人可以自主学习呢?如果它仅仅通过观察世界并尝试各种方法,就能弄明白如何抓取杯子、推开箱子或打开抽屉,而不需要你动一下手指来演示路径,那会怎样?这是研究人员正在追逐的大问题:我们如何让机器人从零开始构建自己的“肌肉记忆”?
欢迎来到 HERO,这是一个像自学成才的学徒一样的全新机器人大脑。这篇论文将 HERO 介绍为一个从零开始、无需人类帮助,并通过巧妙的三步进化来学习操作物体的系统。你可以把它想象成一个机器人在三个不同阶段的成长过程。首先,它使用“启发式推理”(Heuristic Reasoning),这就像是一个利用庞大知识库进行聪明猜测的“猜想者”,用以应对从未见过的任务。如果这种方式失败或变得缓慢,它会转向“范例重用”(Exemplar Reuse),这就像是回忆起曾经成功移动过类似物体的经历,并直接复制那种动作,并针对新情况进行调整。最后,在经过足够的练习后,它会发展出“反射执行”(Reflexive Execution),这是纯粹的肌肉记忆——一种快速、自动的反应,不需要每次都费力思考。论文表明,通过混合这三种技能并让机器人自主练习,它可以学习完成诸如堆叠积木或搜索抽屉等复杂任务,并最终变得如此熟练,以至于几乎不需要思考。
论文的核心故事:从零到肌肉记忆
开发 HERO 的研究人员来自上海交通大学和萨塞克斯大学,他们想要解决一个特定的问题:如今大多数机器人都处于“静态”模式。它们要么在通用推理方面非常出色(讨论该做什么),但在实际移动时显得缓慢且笨拙;要么在移动方面速度极快,但前提是你必须先向它们展示具体该怎么做。HERO 试图通过创建一个能够进化自身技能的系统来弥补这一差距。
论文反对“机器人需要海量人类视频数据库才能学习”的观点。相反,HERO 从零人类演示开始。它的旅程始于一个“启发式引导器”(Level 1)。当面对一个新任务(例如“拿起红色包裹”)时,这一层级就像一个侦探。它使用视觉语言模型(VLM)——一种能够理解图像和文字的 AI——来观察场景、猜测抓取物体的位置并规划路径。它并不完美,也有些缓慢,但它能在没有任何预训练的情况下完成工作。
一旦机器人成功抓取了物体,它并不会就此忘记。它会将这次成功保存为一个“范例”。随着机器人练习的增多,它进入了第二阶段:“范例加速器”(Level 2)。现在,如果它看到一个与之前做过的任务相似的任务,它就不再需要重新猜测。它会找到保存的范例,计算如何拉伸或旋转旧的动作以适应新物体,然后执行。这就像是回忆起上周是如何打开一个特定罐子的,并把同样的转动手腕动作应用到一个同样大小的新罐子上。这一步比猜测阶段要快得多。
最后一个也是最令人印象深刻的阶段是“反射策略”(Level 3)。在收集了数百次成功尝试后,机器人会训练一个特殊的“肌肉记忆”模型。这个模型跳过了思考和复制的步骤。它观察物体和目标,然后立即向机器人的手臂发送正确的指令。这就是论文中提到的“闭环”控制,意味着机器人不断检查自己的运动,并实时进行调整,就像人类在接球时不需要思考物理定律一样。
在现实世界中如何运作
为了测试这一点,研究人员在一个配备了四台摄像头的真实实验室环境中,设置了一个 Franka Emika Panda 机械臂。他们给了它四个不同的挑战:拿起不同颜色的包裹、按特定顺序堆叠积木、打开抽屉寻找隐藏的牛角面包,以及移动箱子以露出隐藏的绷带卷。
机器人不仅仅是完成这些任务一次;它运行了一个持续的自主能力进化循环。以下是神奇的循环过程:
- 尝试: 机器人尝试一项任务。如果是新任务,它使用“猜测”(L1)模式。
- 保存: 如果成功,它会保存该动作。如果是一个它见过的任务,它可能会使用“复制”(L2)模式来提高速度。
- 重置: 完成任务后,机器人会自动计算如何将所有物品恢复到初始位置(一个“反向任务”),以便再次尝试。它总共执行了 664 次!
- 学习: 一旦拥有了足够的数据,它就会训练“肌肉记忆”(L3)模型。
结果非常具有说服力。论文发现,HERO 可以在几乎不需要人类帮助的情况下收集到如此海量的数据——每个子任务仅需约 1.03 秒的人类干预,主要只是为了在机器人卡住时修复场景。机器人能够在没有任何人触碰的情况下,连续完成 46 个子任务循环。
当他们在这些任务上测试最终的机器人时,完整的 HERO 系统(使用所有三个层级)在四种不同任务中的成功率达到了 86.0%。这明显优于仅使用其中一个层级的情况。例如,如果仅使用猜测层(L1),成功率会降至 76.0%。如果仅使用肌肉记忆层(L3),成功率则为 70.0%。论文指出,秘诀在于灵活性:在可能的情况下使用快速的肌肉记忆,但在遇到棘手情况或遇到新事物时,随时准备好让“复制”和“猜测”技能介入。
权衡与瑕疵
论文坦诚地说明了局限性。“猜测”层(L1)是最慢的,每个子任务耗时约 46.57 秒,因为它需要进行大量的深度思考和 3D 建模。 “复制”层(L2)较快,耗时 20.96 秒,而“肌肉记忆”层(L3)对于重复任务效率最高,耗时 37.90 秒(尽管这包含了机器人实际移动的时间,这是一个漫长的过程)。
他们还分析了出错的地方。在 120 次任务尝试中,有 73 次是完美完成且没有任何错误的。发生的失败大多是由于机器人误判了物体位置(感知错误)或“大脑”规划了错误的动作序列。有趣的是,系统的“监控”功能表现出色;它在 94.5% 的情况下都能正确识别任务失败,从而允许它重试或请求帮助。
作者认为,虽然 HERO 迈出了重要一步,但它尚未达到完美。其“猜测”部分仍然可能很慢,有时会误读物体的 3D 形状。此外,机器人目前依赖于一组由人类预先设计的基本动作列表(如“抓取”、“推”、“拉”)。它目前还无法自主发明全新的运动类型。
总结
简单来说,HERO 证明了机器人可以从一张白纸开始,通过实践学习,并最终在不需要人类全程手把手指导的情况下,发展出自己的“肌肉记忆”。它表明,机器人的未来不仅仅在于制造更聪明的头脑或更强壮的手臂,而在于创造能够随着经验积累,在思考、模仿和反应之间无缝切换的系统。论文并未声称解决了所有的机器人问题,但它为那些能在混乱、不可预测的现实世界中真正学习和适应的机器提供了一条充满希望的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。