← 最新论文
💻 computer science

EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy

EMERGE-Policy 引入了一种图结构智能体框架,其中一个中心主智能体协调用于感知、推理和验证的专门子智能体在隔离的上下文中运行,通过涌现出的系统级协作和闭环纠错,实现了无需微调的鲁棒机器人性能。

原作者: Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan L
发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan Li, Ziwei Wang, Weijian Deng, Xiu Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直是重复单一、完美动作的专家,比如流水线上的焊接机器人或堆叠相同箱子的机械臂。但要赋予机器人一个能够应对混乱、不可预测的现实世界的头脑,已被证明要困难得多。几十年来,研究人员试图通过构建一个单一且庞大的计算机程序——即一个“大脑”——来解决这个问题,让这个大脑能同时实现观察物体、理解指令并移动机械臂。虽然这些系统已经变得非常出色,但一旦出现意外,它们往往会陷入困境。如果杯子滑落或光线发生变化,这个单一的大脑就会感到困惑,因为它试图通过一个巨大的跨越来完成所有事情。新的机器人研究思路认为,智能并不一定需要存在于一个地方。相反,机器人的思维可以从一个由专门助手组成的协作团队中产生,其中一部分负责观察,另一部分负责规划,第三部分负责检查工作,第四部分负责记录发生的事情。这种方法不再将机器人视为一个单一的实体,而是一个协调的群体,使其能够以单一程序无法实现的各种方式从错误中恢复并适应变化。

这正是由包括清华大学和北京大学在内的多所大学研究人员开发的名为 EMERGE-Policy 的新框架的核心思想。研究人员并没有依赖一个处理所有事务的庞大模型,而是构建了一个中央“主代理”(Main Agent)充当项目经理的系统。这个经理本身并不观察原始视频流或计算每一个电机运动。相反,它将复杂的任务(例如“将这些杯子堆叠成金字塔”)分解为较小的步骤。然后,它将特定的工作委派给专门的“子代理”(Sub Agents)。一组助手专注于纯粹的场景观察和寻找杯子;另一组助手观察机器人的手臂,以确保其运动正确;第三组助手检查杯子放置后是否真正稳固;如果出现问题,第四组助手则帮助机器人记住失败并尝试不同的方法。主代理负责协调这些小组,仅接收其做出下一个决策所需的关键摘要信息,而处理原始数据的繁重工作则在后台进行。

研究人员在一些具有挑战性的基准测试中测试了该系统,包括机器人在困难条件下操作桌面物体的任务。他们将这种基于团队的方法与目前最优秀的单程序模型进行了对比。结果显示,这种协调的团队显著优于单模型,尤其是在环境发生变化或指令模糊的情况下。在标准测试中,该系统的成功率接近 99%,这比最好的单模型有了微小但具有意义的提升。更重要的是,当研究人员引入干扰(例如改变照明、改变杯子大小或遮挡机器人的视线)时,基于团队的系统表现出了极强的鲁棒性。当单模型在这些新条件下往往会完全失效时,EMERGE-Policy 系统能够检测到问题、诊断出问题并调整计划以取得成功。在一次涉及真实机器人将纸杯堆叠成三层金字塔的具体测试中,即使杯子大小不同或相机角度发生偏移,该系统仍以 94% 的成功率完成了任务。

该系统成功的关键在于它如何处理记忆和错误。系统并没有试图记住每一帧视频,因为这会使计算机过载,而是将发生的事情写成一份简洁的数字日志摘要。如果机器人掉落了一个杯子,系统不会只是盲目地重试,它会分析掉落的原因,记录下失败的笔记,并制定一个专门的计划来修复该部分的特定问题,然后再继续进行。这使得机器人能够在局部从错误中恢复,而不必重新开始整个任务。研究人员还发现,给系统一个对接下来可能发生情况的“预演”,有助于它在错误发生前就予以避免。通过在脑海中模拟几种可能的动作并检查哪一种看起来最好,机器人可以做出最安全的路径选择。这种“想象”步骤结合严格的验证过程,意味着机器人不太可能犯下不可逆转的错误。

实验并不局限于计算机模拟。团队将该系统部署在一个物理机械臂上,执行一系列长序列任务:将纸杯从桌面上移开、倒置放置并将它们堆叠成层。这项现实世界的测试证明,该框架可以处理物理对象的不可预测性,例如可能会摇晃或滑动的杯子。该系统成功完成了任务 94% 的次数,甚至当研究人员中断过程或改变照明时,机器人也能重新规划并完成工作。这项研究表明,未来机器人智能的精髓可能不在于构建一个更大、更聪明的单一大脑,而在于创造一种让许多更小的、专门的工具协同工作的更好方式。通过将这些工具组织成一个每个工具都有特定职责且有明确汇报方式的清晰层级结构,研究人员创造了一个不仅更精确,而且对现实世界的混乱更具韧性的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →