长期以来,机器人一直是重复单一、完美动作的专家,比如流水线上的焊接机器人或堆叠相同箱子的机械臂。但要赋予机器人一个能够应对混乱、不可预测的现实世界的头脑,已被证明要困难得多。几十年来,研究人员试图通过构建一个单一且庞大的计算机程序——即一个“大脑”——来解决这个问题,让这个大脑能同时实现观察物体、理解指令并移动机械臂。虽然这些系统已经变得非常出色,但一旦出现意外,它们往往会陷入困境。如果杯子滑落或光线发生变化,这个单一的大脑就会感到困惑,因为它试图通过一个巨大的跨越来完成所有事情。新的机器人研究思路认为,智能并不一定需要存在于一个地方。相反,机器人的思维可以从一个由专门助手组成的协作团队中产生,其中一部分负责观察,另一部分负责规划,第三部分负责检查工作,第四部分负责记录发生的事情。这种方法不再将机器人视为一个单一的实体,而是一个协调的群体,使其能够以单一程序无法实现的各种方式从错误中恢复并适应变化。
这正是由包括清华大学和北京大学在内的多所大学研究人员开发的名为 EMERGE-Policy 的新框架的核心思想。研究人员并没有依赖一个处理所有事务的庞大模型,而是构建了一个中央“主代理”(Main Agent)充当项目经理的系统。这个经理本身并不观察原始视频流或计算每一个电机运动。相反,它将复杂的任务(例如“将这些杯子堆叠成金字塔”)分解为较小的步骤。然后,它将特定的工作委派给专门的“子代理”(Sub Agents)。一组助手专注于纯粹的场景观察和寻找杯子;另一组助手观察机器人的手臂,以确保其运动正确;第三组助手检查杯子放置后是否真正稳固;如果出现问题,第四组助手则帮助机器人记住失败并尝试不同的方法。主代理负责协调这些小组,仅接收其做出下一个决策所需的关键摘要信息,而处理原始数据的繁重工作则在后台进行。
研究人员在一些具有挑战性的基准测试中测试了该系统,包括机器人在困难条件下操作桌面物体的任务。他们将这种基于团队的方法与目前最优秀的单程序模型进行了对比。结果显示,这种协调的团队显著优于单模型,尤其是在环境发生变化或指令模糊的情况下。在标准测试中,该系统的成功率接近 99%,这比最好的单模型有了微小但具有意义的提升。更重要的是,当研究人员引入干扰(例如改变照明、改变杯子大小或遮挡机器人的视线)时,基于团队的系统表现出了极强的鲁棒性。当单模型在这些新条件下往往会完全失效时,EMERGE-Policy 系统能够检测到问题、诊断出问题并调整计划以取得成功。在一次涉及真实机器人将纸杯堆叠成三层金字塔的具体测试中,即使杯子大小不同或相机角度发生偏移,该系统仍以 94% 的成功率完成了任务。
该系统成功的关键在于它如何处理记忆和错误。系统并没有试图记住每一帧视频,因为这会使计算机过载,而是将发生的事情写成一份简洁的数字日志摘要。如果机器人掉落了一个杯子,系统不会只是盲目地重试,它会分析掉落的原因,记录下失败的笔记,并制定一个专门的计划来修复该部分的特定问题,然后再继续进行。这使得机器人能够在局部从错误中恢复,而不必重新开始整个任务。研究人员还发现,给系统一个对接下来可能发生情况的“预演”,有助于它在错误发生前就予以避免。通过在脑海中模拟几种可能的动作并检查哪一种看起来最好,机器人可以做出最安全的路径选择。这种“想象”步骤结合严格的验证过程,意味着机器人不太可能犯下不可逆转的错误。
实验并不局限于计算机模拟。团队将该系统部署在一个物理机械臂上,执行一系列长序列任务:将纸杯从桌面上移开、倒置放置并将它们堆叠成层。这项现实世界的测试证明,该框架可以处理物理对象的不可预测性,例如可能会摇晃或滑动的杯子。该系统成功完成了任务 94% 的次数,甚至当研究人员中断过程或改变照明时,机器人也能重新规划并完成工作。这项研究表明,未来机器人智能的精髓可能不在于构建一个更大、更聪明的单一大脑,而在于创造一种让许多更小的、专门的工具协同工作的更好方式。通过将这些工具组织成一个每个工具都有特定职责且有明确汇报方式的清晰层级结构,研究人员创造了一个不仅更精确,而且对现实世界的混乱更具韧性的系统。
技术摘要:EMERGE-Policy
问题陈述
本文针对当前具身智能(Embodied AI)中的一个根本性局限提出了挑战:即假设机器人的“大脑”必须驻留在单一、单体化的策略或推理模型中。虽然视觉-语言-动作(VLA)模型和世界-动作模型(WAMs)已取得了显著进展,但它们在处理需要复杂分解、结果验证以及从执行失败中恢复的长程任务时往往表现挣扎。现有的编排框架(例如 Code as Policies 或基于 Harness 的系统)通常将来自感知和执行的密集、非结构化证据直接传递给高层规划器。这种方法会使规划器的上下文窗口被无关数据淹没,模糊了决策相关信息的来源,并且缺乏用于局部恢复和状态巩固的显式机制。核心挑战在于如何协调专门的能力(感知、预测、控制、验证),同时严格控制每一阶段呈现给高层决策者的信息负载。
方法论:EMERGE-Policy
作者提出了 EMERGE-Policy,这是一个图结构化智能体框架,其连贯的行为并非源于单一模型,而是通过专门组件之间的协调交互而涌现。该系统围绕三个主要的架构支柱构建:
1. 分层智能体编排
- 主智能体(Main Agent): 作为编排核心,维护一个紧凑的活跃上下文窗口(Ct)。它持有任务指令、当前子目标、计划状态、恢复状态和相关记忆。它并不处理原始观测或完整的执行轨迹,而是将指令分解为由目标、状态变化和完成标准定义的子目标(gi=⟨Target,Change,Criterion⟩)。
- 子智能体(Sub Agents): 角色特定的智能体(感知、验证、监控)在隔离的上下文中运行。它们处理密集且证据密集型的任务(例如物体定位、异常检测),并仅向主智能体返回结构化的、与任务相关的证据。这种分离防止了主智能体的上下文被低层处理痕迹所污染。
- 分支栈恢复(Branch Stack Recovery): 当子目标验证失败时,主智能体会生成文本诊断,并将一个局部的恢复子目标压入分支栈。执行尝试在诉诸全局重新规划之前先解决此栈中的问题,从而实现高效的局部纠偏。
2. 统一技能接口
该框架将异构后端(VLA 策略、世界模型、分析控制器)抽象为功能性的**技能(Skill)**接口,并按其在决策循环中的角色进行分类:
- 操作技能(Operational Skills): 执行动作(例如 VLA 运动策略、轨迹原语)。
- 想象技能(Imagination Skills): 在不进行物理执行的情况下预测未来结果或潜在状态(例如世界模型)。
- 评估技能(Evaluation Skills): 评估可行性、进度或标准满足情况(例如视觉-语言模型、几何检查)。
这种功能抽象允许不同的后端模型在同一个闭环内进行组合,而无需具备相同的内部架构。
3. 令牌感知记忆与状态管理
为了处理长程任务,EMERGE-Policy 利用了多层记忆架构:
- 持久化文件:
PLAN.md(子目标序列及状态)、HISTORY.md(按时间顺序的摘要)和 MEMORY.md(整合后的信念状态)在外部存储任务状态。
- 动态上下文: 主智能体的活跃上下文通过从这些文件中检索相关事实以及从子智能体获取最新的结构化证据来重建,确保令牌预算得到高效利用。
- 视觉验证: 一个专门的监控子智能体异步地根据标准验证物理结果,提供二元判断和文本解释,以更新主智能体的信念状态。
核心贡献
- 图结构化智能体框架: 引入了 EMERGE-Policy,它将范式从单一策略转向了一个协调系统,其中行为通过主智能体、角色特定子智能体和统一技能库之间的相互作用而涌现。
- 扩展的技能定义与接口: 本文重新定义了“技能”,将其包括 VLA、世界模型和验证器在内的可调用功能单元。它建立了明确的信息边界,即子智能体返回结构化证据而非原始历史,并定义了标准的技能调用模式(⟨Imeta,Θparam,Φpre,Ψpost⟩)。
- 系统级性能提升: 作者证明,这种编排策略在鲁棒性和记忆处理方面显著优于底层的执行后端,且无需对基础模型进行额外的微调。
实验结果
该框架在标准及扰动基准测试(LIBERO, LIBERO-Plus, LIBERO-Pro, RoboDojo)上进行了评估,并在物理机器人上部署于一项多步叠杯任务。
- 基准测试性能 (LIBERO):
- 使用 Cosmos Policy 后端,EMERGE-Policy 在标准 LIBERO 上实现了 99.2% 的平均成功率(相比之下,后端本身为 98.5%),在 LIBERO-Plus 上实现了 93.9%(相比之下,后端本身为 82.2%)。
- 使用 π0.5 后端,它在标准 LIBERO 上实现了 98.8%(相比之下,后端本身为 96.8%),在 LIBERO-Plus 上实现了 88.3%(相比之下,后端本身为 85.7%)。
- 在 LIBERO-Pro(隐式指令)上,系统表现出巨大的提升,例如将 Spat-S 套件的成功率从 20.0% (π0.5) 提升至 95.7%。
- RoboDojo (记忆与开放设置):
- 系统在“记忆”维度达到了 25.00% 的成功率,显著优于 π0.5 (5.78%) 和 X-VLA (4.76%) 等基准,展示了强大的非马尔可夫推理和历史编码能力。
- 真实机器人部署:
- 在“多层叠杯”任务中,系统在标准条件下实现了 99% 的成功率。
- 在扰动下保持了鲁棒性:执行中断后成功率为 86%,杯子尺寸变化时为 92%,光照/颜色变化时为 93-94%。
- 效率: 引入任务特定先验知识减少了 24.7% 的规划步骤,并将每轮任务的墙钟时间减少了 16.3%,同时保持了相当的成功率。
意义与主张
本文声称,EMERGE-Policy 证明了机器人的有效“大脑”不必局限于单一策略。相反,智能通过多个智能体之间的功能性子任务划分及其并发协作而涌现。
作者强调,系统的成功源于:
- 结构化编排: 将感知、执行、验证和记忆明确分离到隔离的上下文中,防止了高层规划器出现信息过载。
- 局部恢复: 分支栈机制允许进行高效的基于文本的诊断与恢复,而无需丢弃整个计划。
- 模块化: 通过将模型(VLA、世界模型)视为可互换的“技能”,该框架可以在单个闭环协议内利用异构后端的优势。
作者谦虚地指出,虽然系统级结果令人鼓舞,但每个架构组件(例如上下文隔离对比增加的交互预算)的具体贡献仍需进一步的消融研究。他们总结道,该框架将鲁棒的机器人策略从孤立的运行扩展到了更广泛的领域,使其能够在复杂的、长程的以及受扰动的环境中实现可靠的表现。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。