核心理念:拥有“第二意见”的机器人
想象你有一个非常有天赋的机器人厨师(生成器/Generator),它通过观看成千上万段人类烹饪的视频进行了训练。这个机器人非常擅长遵循食谱,但如果厨房布局发生微小的变化——比如盐罐向左移动了两英寸——机器人可能会感到困惑、掉落勺子或洒出汤汁。通常情况下,为了解决这个问题,你需要送机器人回“学校”(重新训练)去学习新的布局,这既缓慢又昂贵。
这篇论文的作者提出了一个不同的解决方案:EVE。他们没有选择重新训练机器人,而是给了它一个专家评审团(验证器/Verifiers),这些专家会实时观察机器人的工作。如果机器人开始犯错,这些评审员就会介入,提供微小的修正建议,并帮助机器人顺利完成任务——而无需机器人回到学校。
EVE 如何运作:导演与编辑
该系统就像一个电影制作团队:
- 导演(生成器/The Director): 这是机器人的原始大脑。它观察场景并说:“好的,我认为我应该这样移动我的手臂。”它生成一个计划(一组动作)。
- 编辑(验证器/The Editors): 这些是强大的 AI 模型(具体来说是视觉语言模型/Vision-Language Models),充当专家小组。它们虽然不会做饭,但非常擅长“观察”和“评论”。
- 编辑 A 可能会观察机器人的计划并说:“那条路径看起来有风险;你可能会撞到柜台。”
- 编辑 B 可能会说:“实际上,如果你把手稍微向左挪一点,你就能完美地抓取物体。”
- 融合(动作整合器/The Fusion): 这是神奇的胶水。EVE 并没有让机器人盲目地跟随编辑或忽略编辑,而是使用一种特殊的数学过程(称为引导扩散/Guided Diffusion)将导演的原始计划与编辑的建议进行融合。这就像是拿着导演的剧本,对对话进行细微的润色,使其听起来更自然,而不是重写整部电影。
“安全网”机制
论文指出,要求这些专家编辑每秒钟都盯着机器人看会太慢且太昂贵(就像有一组评委在你每次呼吸时都大声提供建议一样)。
因此,EVE 使用了一个烟雾探测器(称为 MMD 触发器):
- 机器人正常运行。
- 系统不断检查:“机器人的动作看起来是否奇怪或不稳定?”
- 如果机器人的动作很平滑,系统就保持静默。
- 如果机器人开始踉跄(“烟雾探测器”被触发),系统会立即唤醒编辑。他们分析情况,提出修复方案,然后系统将该修复方案融入到机器人的下一个动作中。一旦机器人回到正轨,系统便会再次进入休眠状态。
论文的研究结果(研究发现)
研究人员在机器人执行各种任务(如堆叠积木、打开抽屉或移动桌面上的物体)时测试了这一系统。
- 优于训练法: 他们将 EVE 与其他需要大量新数据进行训练的方法进行了对比。EVE 在无需任何新训练数据的情况下,表现甚至优于其他方法。这就像是一个学生不需要为新考试复习,因为他在考试过程中有一位非常聪明的监考老师在提供帮助。
- 团队协作更胜一筹: 他们发现,使用不同类型的编辑组成的“团队”(有些关注全局,有些专注于特定动作)比只使用一个编辑效果更好。如果一个编辑给出了错误的建议,其他编辑可以起到平衡作用。
- 现实世界的成功: 他们在实验室中使用真实的机器人手臂进行了测试。当机器人面临新的、棘手的场景(例如拿起一个它从未见过的咖啡胶囊)时,EVE 系统帮助它取得了成功,而其他方法则失败了。
局限性(论文中提到的内容)
论文坦诚地说明了该系统并不完美的地方:
- 速度: 由于“编辑”是功能强大的 AI 模型,检查它们需要花费一点时间。然而,由于它们只在必要时才进行检查,完成任务的总时间仍然很快。
- 并非万能: 如果任务极其困难(例如在相机看不清的深暗冰箱里捡东西),编辑可能无法给出好的建议,此时系统可能无法提供太多帮助。
总结
EVE 是一个让预训练机器人能够在遇到困难时从智能 AI 评论员那里获得“第二意见”的系统。它不是通过重新训练机器人,而是利用这些评论员来引导机器人的动作走向正确方向,从而使其比以往能更好地处理新的和棘手的场景。这就像是给一位熟练的驾驶员配备了一位只有在路况危险时才会开口的副驾驶。
技术摘要:EVE:一种用于生成式策略的生成器-验证器系统
问题陈述
基于生成模型(如扩散模型和流匹配)的视觉运动策略在机器人领域展现了强大的性能,但在部署过程中遇到分布偏移或分布外(OOD)状态时表现出显著的局限性。与语言模型不同——语言模型的推理能力已通过生成-验证框架下的测试时计算扩展得到了革命性的提升——具身策略通常缺乏鲁棒的恢复机制。提高其鲁棒性通常需要使用额外的领域内数据进行昂贵的微调或恢复序列,这不仅收集成本高昂,且往往导致模型过度依赖于特定数据的规模和质量。此外,现有的基于验证器的机器人引导方法通常需要从头开始训练验证器或学习潜在动力学模型,这限制了它们的零样本(zero-shot)适用性。
方法论:EVE 框架
作者提出了 EVE(具身验证器集成,Embodied Verifier Ensembles),这是一个模块化的推理时框架,旨在通过多个零样本、基于视觉语言模型(VLM)的验证器智能体来增强冻结的预训练生成式策略。EVE 的运行无需额外的策略训练或验证器微调。
核心组件
- 基础策略候选生成: 在每个时间步,冻结的基础策略 (πθ) 根据当前的观测和状态生成一组候选动作轨迹(通过从独立的噪声样本中去噪得到)。
- 验证器智能体: EVE 采用异构验证器模块集合 (V={Vj}) 进行零样本操作。该框架根据输入模态对验证器进行分类:
- 生成器无关型验证器(Generator-Agnostic Verifiers): 这些验证器仅基于机器人传感器观测(如 RGB 图像)和任务指令运行,无法获取基础策略的动作提案。它们从一组预定义的原语(primitives)中建议恢复动作。
- 生成器条件型验证器(Generator-Conditioned Verifiers): 这些验证器将基础策略的候选动作轨迹作为输入(除观测值外),以提供反馈,例如选择最佳轨迹或提出基于文本的修正。
- 动作聚合: 不同类型的验证器输出(可能是轨迹选择、原语建议或文本修正)被投影到一个共同的语义空间,并使用加权插值算子聚合为一个单一的融合轨迹信号 (m~)。
- 引导扩散动作整合器(Guided Diffusion Action Incorporator): EVE 并非简单地对动作进行平均或覆盖基础策略,而是使用了一种**引导扩散(Guided Diffusion)**机制,将聚合后的验证器反馈与基础策略的动作分布进行融合。
- 系统定义了一个基于生成动作与验证器反馈之间 L2 范数差异的对齐目标 ξ。
- 在反向扩散过程中,引导系数 (βk) 对该目标的梯度进行缩放,从而在保留预训练策略先验的同时,将去噪过程引导至符合验证器一致性的行为。
- 干预检测: 为了减轻连续进行 VLM 推理带来的高计算成本,EVE 并不会在每个时间步都查询验证器。相反,它利用基于**最大均值差异(MMD)**的动作分布失败检测器。只有当 MMD 超过阈值(表明在展开过程中可能出现偏差或失败)时,才会调用验证器。
主要贡献
- EVE 框架: 一种新型的生成器-验证器系统,专为具身策略量身定制,利用具有不同能力的零样本 VLM 验证器集成来提升测试时性能。
- 引导扩散整合器: 一个特定的模块,通过使用分类器引导,将聚合后的验证器反馈与基础策略动作预测无缝插值,避免了简单平均或硬覆盖的缺陷。
- 零样本优越性: 实证证据表明,EVE 集成方案优于需要大量领域内训练预算(例如 17.5 万次演示或 2000 万个合成样本)的先进具身验证器基准模型(如 RoboMonkey 和 V-GPS)。
- 系统性分析: 通过广泛的消融实验,隔离了验证器模型规模、聚合策略和引导系数各自的贡献,为构建可扩展的生成器-验证器系统提供了实践指南。
实验结果
作者在多种模拟和现实世界的机器人任务及具身形态上评估了 EVE:
- SimplerEnv 基准测试: 在针对 WidowX 和 Google Robot 具身形态的 7 项任务中,EVE 集成方案实现了 72.2% 的总平均成功率,超过了基础策略 (π0, 67.1%) 和经过训练的验证器基准(RoboMonkey: 68.1%, V-GPS: 27.3%)。值得注意的是,EVE 在零训练数据的情况下实现了这些结果。
- 长程任务(ManiSkill-HAB): EVE 在移动操作任务(如开冰箱、放置物品)中表现出持续的改进,在需要从细微执行退化中恢复的任务中观察到了最大的增益。
- 复杂具身形态(RoboTwin-2.0): EVE 提升了一个双臂协作策略 (π0.5) 在复杂双臂任务中的表现,而其他基准模型在零样本设置下无法适用。
- 现实世界验证: 在 Franka Emika Panda 机械臂上,EVE 提高了分布内任务的成功率,并在 OOD 任务(变化的物体顺序和未见过的物体)上显著优于基准模型,展示了在现实环境中的鲁棒性。
- 延迟: 虽然由于 VLM 推理导致单步验证延迟较高,但 MMD 触发的干预策略使得 平均展开时间与每一步都查询验证器的基准模型相当甚至更低。
意义与主张
论文声称 EVE 代表了具身智能领域的一种范式转变,证明了冻结的预训练生成式策略可以通过测试时使用零样本验证器进行显著提升,这镜像了大型语言模型在测试时计算扩展方面的成功。
作者强调,这种方法消除了通常用于增强策略鲁棒性所需的昂贵数据收集和微调流程。通过编排异构的零样本验证器集成,并通过引导扩散整合其反馈,EVE 提供了一种可扩展、模块化的具身控制解决方案,能够有效地从失败中恢复,并在无需重新训练底层策略的情况下,泛化到新任务和新具身形态。这项工作表明,“生成-验证”差距是提高机器人系统在开放式环境中可靠性的一个可行且强大的途径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。