← 最新论文
🤖 AI

EXIMO: VLM Guided Exploration of VLA Policies

本文介绍了 EXIMO,这是一种三阶段算法,它结合了用于任务分解和数据收集的视觉-语言模型(VLM)规划器,以及随后的模仿学习和残差强化学习,旨在高效地为新机器人任务微调大型视觉-语言-动作(VLA)策略。

原作者: Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch, Markus Wulfmeier, Abbas Abdolmaleki, Martin Riedmiller

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch, Markus Wulfmeier, Abbas Abdolmaleki, Martin Riedmiller

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人在没有人类站在旁边指导每一个动作的情况下,很难学习新任务。多年来,最成功的方法是向机器人展示数千小时的人类演示,教它模仿那些特定的动作。这种方法对于简单、重复的工作效果很好,但当机器人面临从未见过的场景时(例如,根据一个关于猴子喜欢吃什么的谜语来弄清楚如何将特定的水果放入碗中),它就会失效。另一种方法是让机器人通过试错来学习,但这在现实世界中通常太慢且太危险,因为机器人可能需要数百万次尝试才能成功。科学家面临的挑战是找到一种方法,赋予机器人思考问题并快速学习的能力,而不需要人类记录每一个步骤。

Google DeepMind 的研究团队开发了一种名为 Eximo 的新方法来解决这个问题。他们从一个已经掌握基本技能(如拿起香蕉或放置杯子)但无法弄清楚如何组合这些技能以完成复杂多步目标的机器人开始。为了弥补这一差距,他们引入了第二个高度智能的计算机程序,充当战略规划器。这个被称为“视觉-语言模型”的规划器可以观察机器人的周围环境并理解整体目标,例如“把盘子和碗放在架子上”。该规划器并不直接尝试移动机器人的手臂,而是将大目标分解为一系列简单的自然语言指令,例如“用左手拿起蓝色盘子”,并将它们传递给机器人。

这个过程分为三个不同的阶段。首先,研究人员让机器人和规划器协同工作,以探索新任务。规划器通过摄像头画面观察机器人的进度,并不断更新其指令,引导机器人完成成功所需的步骤。当机器人成功完成一项任务时,团队会保存该事件序列。在第二阶段,他们利用这些成功的案例来直接教导机器人。他们获取机器人的原始大脑,并使用这些成功的例子对其进行微调,实际上是在展示如何无需规划器在耳边低声指点就能独立解决问题。最后,在第三阶段,他们让机器人再次练习该任务,这一次使用一种允许机器人对动作进行微调的学习方法,使其变得更加精准和可靠。

这种方法的成果在模拟环境中进行了测试,涵盖了二十二种不同的任务,从将餐具放在架子上到将工具分类放入特定隔间。研究人员发现,当机器人在初始探索阶段由规划器引导时,它完成这些复杂任务的频率比试图独自摸索的机器人要高得多。更重要的是,在机器人使用来自规划器的成功案例进行学习后,它变得比目前最先进的机器人还要出色。机器人学会了解决需要推理的任务,例如通过描述而非名称来识别物体,并且完成这些任务所需的尝试次数远少于传统方法。

这项工作表明,将机器人的物理技能与强大的思考型计算机程序相结合,可以创造出更强大的学习者。核心见解在于,机器人不需要永久运行这个思考程序;相反,它可以从程序的指导中学习,然后独立执行任务。通过使用这种方法,研究人员展示了机器人可以快速且高效地学习新的复杂行为,向着能够适应现实世界不可预测性且无需持续人工监督的机器迈出了重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →