Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents
Harness VLA 是一个记忆增强型智能体框架,它通过将冻结的视觉-语言-动作模型视为可重试的富接触原语,并将其与一组固定的解析原语库进行组合,从而在无需模型微调的情况下,显著提升了这些模型在复杂操控任务中的可靠性,并在 LIBERO-Pro 和 RoboCasa365 等基准测试中实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人大脑,它在某一件特定的事情上表现得极其出色:抓取形状奇特的物体、转动粘性的旋钮或按下按钮。它就像一位世界级的厨师,能完美地切菜和煎牛排。但如果你要求这位厨师策划一场完整的晚宴、在拥挤的厨房中穿行,或者在桌子被移动后弄清楚盐罐在哪里,他们就会彻底迷失方向。他们可能会试图去切那个盐罐,因为他们是在特定的桌面布局下接受的训练;或者当指令发生轻微变化时,他们可能会陷入僵局。
这就是目前的“视觉-语言-动作”(VLA)机器人所面临的问题。它们擅长“接触”部分(触摸和移动物体),但在面对混乱或变化的情况时,处理“规划”部分的能力却很糟糕。
由此诞生了 Harness VLA。请将它视为不仅仅是一个新的机器人大脑,而是一位接管厨房运营工作的卓越项目经理。
团队协作:经理与专家
在这个新系统中,机器人大脑(VLA)是“冻结”的。这意味着我们不会重新训练它或教它新技巧。它保持原样,作为一个专注于复杂接触任务的专家。Harness VLA 系统在这一专家周围包裹了一个“经理”(AI 智能体)。
以下是他们如何协作的:
- 经理(规划者): 这是老板。它观察任务(例如,“把牛奶放进冰箱”),检查房间情况,并将工作分解为微小且符合逻辑的步骤。它使用一组精简且固定的“分析型”工具——比如移动机械臂的 GPS、一个简单的开合夹爪指令,或者一个旋转手腕的动作。这些工具就像机器人的基本反射:可预测、可靠,且非常适合在空旷空间中移动。
- 专家(冻结的 VLA): 经理只在情况变得棘手时才调用专家。当机器人需要实际抓取一个湿滑的牛奶盒、转动水龙头或按下按钮时,经理会说:“好了,专家,轮到你了!”专家完成其魔力操作,持续几秒钟后,再将控制权交还给经理。
核心秘诀:记忆笔记本
真正的魔力不仅在于这种团队协作,还在于记忆。
想象一下,经理有两个笔记本:
- 任务笔记本: 在机器人成功解决一个问题后,经理会记录下它采取的步骤序列。但酷的地方在于:经理记录的不是像“移动到 x=1.2, y=0.5”这样的精确坐标,而是记录逻辑,例如“移动到红碗处”。这样一来,如果明天碗换了位置,经理仍然可以使用相同的计划,只是重新瞄准步骤以适应新位置。
- 全局笔记本: 这是一个收集了许多不同任务中的“经验法则”和“教训”的集合。其中包含类似这样的笔记:“如果夹爪闭合但物体没有移动,说明是无效抓取——重试一次”或“在庆祝成功之前,务必检查成功信号”。
当有新任务进来时,经理会查阅这些笔记本。如果机器人失败了,经理不会直接放弃。经理会阅读“失败规则”,调整计划,重新定位机器人,并再次请求专家的帮助。这就像人类学习骑自行车:你摔倒了,你记住了哪里出了错,你调整了平衡,然后再次尝试。
这个系统不是什么
论文非常明确地说明了这个系统不做的事情。它明确反对以下两种常见观点:
- 它并不试图让机器人大脑变得更大或更聪明。 作者并没有训练一个新的、庞大的全能 AI 模型来处理一切。他们保持了大脑的冻结和精简。
- 它并不给机器人提供无限的新技能库。 经理不会在运行中即兴发明新工具。它使用一套精简且固定的工具集(移动、旋转、抓取、释放),并学习如何完美地组合它们。
论文指出,试图让一个巨大的 AI 处理所有事情(规划、移动和抓取)本身就是问题所在。通过将工作拆分,该系统变得更加可靠。
结果:它奏效了吗?
作者在多个虚拟世界中测试了该系统,从简单的桌面游戏到复杂的厨房模拟。结果令人印象深刻:
- 在名为 LIBERO-Pro 的标准测试中(指令发生了变化或物体被移动到了新位置),Harness VLA 系统的成功率比之前的最佳方法高出了 38.6 个百分点。
- 在名为 RoboCasa365 的厨房模拟中,它将成功率提高了 25.4 个百分点。
- 在名为 RoboTwin 的双臂机器人测试中,它达到了 58.4% 的成功率。
论文表明,通过让聪明的经理处理规划和记忆,并仅在实际抓取时使用冻结的“专家”大脑,机器人能够比以前更好地应对现实世界的变化。这提醒我们,有时构建超级机器人的方法不在于给它一个更大的大脑,而在于给它一个更好的经理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。