← 最新论文
💻 computer science

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

Harness VLA 是一个记忆增强型智能体框架,它通过将冻结的视觉-语言-动作模型视为可重试的富接触原语,并将其与一组固定的解析原语库进行组合,从而在无需模型微调的情况下,显著提升了这些模型在复杂操控任务中的可靠性,并在 LIBERO-Pro 和 RoboCasa365 等基准测试中实现了显著的性能提升。

原作者: Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人大脑,它在某一件特定的事情上表现得极其出色:抓取形状奇特的物体、转动粘性的旋钮或按下按钮。它就像一位世界级的厨师,能完美地切菜和煎牛排。但如果你要求这位厨师策划一场完整的晚宴、在拥挤的厨房中穿行,或者在桌子被移动后弄清楚盐罐在哪里,他们就会彻底迷失方向。他们可能会试图去切那个盐罐,因为他们是在特定的桌面布局下接受的训练;或者当指令发生轻微变化时,他们可能会陷入僵局。

这就是目前的“视觉-语言-动作”(VLA)机器人所面临的问题。它们擅长“接触”部分(触摸和移动物体),但在面对混乱或变化的情况时,处理“规划”部分的能力却很糟糕。

由此诞生了 Harness VLA。请将它视为不仅仅是一个新的机器人大脑,而是一位接管厨房运营工作的卓越项目经理。

团队协作:经理与专家

在这个新系统中,机器人大脑(VLA)是“冻结”的。这意味着我们不会重新训练它或教它新技巧。它保持原样,作为一个专注于复杂接触任务的专家。Harness VLA 系统在这一专家周围包裹了一个“经理”(AI 智能体)。

以下是他们如何协作的:

  1. 经理(规划者): 这是老板。它观察任务(例如,“把牛奶放进冰箱”),检查房间情况,并将工作分解为微小且符合逻辑的步骤。它使用一组精简且固定的“分析型”工具——比如移动机械臂的 GPS、一个简单的开合夹爪指令,或者一个旋转手腕的动作。这些工具就像机器人的基本反射:可预测、可靠,且非常适合在空旷空间中移动。
  2. 专家(冻结的 VLA): 经理只在情况变得棘手时才调用专家。当机器人需要实际抓取一个湿滑的牛奶盒、转动水龙头或按下按钮时,经理会说:“好了,专家,轮到你了!”专家完成其魔力操作,持续几秒钟后,再将控制权交还给经理。

核心秘诀:记忆笔记本

真正的魔力不仅在于这种团队协作,还在于记忆。

想象一下,经理有两个笔记本:

  • 任务笔记本: 在机器人成功解决一个问题后,经理会记录下它采取的步骤序列。但酷的地方在于:经理记录的不是像“移动到 x=1.2, y=0.5”这样的精确坐标,而是记录逻辑,例如“移动到红碗处”。这样一来,如果明天碗换了位置,经理仍然可以使用相同的计划,只是重新瞄准步骤以适应新位置。
  • 全局笔记本: 这是一个收集了许多不同任务中的“经验法则”和“教训”的集合。其中包含类似这样的笔记:“如果夹爪闭合但物体没有移动,说明是无效抓取——重试一次”或“在庆祝成功之前,务必检查成功信号”。

当有新任务进来时,经理会查阅这些笔记本。如果机器人失败了,经理不会直接放弃。经理会阅读“失败规则”,调整计划,重新定位机器人,并再次请求专家的帮助。这就像人类学习骑自行车:你摔倒了,你记住了哪里出了错,你调整了平衡,然后再次尝试。

这个系统不是什么

论文非常明确地说明了这个系统不做的事情。它明确反对以下两种常见观点:

  1. 它并不试图让机器人大脑变得更大或更聪明。 作者并没有训练一个新的、庞大的全能 AI 模型来处理一切。他们保持了大脑的冻结和精简。
  2. 它并不给机器人提供无限的新技能库。 经理不会在运行中即兴发明新工具。它使用一套精简且固定的工具集(移动、旋转、抓取、释放),并学习如何完美地组合它们。

论文指出,试图让一个巨大的 AI 处理所有事情(规划、移动和抓取)本身就是问题所在。通过将工作拆分,该系统变得更加可靠。

结果:它奏效了吗?

作者在多个虚拟世界中测试了该系统,从简单的桌面游戏到复杂的厨房模拟。结果令人印象深刻:

  • 在名为 LIBERO-Pro 的标准测试中(指令发生了变化或物体被移动到了新位置),Harness VLA 系统的成功率比之前的最佳方法高出了 38.6 个百分点。
  • 在名为 RoboCasa365 的厨房模拟中,它将成功率提高了 25.4 个百分点。
  • 在名为 RoboTwin 的双臂机器人测试中,它达到了 58.4% 的成功率。

论文表明,通过让聪明的经理处理规划和记忆,并仅在实际抓取时使用冻结的“专家”大脑,机器人能够比以前更好地应对现实世界的变化。这提醒我们,有时构建超级机器人的方法不在于给它一个更大的大脑,而在于给它一个更好的经理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →