← 最新论文
💻 computer science

ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

ChainVLA 是一个拥有 12 亿参数的视觉-语言-动作策略,它通过将连续查询链入一个统一且可修正的执行状态(该状态结合了用于任务进度的循环工作记忆和用于连续动作生成的运动尾随),实现了卓越的长时程操控性能。

原作者: Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人清理你凌乱的房间。你给它一个简单的指令:“把玩具收好。”一个以微小、孤立步骤进行思考的机器人可能会看着地板,拿起一个红色的积木,然后把它放进盒子里。接着,它停了下来。它忘记了自己刚刚拿起了那个积木。它再次看向地板,看到了一个蓝色的积木,然后又把它拿了起来。但如果那个红色的积木原本应该是放在蓝色积木下面呢?或者如果机器人需要记住它已经清理了房间的左侧,所以不应该再回到那里呢?这就是“长程操控”(long-horizon manipulation)的挑战。这不仅仅是移动机械臂的问题;它关乎在双手忙碌时,如何在脑海中维持一个连贯的故事。

在机器人领域,科学家们使用一种叫做视觉-语言-动作(Vision-Language-Action,简称 VLA)策略的东西。把这些看作是机器人的大脑,它通过摄像头观察(视觉),阅读你的指令(语言),并决定做什么(动作)。通常,这些大脑是以短促的爆发式工作的。它们为接下来的几秒钟制定一个计划,执行这些动作,然后立即停止,从头开始制定一个新的计划。这就像是在写小说时,写完一句话,就抹掉对前一句话的记忆,然后仅凭当前这一页的内容去猜测下一句该写什么。问题在于,机器人经常会丢掉故事的线索。它会忘记自己刚刚完成了什么,或者因为它新的计划与正在进行的动作发生冲突而感到困惑。这篇论文提出了一个问题:我们如何让机器人既能记住它的故事,又能保持动作的流畅,同时还能实时观察世界?


拥有记忆与动量的机器人

见见 ChainVLA。这是研究人员设计的一种新型机器人大脑,旨在解决“健忘机器人”的问题。想象一下你在蜿蜒的小路上骑自行车。为了保持平衡,你需要两样东西:你需要记住你走过的路(刚才转弯了吗?前面有坡吗?),并且你需要保持平稳地踩踏,这样才不会摇晃跌倒。ChainVLA 的设计初衷正是为机器人手臂实现这一点。

如今大多数机器人大脑的工作方式就像是一个人:拍一张照片,做一个决定,放下照片,再拍一张新照片,再做一个新决定。它们不会将前一个决定的“感觉”带入下一个决策中。ChainVLA 通过将这些决策串联起来,改变了游戏规则。它创建了一个特殊的“执行状态”,就像机器人背着的一个背包。这个背包有两个非常重要的隔层:

  1. “故事”隔层(进度上下文/Progress Context): 它保存了机器人已经实现的成就记忆。它就像一个心理清单。如果机器人刚刚把一个积木移到了左边,这个隔层就会记住:“好的,左边已经清理干净了。”它结合了快速的短期记忆(正在发生的事情)和稀疏的长期记忆(过去发生的重要事件,比如“我先移动了红色积木”)。这有助于机器人了解自己在宏观任务中所处的阶段。
  2. “动量”隔层(运动尾迹/Motion Tail): 这是最酷的部分。当机器人决定移动时,它不仅仅是说“向前移动”。它会预测接下来几秒钟内的一整套动作序列。但在它停下来重新思考之前,它实际上只执行前几个动作。 “运动尾迹”就是那部分尚未完成的预测计划。ChainVLA 保存了这个未完成的计划,并将其反馈到机器人的大脑中进行下一步。这就像一个跑步者,即使在停下来系鞋带后,依然记得自己刚才跑的速度和方向,因此不需要从静止状态重新开始。

实际应用中的运作方式

研究人员在一些棘手的任务上测试了这个想法。其中最难的任务之一叫做“放回积木”(Put Back Block)。想象机器人必须把一个积木移动到一个位置,然后移动另一个物体,最后把那个积木放回原来的位置。问题在于?当机器人准备放回积木时,原来的位置可能已经被新物体挡住了摄像头的视线。普通的机器人会看着摄像头,发现什么也看不见,然后陷入混乱。它会忘记那个位置在哪里。

然而,ChainVLA 使用它的“故事”隔层来记住:“嘿,我刚才把那个积木放在那里了,即使我现在看不见它。”与此同时,它的“动量”隔层确保当它移动去放回积木时,不会因为机械臂指向了一个与刚才动作产生冲突的奇怪新方向而猛烈甩动。

结果非常显著。在一次名为 RMBench 的高难度测试中,ChainVLA 的成功率达到了 62.8%。对比一下其他智能机器人:

  • 如果你拿掉“故事”(进度上下文),成功率会暴跌至 3.0%。机器人完全忘记了任务。
  • 如果你拿掉“动量”(运动尾迹),成功率会降至 11.2%。机器人记住了任务,但动作过于笨拙,导致失败。

这表明这两个部分都是必不可少的。“故事”告诉机器人要做什么,而“动量”帮助它平稳地完成动作,而不至于被自己的脚步绊倒。

为什么这很重要

论文指出,保持“未完成动作”的活跃状态对于记住任务其实至关重要。这有点像跳舞:如果你在每一步之间完全停止舞蹈,你可能会忘记节奏。但如果你保持节奏(运动尾迹),你的大脑会更好地记住编舞(进度上下文)。

当研究人员尝试通过仅仅在机器人已经决定好动作之后再去平滑处理动作(这是其他机器人常用的技巧)来修复机器人的笨拙感时,这种方法并没有奏效。机器人仍然失败了。这证明了秘诀不仅仅在于让动作看起来好看;而是在机器人做出新决定之前,就将下一个动作的“想法”喂给它的大脑。

简而言之,ChainVLA 表明,为了处理长期的、复杂的任务,机器人需要减少像“拍照记录”那样工作,而更多地像一个永远不会在书中迷失方向的讲故事的人,同时还要保持脚步随着音乐的节拍不断律动。这是迈向让机器人能够真正协助我们处理现实生活中繁琐、多步骤家务的一小步,而不会让它们感到困惑或丢三落四。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →