← 最新论文
💻 computer science

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1 推出了首个面向自动驾驶的统一流式视觉 - 语言 - 动作架构,该架构通过共享骨干网络与记忆通道,将自回归语言推理与基于流匹配的连续动作生成相结合,实现了语言引导的轨迹控制,在保持实时吞吐量的同时,于 WOD-E2E 基准测试中超越了人类性能。

原作者: Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下教机器人开车。长期以来,最好的方法是构建一个系统,只需观察道路并立即决定如何转向和刹车。这就像一种反射:你看到一个球向你滚来,你的手会不假思索地伸出去接住它。在论文中,这被称为**视觉到动作(VA)*模型。它极其快速且精准,但它是一个“黑盒”。你无法询问它为何*做出某个动作,而且当它看到从未见过的奇怪事物时,就会陷入困境。

随后,研究人员尝试添加一个能够交流和推理的“大脑”,从而创造出**视觉 - 语言 - 动作(VLA)**模型。其理念是:“让我们给汽车配备一个语言模型,使其能像人类一样理解世界。”但问题在于:大多数这些新系统都很笨拙。它们反应缓慢,无法像纯反射模型那样精准地转向,而且“说话”部分实际上并未帮助“驾驶”部分。这就像聘请一位才华横溢的哲学家来驾驶赛车,但这位哲学家被困在后座,大声喊出的指令因到达太晚而毫无用处。

MindVLA-U1 是作者提出的解决方案。他们主张,问题不在于“思考”与“驾驶”互不相容,而在于它们采用了错误的接口构建。

以下是 MindVLA-U1 的工作原理,使用简单的类比说明:

1. “单一大脑”架构

MindVLA-U1 不再使用一个独立的“思考”模块和一个独立的“驾驶”模块来回传递笔记,而是采用单一、统一的大脑

  • 类比:想象一位指挥家领导着一支管弦乐队。在旧系统中,指挥家(语言模型)会写下乐谱,将其交给一个独立的乐手组(动作模型),并指望他们正确演奏。而在 MindVLA-U1 中,指挥家就是乐队本身。那些理解语言(“路面结冰了”)的神经元,与计算转向角度的神经元完全相同。
  • 结果:汽车可以自然地描述其所见,同时以厘米级的精度进行驾驶,且两项任务使用相同的“权重”(记忆)。

2. “流式”记忆(不再分块)

以前的系统试图通过观看短而固定的道路片段(就像以 5 秒为一段观看电影)来学习。这导致汽车在片段边界处出现“卡顿”,忘记了刚刚发生的一秒钟内的事。

  • 类比:想象你读书时一次只看一页,然后合上书,再打开下一页。你会失去连贯性。MindVLA-U1 一次读一个词,连续不断地阅读。
  • 机制:它使用一个“流式记忆”通道。这就像一条传送带,承载着过去几秒驾驶情况的微小压缩摘要。随着汽车移动,它将最旧的摘要从传送带后端卸下,并在前端添加新的摘要。这使得汽车能够在长距离上平稳规划,而无需每次都被迫重读整个视频。

3. “意图”桥梁(语言操控方向盘)

这是论文最大的突破。在以前的系统中,汽车的“语言”仅仅是一个副作用;它实际上并不控制转向。

  • 类比:想象一个 GPS 说“左转”,但汽车无视它并继续直行。在 MindVLA-U1 中,语言部分就是方向盘。
  • 工作原理:汽车首先预测一个简单的文字“意图”(例如“直行”或“变道”)。然后,它将该词作为遥控器来引导生成驾驶路径的数学计算。如果汽车预测“直行”,数学计算就会被微调以产生直线路径。如果预测“转弯”,数学计算就会被微调以产生转弯路径。这证明了语言不仅仅是说话,它实际上在物理层面上引导着汽车的决策。

4. 快速与慢速模式(反射 vs. 思考者)

人们对 AI 汽车的一个常见抱怨是,由于它们“思考”得太深,在紧急情况下反应太慢。

  • 类比:想象一名人类驾驶员。当你在高速公路上巡航时,你依靠反射(系统 1)驾驶。当你接近复杂的十字路口时,你会思考(系统 2)。
  • 创新:MindVLA-U1 可以使用同一个大脑在这些模式之间瞬间切换。
    • 快速模式:它跳过“思考”部分,仅凭反射驾驶。其速度与旧的非说话模型一样快。
    • 慢速模式:它启动完整的语言推理功能,以解决复杂场景。
    • 优势:你既获得了思考型驾驶员的安全性,又没有牺牲反射型驾驶员的速度。

结果:超越人类

作者在非常困难的真实世界驾驶数据集(Waymo Open Dataset)上测试了该系统。

  • 得分:他们使用了一个名为“评分者反馈分数”(RFS)的指标,由人类专家在 0 到 10 的尺度上对驾驶路径的优劣进行评分。
  • 成就:MindVLA-U1 的得分为 8.20,而数据集中最佳人类驾驶员的得分为 8.13
  • 这意味着:首次有 AI 系统被证明能规划出被人类专家评为略优于经验丰富的人类驾驶员的驾驶路径,同时保持了能够谈论和推理道路情况的能力。

总结

MindVLA-U1 解决了“接口”问题。它不再将语言和驾驶视为需要粘合在一起的两项独立工作。相反,它构建了一个单一系统,其中思考与行动在同一时刻发生,利用连续的记忆流和一个直接的桥梁,让词语能够物理地操控汽车。它证明了你不必在“能说话的汽车”和“驾驶良好的汽车”之间做出选择;你可以两者兼得,而且它们实际上可以互相帮助。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →