← 最新论文
💻 computer science

DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving

DriveWorld-VLA 是一个新颖的框架,它将视觉-语言-动作(Vision-Language-Action)规划与共享潜空间中的世界模型统一起来,以实现可控的、以动作为条件的场景想象并提升自动驾驶决策能力,在 NAVSIM 和 nuScenes 基准测试中达到了最先进的性能。

原作者: Feiyang jia, Lin Liu, Ziying Song, Caiyan Jia, Hangjun Ye, Xiaoshuai Hao, Long Chen

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Feiyang jia, Lin Liu, Ziying Song, Caiyan Jia, Hangjun Ye, Xiaoshuai Hao, Long Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一辆自动驾驶汽车如何开车。目前大多数方法就像是通过展示一段完美驾驶的视频来教学生:“照着这个做。”如果学生看到红灯,他们就停下;如果看到绿灯,他们就前进。但如果发生了意料之外的情况——比如一个球滚到了街上——他们可能会惊慌失措,因为他们并没有理解事物发生的“原因”,而仅仅是学会了“做什么”。

这篇论文介绍了一种名为 DriveWorld-VLA 的新方法,它更像是赋予汽车一种在行动之前先“想象未来”的“超能力”。

以下是其工作原理的拆解,通过简单的概念进行说明:

1. 问题所在:两个独立的脑区

此前,研究人员尝试结合两种类型的 AI:

  • “感知”脑 (VLA): 这部分负责观察道路、识别标志并理解语言。它像是一位非常聪明的驾驶员,深谙交通规则。
  • “想象”脑 (世界模型): 这部分负责模拟未来。它像是一个水晶球,会说:“如果我在这里左转,我可能会撞到那棵树。”

旧的方法是让这两个大脑独立工作。当“感知”脑询问“想象”脑时,“感知”脑会问:“如果我左转会发生什么?”“想象”脑会给出回答,但由于它们是脱节的,所以“感知”脑并不能真正从这个答案中学习。这就像是向朋友寻求建议,却忽略了对方的推理逻辑。

2. 解决方案:一个统一的心智

DriveWorld-VLA 将这两个大脑融合为一个统一的系统。它们不再是两个独立的房间,而是现在共享同一个办公室。

  • 共享语言 (潜空间/Latent Space): 想象汽车的大脑使用一种秘密代码。既负责“观察”的部分和负责“想象”的部分都使用同一种秘密代码。当汽车看到一名行人时,它不仅仅是看到了一张图像;它将该图像转化为这种秘密代码。随后,“想象”部分利用这段完全相同的代码来模拟接下来的情况。这意味着汽车真正理解了物理世界的规律,而不仅仅是看到了图像。

3. “如果……会怎样”的超能力

最大的创新在于 动作条件的“如果……会怎样”推理 (Action-Conditioned "What-If" Reasoning)

你可以把它想象成一款可以在提交动作前暂停并尝试不同招式的视频游戏:

  • 旧的方法: 汽车看到停止标志,然后停车。
  • DriveWorld-VLA: 汽车思考:“好吧,我有三个选择:停车、减速或加速。”
    • 它会在脑海中瞬间想象出这三种选择对应的未来。
    • 它看到“加速”在想象中会导致碰撞。
    • 它看到“停车”会导致安全的结果。
    • 然后,它选择了那条安全的路径。

它不仅仅是对“现在”正在发生的事情做出反应;它会在脑海中主动测试不同的未来,以挑选出最佳方案。

4. 他们是如何教学的(三阶段训练)

你不能直接开启这个系统并期望它能正常工作。作者通过三个步骤训练它,就像在视频游戏中升级一样:

  • 第一阶段:学习基础知识。 汽车学习观察道路,并预测几秒钟后道路的样子,同时学习预测人类驾驶员会做出什么行为。它在学习“观察”的同时也在学习“移动”。
  • 第二阶段:学习控制。 现在,汽车学习到它的动作会改变未来。如果它向左转向,未来的图像必须显示汽车位于左侧。它学会了如何控制自己的“水晶球”。
  • 第三阶段:最终考试 (闭环)。 这是最重要的一部分。汽车预测一个动作,想象未来的结果,然后询问自己:“这是一个好的动作吗?”如果想象中的未来看起来很危险,它会得到一个“低分”,并学习在下次尝试不同的动作。它从自己的想象中学习。

5. 结果

论文在真实世界的驾驶数据集(如 NAVSIM 和 nuScenes)上测试了这个系统。

  • 安全性: 它的碰撞率显著低于其他顶尖方法(在测试中碰撞率仅为 0.16%)。
  • 效率: 它能够平稳地向前行驶,不会卡顿或表现得过于谨慎。
  • 对比: 它击败了其他试图结合视觉与想象但未能实现紧密统一的先进系统。

总结

DriveWorld-VLA 就像是给了自动驾驶汽车一个心理演练空间。它不再只是对道路做出反应,而是不断在脑海中运行“模拟”,以测试不同的动作。通过让“观察”和“想象”的部分使用同一种语言,汽车做出了更聪明、更安全且更像人类的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →