← 最新论文
💻 computer science

OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models

该论文提出了名为 OneDrive 的统一多范式自动驾驶框架,通过在单一 Transformer 解码器中整合视觉 - 语言 - 动作模型,实现了从感知到规划任务的端到端联合优化,并在 nuScenes 和 NAVSIM 基准测试中取得了最先进的性能。

原作者: Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 OneDrive 的自动驾驶新系统。为了让你轻松理解,我们可以把自动驾驶比作一位经验丰富的“老司机”在开车,而传统的自动驾驶系统则像是一个分工过细的“流水线工厂”

1. 以前的痛点:分工太细,沟通不畅

想象一下,以前的自动驾驶系统(End-to-End Driving)像是一个大型工厂

  • 感知部门:专门负责看路(识别行人、车道线)。
  • 规划部门:专门负责想怎么开(决定加速、转弯)。
  • 语言部门:专门负责跟乘客聊天(“前面有红灯,请系好安全带”)。

问题在于:这三个部门是分开办公的,甚至用的是不同的“语言”和“工具”。

  • 感知部门用一套复杂的 3D 建模工具。
  • 语言部门用的是大语言模型(像 ChatGPT 那样,一个字一个字地说话)。
  • 规划部门又是另一套逻辑。

这就导致它们之间沟通成本很高,信息传递容易失真,而且很难把那个强大的“语言大脑”(预训练的大模型)直接用到开车上,因为它们的“思维方式”(架构)完全不同。

2. OneDrive 的创意:一位“全能型”老司机

OneDrive 的核心思想是:为什么要分三个部门?不如请一位“全能型老司机”来同时搞定所有事!

这位“老司机”(基于预训练的视觉 - 语言模型,VLM)原本就擅长:

  • 看图说话(理解图片内容)。
  • 逻辑推理(回答问题)。

OneDrive 发现,这位老司机的核心大脑(注意力机制) 其实非常强大,不仅能处理文字,也能处理开车需要的“结构化数据”(比如坐标、轨迹)。

它的创新做法(比喻版):

  1. 统一语言(Token 化)
    以前,把“看到的一辆车”和“说一句话”混在一起很难。OneDrive 把所有的信息(摄像头拍到的画面、要检测的物体、要规划的路线、要说的话)都打包成同一种“积木块”(Token),排成一列。

    • 就像把“路况照片”、“转弯指令”和“聊天内容”都写在了同一张长纸条上。
  2. 保留核心,微调手脚(混合解码器)

    • 大脑(注意力机制):OneDrive 保留了大模型原本最强大的“注意力机制”。这就像老司机的直觉和观察力,它天生就能把“眼前的景象”和“接下来的动作”联系起来。论文发现,这部分能力可以直接“迁移”到开车上,不需要大改。
    • 手脚(特定任务层):虽然大脑没变,但为了干具体的活(比如画个精准的 3D 框,或者算出精确的刹车距离),他们在浅层加了一些专用的“小工具”(任务特定的前馈网络)。
    • 结果:同一个“大脑”(Transformer 解码器),既能像写文章一样生成文字回答,又能像做数学题一样并行计算出 3D 坐标和行驶轨迹。

3. 为什么要这么做?(优势)

  • 效率更高(省时间)
    以前的系统,感知、规划、聊天要跑三个不同的程序,或者像接力赛一样一个个跑。OneDrive 是一次性跑完,就像老司机一边看路、一边想路线、一边跟乘客说话,中间没有停顿。

    • 数据:论文显示,它的反应速度比之前的先进系统快了 40%(延迟从 264 毫秒降到 156 毫秒),这对开车安全至关重要。
  • 更聪明(数据共享)
    因为所有任务都在同一个“大脑”里,感知到的信息(比如前面有行人)可以直接、自然地影响规划决策(比如减速),不需要经过复杂的转换。这就像老司机看到行人,大脑瞬间就做出了反应,而不是先告诉“感知部”,再传给“规划部”。

  • 既会开车又会聊天
    它不仅能精准地控制车辆(在测试中碰撞率极低,轨迹很准),还能保留原本大模型强大的多模态生成能力,能跟乘客进行复杂的对话,解释为什么要这样开。

4. 实验结果:真的好用吗?

作者在两个著名的自动驾驶测试场(nuScenes 和 NAVSIM)上进行了测试:

  • 开得稳:在模拟的开放道路测试中,它的轨迹误差很小,撞车率极低(只有 0.18%),是目前最好的水平之一。
  • 反应快:在封闭的闭环测试中,它的综合得分很高,而且因为不需要反复运行大模型,计算成本大幅降低

总结

OneDrive 就像是把自动驾驶系统从“三个分工明确的工人”升级成了“一位身怀绝技的超级老司机”。

它不再把“看路”、“开车”和“说话”割裂开来,而是利用大模型原本强大的注意力机制,让所有任务在一个统一的框架下协同工作。这不仅让车开得更稳、更安全,还让反应速度更快,为未来的全自动驾驶提供了一种更高效、更聪明的新思路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →