OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
该论文提出了名为 OneDrive 的统一多范式自动驾驶框架,通过在单一 Transformer 解码器中整合视觉 - 语言 - 动作模型,实现了从感知到规划任务的端到端联合优化,并在 nuScenes 和 NAVSIM 基准测试中取得了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 OneDrive 的自动驾驶新系统。为了让你轻松理解,我们可以把自动驾驶比作一位经验丰富的“老司机”在开车,而传统的自动驾驶系统则像是一个分工过细的“流水线工厂”。
1. 以前的痛点:分工太细,沟通不畅
想象一下,以前的自动驾驶系统(End-to-End Driving)像是一个大型工厂:
- 感知部门:专门负责看路(识别行人、车道线)。
- 规划部门:专门负责想怎么开(决定加速、转弯)。
- 语言部门:专门负责跟乘客聊天(“前面有红灯,请系好安全带”)。
问题在于:这三个部门是分开办公的,甚至用的是不同的“语言”和“工具”。
- 感知部门用一套复杂的 3D 建模工具。
- 语言部门用的是大语言模型(像 ChatGPT 那样,一个字一个字地说话)。
- 规划部门又是另一套逻辑。
这就导致它们之间沟通成本很高,信息传递容易失真,而且很难把那个强大的“语言大脑”(预训练的大模型)直接用到开车上,因为它们的“思维方式”(架构)完全不同。
2. OneDrive 的创意:一位“全能型”老司机
OneDrive 的核心思想是:为什么要分三个部门?不如请一位“全能型老司机”来同时搞定所有事!
这位“老司机”(基于预训练的视觉 - 语言模型,VLM)原本就擅长:
- 看图说话(理解图片内容)。
- 逻辑推理(回答问题)。
OneDrive 发现,这位老司机的核心大脑(注意力机制) 其实非常强大,不仅能处理文字,也能处理开车需要的“结构化数据”(比如坐标、轨迹)。
它的创新做法(比喻版):
统一语言(Token 化):
以前,把“看到的一辆车”和“说一句话”混在一起很难。OneDrive 把所有的信息(摄像头拍到的画面、要检测的物体、要规划的路线、要说的话)都打包成同一种“积木块”(Token),排成一列。- 就像把“路况照片”、“转弯指令”和“聊天内容”都写在了同一张长纸条上。
保留核心,微调手脚(混合解码器):
- 大脑(注意力机制):OneDrive 保留了大模型原本最强大的“注意力机制”。这就像老司机的直觉和观察力,它天生就能把“眼前的景象”和“接下来的动作”联系起来。论文发现,这部分能力可以直接“迁移”到开车上,不需要大改。
- 手脚(特定任务层):虽然大脑没变,但为了干具体的活(比如画个精准的 3D 框,或者算出精确的刹车距离),他们在浅层加了一些专用的“小工具”(任务特定的前馈网络)。
- 结果:同一个“大脑”(Transformer 解码器),既能像写文章一样生成文字回答,又能像做数学题一样并行计算出 3D 坐标和行驶轨迹。
3. 为什么要这么做?(优势)
效率更高(省时间):
以前的系统,感知、规划、聊天要跑三个不同的程序,或者像接力赛一样一个个跑。OneDrive 是一次性跑完,就像老司机一边看路、一边想路线、一边跟乘客说话,中间没有停顿。- 数据:论文显示,它的反应速度比之前的先进系统快了 40%(延迟从 264 毫秒降到 156 毫秒),这对开车安全至关重要。
更聪明(数据共享):
因为所有任务都在同一个“大脑”里,感知到的信息(比如前面有行人)可以直接、自然地影响规划决策(比如减速),不需要经过复杂的转换。这就像老司机看到行人,大脑瞬间就做出了反应,而不是先告诉“感知部”,再传给“规划部”。既会开车又会聊天:
它不仅能精准地控制车辆(在测试中碰撞率极低,轨迹很准),还能保留原本大模型强大的多模态生成能力,能跟乘客进行复杂的对话,解释为什么要这样开。
4. 实验结果:真的好用吗?
作者在两个著名的自动驾驶测试场(nuScenes 和 NAVSIM)上进行了测试:
- 开得稳:在模拟的开放道路测试中,它的轨迹误差很小,撞车率极低(只有 0.18%),是目前最好的水平之一。
- 反应快:在封闭的闭环测试中,它的综合得分很高,而且因为不需要反复运行大模型,计算成本大幅降低。
总结
OneDrive 就像是把自动驾驶系统从“三个分工明确的工人”升级成了“一位身怀绝技的超级老司机”。
它不再把“看路”、“开车”和“说话”割裂开来,而是利用大模型原本强大的注意力机制,让所有任务在一个统一的框架下协同工作。这不仅让车开得更稳、更安全,还让反应速度更快,为未来的全自动驾驶提供了一种更高效、更聪明的新思路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。