← 最新论文
💻 computer science

Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

Drive-JEPA 通过将用于预测性表示学习的视频联合嵌入预测架构 (V-JEPA) 与一种通过蒸馏多模态模拟器生成的轨迹来克服单轨迹监督局限性的以提议为中心的规划器相结合,建立了端到端自动驾驶的新标杆。

原作者: Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng Lu

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,不仅仅是通过展示几个人类驾驶的示例来教导一辆自动驾驶汽车,而是给它一个海量的驾驶电影库进行学习,然后让它在一个超先进的视频游戏模拟器中进行练习。这本质上就是 Drive-JEPA 所做的事情。

以下是利用简单的类比对这一新系统工作原理的详细解析:

1. 问题所在:“单一路径”陷阱

如今大多数自动驾驶汽车是通过观察人类驾驶员来学习的。但问题在于:在任何给定的情境下(比如接近黄灯时),人类通常只会采取一种特定的行动。然而在现实世界中,处理某种情况通常有很多种安全的方式(例如,你可以轻缓减速,也可以完全停车)。

如果汽车只学习那条单一的人类路径,它就会陷入“死板”的思维,认为只有一种驾驶方式。它会变得僵化,并可能错过其他安全、舒适的选择。这被称为模式崩溃(mode collapse)——汽车忘记了解决问题还有多种方法。

2. 解决方案:Drive-JEPA

研究人员构建了一个由三部分组成的系统来解决这个问题,它就像一位拥有时光机和游戏机的顶级驾驶教练。

A 部分:“电影达人”预训练 (V-JEPA)

汽车不仅仅是记忆特定的转弯动作,它首先要观看数千小时的原始驾驶视频。

  • 类比: 想象一名学生在还没被告知该做什么之前,先看了数千小时的驾驶电影。他们学习了驾驶的“语法”:车辆如何移动、交通流如何变化以及世界如何随时间演变。
  • 技术: 他们使用了名为 V-JEPA 的技术。可以把这想象成一个针对视频的“填空游戏”。计算机隐藏掉视频中的一块内容,并要求 AI 预测接下来会发生什么。通过进行数百万次的这种练习,AI 构建了对驾驶世界的深度直觉理解,而无需为每一个物体都进行标注。这使得汽车在开始学习转向之前,就拥有了一个强大的“大脑”。

B 部分:“模拟器教练” (多模态轨迹蒸馏)

一旦 AI 拥有了“大脑”,它就需要学习如何做出决策。通常情况下,它只能看到人类采取的那一条路径。Drive-JEPA 通过引入一个模拟器教练改变了游戏规则。

  • 类比: 想象一名驾驶学生在视频游戏中练习。游戏可以生成成千上万种不同的“假设”场景。也许在某个版本的模拟中,汽车向左转向;在另一个版本中,它猛踩刹车;在第三个版本中,它在车流中穿梭。所有这些都是安全且合法的。
  • 技术: 该系统使用基于规则的模拟器为每个场景生成许多不同的安全路径(轨迹)。然后,它教会 AI 识别并重视所有这些不同的选项,而不仅仅是人类采取的那条单一路径。这被称为多模态轨迹蒸馏(Multimodal Trajectory Distillation)。这就像是在告诉 AI:“这里不只有唯一正确的答案;这里有五种不同的安全处理这个路口的方案。”

C 部分:“平滑过滤器” (动量感知选择)

现在 AI 有了一堆不同的路径可以供其选择。它如何挑选出最好的那一个呢?

  • 类比: 想象你正在走廊里行走。如果你突然身体向左猛地一甩,接着向右,再向左,你会感到头晕和不适。你希望移动得平稳顺畅。
  • 技术: 系统包含一个**动量感知选择(Momentum-Aware Selection)**模块。它会查看汽车在前一瞬间采取的路径,并检查新的选项。如果某个选项需要突然、剧烈的方向改变,系统就会对其进行惩罚。它会选择不仅安全,而且让乘客感到平滑、自然的路径,从而避免“颠簸”驾驶。

结果

当他们在标准驾驶基准测试(如 NAVSIM 和 Bench2Drive)上测试该系统时,结果令人印象深刻:

  • 更聪明的决策: 它的表现优于以往的最先进方法,刷新了安全性和平滑性的新纪录。
  • 少即是多: 即使我们去掉了所有的“感知”传感器(如 LiDAR),仅使用单个前视摄像头,该系统的表现仍然优于其他系统。这证明了“电影达人”式的预训练为汽车打下了极其坚实的基础。
  • 更平稳的乘坐体验: 通过使用动量过滤器,汽车驾驶得更加舒适,避免了突然、剧烈的动作。

总结

Drive-JEPA 就像是带一名自动驾驶汽车学生,通过观看数千部电影让他们获得驾驶理论的博士学位,让他们在可以看到每一种可能安全结果的视频游戏中进行练习,最后教他们如何选择最平滑、最舒适的路径。其结果是,汽车的驾驶方式更像是一个理解交通“流动感”的高手,而不是一个仅仅在地图上复制单条线路的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →