想象你正在驾驶一辆汽车。如今大多数自动驾驶汽车就像被动的乘客。它们透过车窗观察,看到前方有车,便立即踩下刹车。它们只会对当下正在发生的事情做出反应。如果一辆车突然从侧面变道闯入它们的车道,被动型汽车可能反应太慢,直到为时已晚才意识到危险。
本文介绍了ProDrive,这是一种更像经验丰富、具有前瞻性的人类驾驶员的驾驶方式。ProDrive 不再仅仅关注保险杠正前方的路面,而是不断自问:“如果我这样做,接下来会发生什么?如果那辆车那样做,整个场景将如何变化?”
以下是 ProDrive 的工作原理,分解为简单概念:
1. 双脑系统
ProDrive 使用两个专门化的“大脑”,它们持续相互沟通:
- 规划器(驾驶员): 这个大脑观察当前路况,列出一系列可能的路径(例如“左转”、“直行”或“减速”)。它不只选择一个选项,而是生成多种方案。
- 世界模型(水晶球): 这个大脑将这些可能的路径在脑海中进行模拟。它会问:“好吧,如果汽车左转,接下来几秒我们周围的交通状况会如何变化?我们会撞到行人吗?我们会被困住吗?”
2. 秘诀:“自车 - 环境协同演化”
在旧系统中,“驾驶员”和“水晶球”就像在两个不同房间工作的人。驾驶员制定计划,将其发送给水晶球,而水晶球只会回答“好”或“坏”。
ProDrive 通过将两者紧密结合改变了游戏规则。
- 驾驶员向水晶球低语: 驾驶员不再仅仅说“我要左转”,而是发送一条特殊消息(称为“自车标记”),解释为什么它想左转以及它的思考过程。这有助于水晶球理解驾驶员的意图。
- 水晶球回传低语: 水晶球不只是给出一个评分;它会将一个“梯度”(学习信号)一直反馈给驾驶员。这就像水晶球在说:“如果你左转,三秒后你会被困住,所以你现在就需要改变计划。”
这种来回互动发生得如此迅速,以至于汽车学会基于未来而非仅仅基于当下做出决策。这就像下棋:你移动棋子不仅仅是因为它此刻看起来不错,而是因为你预见到三步之后的走法将有助于你获胜。
3. 结果:看见不可见之物
得益于这种团队协作,ProDrive 能够预判其他汽车会忽略的危险。
- 类比: 想象你穿过一个拥挤的市场。被动型行人看到前方有人就会停下。而具有前瞻性的行人(如 ProDrive)则会看到有人从侧面跑向他们,并在碰撞甚至可能发生之前就侧身避让。
- 论文证明: 在名为NAVSIM的困难驾驶数据集上进行测试时,ProDrive 比其他顶级自动驾驶系统更安全、更高效,且犯错更少。它在避免碰撞方面表现更佳,并能保持车辆平稳行驶而不陷入停滞。
总结
ProDrive 是一个自动驾驶系统,它不再仅仅对道路做出“反应”,而是开始“想象”未来。通过让规划大脑和预测大脑作为一个团队协同工作,它能够做出更智能、更安全、更像人类的决策,在事故甚至发生之前就加以避免。
以下是论文《ProDrive:通过自车 - 环境协同演进的主动规划实现自动驾驶》的详细技术总结。
1. 问题陈述
当前的端到端自动驾驶规划器主要是反应式的。它们仅基于当前的传感器观测(图像、激光雷达、状态)生成轨迹,而没有显式地建模环境将如何响应自车动作而演变。
- 局限性: 这种短视的方法无法预判未来的场景动态,导致决策次优、出现安全关键性故障,且无法有效处理复杂的多智能体交互。
- 现有研究的空白: 虽然“世界模型”可用于预测未来状态,但它们通常仅作为辅助工具(例如用于数据生成、仿真或事后重排序),而非紧密集成到规划器的决策过程中。因此,规划器无法从未来预测中获得直接的梯度反馈,以塑造其内部决策逻辑。
2. 方法论:ProDrive 框架
ProDrive 提出了一种实现自车 - 环境协同演进的主动规划框架。它以端到端的方式联合训练以查询为中心的轨迹规划器和鸟瞰图(BEV)世界模型。
核心架构
该系统由两个紧密耦合的模块组成:
A. 自车模块(以查询为中心的规划器)
- 输入: 多视角图像、激光雷达和自车状态。
- 机制: 基于 BEVFormer 架构,它使用可学习的**自车查询(ego queries)**来生成多样化的候选轨迹。
- 迭代优化: 自车 token 经过 L 个阶段的优化。在每一阶段中:
- 解码: 一个多层感知机(MLP)将 token 解码为轨迹航点。
- 优化: 可变形交叉注意力机制通过关注提议航点特定空间位置的图像特征,来更新自车 token。
- 输出: 一组 K 个候选轨迹以及经过优化的自车 token(Q(L)),这些 token 编码了规划感知的语义信息。
B. 环境模块(BEV 世界模型)
- 输入: 当前 BEV 状态、自车状态以及自车 Token(从规划器注入)。
- 机制: 一个基于循环 Transformer 的模型,在 N 次迭代中预测未来的 BEV 场景演变。
- 关键创新: 与依赖原始坐标或通用潜在特征的标准世界模型不同,ProDrive 将优化的自车 token直接注入世界模型。这使得未来预测不仅取决于汽车将去往何处,还取决于规划器为何选择该运动(即规划感知的上下文)。
- 输出: 预测的未来 BEV 状态,以及基于安全性、舒适性和效率为每个候选轨迹计算的奖励分数。
C. 自车 - 环境耦合(“协同演进”机制)
- 双向流动:
- 前向: 规划器提供自车 token 以引导世界模型的未来预测。
- 后向: 世界模型并行评估所有候选项,并将感知未来的梯度反向传播给规划器。
- 结果: 规划器不再仅基于当前观测进行优化,而是显式地由场景预期的未来演变所塑造。
训练目标
该系统通过多任务损失函数进行端到端训练:
- 轨迹损失: 用于准确路径生成的回归损失及多样性正则化。
- 奖励损失: 监督世界模型预测模仿奖励(与专家的距离)和仿真奖励(避障、可行驶区域、进展)。
- 对齐损失: 使规划器的内部评分与世界模型预测的奖励保持一致。
- 语义损失: 确保世界模型准确预测未来的 BEV 语义地图(例如其他智能体的占用情况)。
3. 主要贡献
- 主动规划框架: 提出了 ProDrive,这是首个通过自车 - 环境协同演进将轨迹规划器与世界模型紧密耦合的框架,超越了反应式、观测驱动的规划。
- 规划感知的自车 Token 注入: 一种新颖机制,将规划器优化的决策 token 注入世界模型。这保留了规划器的内部决策语义,使世界模型能够基于特定的规划意图进行“假设”推理。
- 端到端梯度反馈: 建立了双向梯度流,其中未来场景预测直接塑造规划器的优化过程,使系统能够学习预判交互的主动行为。
- 最先进的性能: 在极具挑战性的 NAVSIM 基准测试中,展示了安全性和规划效率的显著提升。
4. 实验结果
该方法在 NAVSIM v1 上进行了评估,这是一个专为具有挑战性的交互式驾驶场景设计的基准测试。
- 主要指标: 预测驾驶员模型分数(PDMS),综合了安全性(无责任碰撞、碰撞时间)、规则遵守(可行驶区域合规性)以及效率/舒适性。
- 性能表现: ProDrive 实现了 86.6 的 PDMS,优于所有强基线模型(包括反应式端到端模型如 UniAD、VADv2,以及主动基线模型如 LAW 和 FSDrive)。
- 安全性: 98.0% 无责任碰撞(NC),93.7% 碰撞时间(TTC)。
- 效率: 80.7% 自车进展(EP)。
- 消融实验:
- 无世界模型: PDMS 降至 83.5,证明显式的未来建模对安全性至关重要。
- 无自车 Token 注入: PDMS 降至 85.5,证实注入规划语义提高了世界模型预测相关未来状态的能力。
- 无主动梯度: PDMS 降至 85.8,验证了感知未来的梯度反向流动对于塑造规划器至关重要。
5. 意义
ProDrive 代表了自动驾驶研究范式的转变:
- 从反应式到主动式: 它证明了自主智能体可以学会预判未来的交互,而不仅仅是对当前做出反应。
- 统一架构: 它弥合了轨迹预测(通常被视为独立模块)与规划之间的鸿沟,构建了一个统一系统,使未来推理成为首要的训练信号。
- 安全性与效率: 通过显式建模自车与环境的协同演进,ProDrive 产生了更具前瞻性、更安全且高效的驾驶行为,特别是在简单反应式规则失效的复杂多智能体场景中。
这项工作指出了未来的发展方向,即自动驾驶系统将由学习到的未来场景演变预测所引导,从而实现可与经验丰富的驾驶员相媲美的“远见”能力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。