想象一下,你正在教一辆自动驾驶汽车在繁忙的城市中行驶。大多数现有系统就像一个只死记硬背了单条“最佳”路线的学生。当它们看到某种情况时,会立即选择一条路径并坚持到底,即使它们并不确定。如果那个单一的选择是错误的,汽车可能会发生碰撞。
本文介绍了一种名为EnDfuser(集成扩散器)的新系统。它不像强迫汽车只选择一条路径,而是像一个谨慎的驾驶员,同时设想多种可能的未来。
以下是其工作原理,分解为简单的概念:
1. “水晶球”方法(扩散模型)
传统的规划就像问朋友:“我该往哪转?”然后得到一个答案:“左转。”
EnDfuser 使用一种称为扩散模型的技术。这就像一位雕塑家从一块充满噪音、形状模糊的黏土开始。该模型从一堆随机、混乱的想法(噪音)开始,然后逐步“去噪”,一步步进行细化,直到它们变成清晰、平滑的路径。
这里的魔法在于,EnDfuser 不是只制作一个雕塑,而是从同一个起点制作128 个不同的雕塑(候选轨迹)。
- 类比:想象你正要过马路。普通系统看一眼就说:“我现在过马路。”EnDfuser 看一眼后则会想:“我可以现在过,也可以等待,可以慢慢过,或者停下来。”它在眨眼间生成了 128 种不同的“如果……会怎样”的情景。
2. 衡量置信度(不确定性)
由于 EnDfuser 生成了 128 条不同的路径,团队可以观察这些路径彼此之间的一致性程度。
- 高度一致:如果所有 128 条路径看起来几乎相同(例如,它们都说“温和地左转”),那么汽车就是自信的。
- 低度一致:如果路径杂乱无章(有的说“左转”,有的说“停车”,有的说“直行”),那么汽车就是不确定的。
该论文利用这些路径的速度来衡量这种不确定性。如果 128 条路径建议的速度差异巨大,系统就知道这种情况很棘手。
3. “安全刹车”规则
研究人员基于这种不确定性测试了一条非常简单的规则:
- 规则:“如果汽车感到困惑(关于速度的不确定性很高),就踩刹车。”
- 结果:通过仅在系统不确定时添加这个简单的“恐慌刹车”,汽车的行驶表现略有提升(测试分数提高了 1.7%),并且碰撞更少。做出这一决定并不需要复杂的 AI;它只需要倾听自己的困惑即可。
4. 他们学到了什么?(“不确定性地图”)
通过观察汽车在哪里感到困惑,研究人员发现不确定性会在特定地点激增:
- 交叉路口和弯道:这很合理;这些是复杂区域,其他车辆可能会做出意想不到的举动。
- 动态交互:当汽车变道或与其他移动车辆交叉路径时,"128 条路径”会出现分歧,发出危险信号。
- 数据错误:有时汽车感到困惑是因为它从中学习的训练数据略有混乱(就像老师给学生一张稍微错误的地图)。系统将这些地点标记为“不确定”,实际上有助于发现数据本身的错误。
总结
该论文声称,通过使用集成扩散,他们创建了一个不仅猜测一个未来,而是模拟多个未来的自动驾驶系统。通过观察这些模拟在多大程度上存在分歧,汽车可以判断自己是否处于危险或混乱的情况中并减速。这个简单的技巧使汽车在测试中更安全、更可靠,证明了“知道自己不知道什么”是自动驾驶的一项有力工具。
技术摘要:EnDfuser——用于端到端自动驾驶的不确定性估计的集成扩散模型
问题陈述
端到端(E2E)自动驾驶(AD)系统正在快速发展,特别是在 CARLA 等闭环仿真环境中。然而,一个显著的局限性依然存在:许多 E2E 规划系统要么在规划过程中忽略不确定性,要么依赖缺乏通用性的专用表示。在自动驾驶领域,不确定性量化(UQ)至关重要,因为不可靠的预测可能导致灾难性后果。不确定性的来源包括传感器噪声、分布偏移以及架构缺陷。虽然先前的方法曾尝试使用贝叶斯方法、蒙特卡洛 Dropout 或集成学习来解决这一问题,但仍需要一种能够将不确定性建模直接集成到轨迹规划模块中的方法,而无需复杂的架构变更或专用的离散分类器。
方法论
作者提出了EnDfuser,这是一个利用去噪扩散概率模型(DDPM)作为轨迹规划器的端到端驾驶系统。该系统旨在建模轨迹的后验分布,从而通过集成扩散为不确定性估计提供自然机制。
架构
EnDfuser 建立在TransFuser++(TF++)的感知骨干网络之上,该网络融合了 RGB 图像和激光雷达鸟瞰图(BEV)特征。然而,它将 TF++ 的 Transformer+GRU 规划模块替换为扩散 Transformer。
- 输入条件化:扩散模型以丰富的 BEV 特征为条件,这些特征包括驾驶指令(目标点)、当前速度以及扩散步长 k。
- 轨迹表示:输出是一组 8 个航点,间隔 250 毫秒,代表 2 秒的规划视界。
- 集成生成:EnDfuser 不承诺单一的点估计,而是从单个感知帧中生成候选轨迹的分布(实验中具体为 128 个候选轨迹)。这是通过在 GPU 上进行并行批量采样实现的。
- 推理效率:系统采用**DDIM(去噪扩散隐式模型)**调度,仅需 2 个去噪步骤即可生成高质量轨迹,确保实时性能(约 29 FPS)。
不确定性量化
核心创新在于利用生成的轨迹集成来估计不确定性:
- 转换为控制指令:利用源自 TF++ PID 控制器的逻辑,将 128 个轨迹候选集(Tt)转换为一组控制指令(Kt),即期望速度和偏航角。
- 方差计算:系统计算 128 个候选项中预测速度分布的方差(σ^s2)。作者指出速度方差是不确定性的主要指标,并注意到在此特定任务设计中,偏航角通常依赖于速度。
- 安全规则:引入了一种简单的基于规则的安全启发式方法:如果速度方差 σ^s2 超过阈值 λ,智能体将期望速度覆盖为 0 m/s(制动)。
主要贡献
本文概述了三项主要贡献:
- EnDfuser 智能体:提出了一种简单的 E2E 驾驶智能体,能够利用基于扩散的规划器在闭环 CARLA 场景中建模规划不确定性。
- 性能提升:证明了一种简单的不确定性感知启发式方法(制动规则)将智能体在 LAV 基准测试中的驾驶得分提高了1.7%。
- 分布分析:证据表明,后验轨迹分布可以揭示驾驶分布的“长尾”,特别突出了潜在的安全关键情况发生和数据偏差(如标签噪声)的情况。
实验结果
该系统在 CARLA 仿真器中的LAV和Longest6基准测试上进行了评估。
- LAV 基准测试:基础 EnDfuser 配置(未应用安全规则)在驾驶得分(DS)和违规得分(IS)方面已经优于 TF++ 基线。应用安全规则(阈值 λ=0.4)后,DS 进一步提升至78.1(相比之下 TF++ 为 70.0),且每公里车辆碰撞次数减少。
- Longest6 基准测试:虽然 EnDfuser 变体在这个更复杂的基准测试中得分通常低于 TF++,但安全规则成功将车辆碰撞率从每公里 1.1 次降低到 1.02 次。然而,由于涉及路线超时增加的权衡,这并未转化为更高的整体 DS。
- 不确定性定位:速度方差图的分析显示,高不确定性(“尖峰”)始终与交叉口、弯道以及与动态智能体的交互相关联。
- 不确定性分类:对 100 个最高方差帧的视觉检查显示,83% 发生在与其他智能体的交互期间。分析还识别出了因果混淆(没有明确视觉原因的不确定性)和横向标签噪声(由于训练数据限制,预测超出了已知目标点)。
意义与主张
作者将 EnDfuser 定位为迈向 E2E 驾驶策略中不确定性感知决策的重要一步。
- 即插即用替代:本文声称,集成扩散可以作为传统点估计规划模块的“即插即用”替代方案,有效地建模后验轨迹分布的不确定性。
- 可解释性:通过观察完整的候选轨迹集,该系统为不确定、多模态的未来空间提供了可解释性,允许检测可能被单点估计器遗漏的安全关键情况。
- 数据挖掘:该方法提供了一种潜在的工具用于过滤训练数据,特别是用于识别驾驶分布的“长尾”和高智能体不确定性区域,包括标签噪声实例。
本文在局限性方面保持了适度的语气,承认当前的安全启发式方法过于简单,可能无法很好地泛化。它指出该方法目前无法区分偶然不确定性和认知不确定性,并建议未来的工作应探索更复杂的度量(如熵)和动态安全启发式方法。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。