✨ 要点🔬 技术摘要
想象一下你正在教一个机器人开车。教机器人做事主要有两种方式:
“方向盘”法(基于动作): 你告诉机器人:“向左转5度,踩一点油门,不要踩刹车。”这就像是在给飞行员下达具体的、低层级的指令。
“地图路线”法(基于航点): 你告诉机器人:“开到地图上的这个特定点,然后去下一个点,再到下一个点。”这就像是给 GPS 一系列目的地清单。
问题所在:语言障碍 长期以来,“地图路线”法一直被视为黄金标准。大多数针对自动驾驶汽车的测试、竞赛和训练项目,都是为了检查机器人是否击中了那些特定的地图点(航点)。
然而,许多研究人员更倾向于使用“方向盘”法,因为它更灵活,且不需要完美的 GPS 地图(非常适合乡村地区)。问题在于,你无法让一个“方向盘”机器人轻松地参加一场“地图路线”竞赛。这就像是你只懂玩跳棋,却试图参加一场国际象棋锦标赛;你的招式与规则并不匹配。这造成了一个“差距”:优秀的“方向盘”机器人因为测试是为“地图路线”机器人设计的,而无法证明自己的优秀。
解决方案:“通用翻译器” 本文的作者构建了一个聪明的“翻译器”或桥梁 来解决这个问题。
他们创建了一个特殊的、基于数学的工具(称为可微车辆模型 ),它在训练过程中充当模拟器。其工作原理如下:
输入: 机器人给出它的“方向盘”指令(转向、油门、刹车)。
模拟: 该工具会立即计算:“如果汽车完全按照你说的做,1秒后它会在哪里?2秒后又会在哪里?”它将这些低层级的指令转化为一系列地图点(航点)。
检查: 系统随后检查这些计算出的地图点是否与“正确”的路径相匹配。
学习: 如果机器人偏离了航线,系统会通过模拟器向机器人发送一个“修正信号”,教会它如何调整转向和油门以达到目标点。
为什么这很酷?
公平的竞技场: 现在,一个以“方向盘”指令进行思考的机器人,可以在不改变游戏规则的情况下,参加“地图路线”锦标赛。
灵活性: 作者测试了两种类型的“翻译器”:
自行车模型 (KBM): 想象汽车是一辆自行车。这是一种简单、快速预测汽车去向的方法。
平滑曲线模型 (CCPP): 想象汽车正在地面上画一条完美的、平滑的丝带。这更复杂,但能更好地处理急转弯和曲线,就像专业的赛车手一样。
更好的结果: 当他们使用这个桥梁时,“方向盘”机器人在高难度的驾驶测试中表现得与“地图路线”机器人一样好,甚至更好。
核心结论 本文表明,你不需要在通过“转向”还是通过“跟随地图”来教机器人开车之间做出选择。你可以教它转向,并利用这个“数学桥梁”在测试和评分时假装它正在跟随地图。这使得最好的驾驶风格可以得到公平的比较,从而带来更安全、更智能的自动驾驶汽车。
他们并未声称:
他们并未声称这解决了所有的自动驾驶问题(例如 3D 山坡或悬挂弹跳)。
他们并未声称这是一个医疗工具或某种特定的未来应用;这严格来说是一种旨在改进目前如何训练和测试驾驶软件的方法。
技术摘要:通过车辆运动模型解决端到端自动驾驶中的路点-动作差距(Waypoint–Action Gap)
1. 问题陈述
端到端自动驾驶(E2E-AD)系统目前根据其输出分为两种范式:基于路点的模型 (预测未来轨迹)和基于动作的模型 (直接输出低级控制量,如油门、转向、刹车)。虽然基于动作的策略具有减少对高精度 GPS 依赖以及更适用于网络连接较差的农村地区等优势,但研究界日益倾向于使用基于路点的方案。
这种转变造成了“路点-动作差距”。大多数现代基准测试(如 NAVSIM、Bench2Drive)及其训练流水线都是专门为路点输出设计的。因此,如果不引入非标准接口(例如离散化控制空间),基于动作的策略无法在这些框架内进行直接训练或评估。这种不平衡阻碍了基于动作方法的公平比较与进步。本文旨在通过使基于动作的架构能够在不修改评估协议的情况下,在现有的基于路点的基准测试中进行训练和评估,从而弥合这一差距。
2. 方法论
作者提出了一个可微车辆模型框架 ,作为动作与路点表示之间的解析桥梁。其核心机制是一个提升算子 (F ϕ F_\phi F ϕ ),它将预测的动作序列展开(roll out)为对应的自车坐标系下的路点轨迹。这使得系统能够使用路点空间的损失函数来监督基于动作的策略。
核心组件:
提升算子 (F ϕ F_\phi F ϕ ): 该算子接收一系列低级动作 (a t a_t a t ) 和初始车辆状态 (s t s_t s t ),生成一系列路点 (w t w_t w t )。它被分解为三个模块化的、可微的组件:
控制激活 (ψ ϕ \psi_\phi ψ ϕ ): 将原始网络输出映射为有界的物理控制量(例如,使用 sigmoid/tanh 处理油门和转向)。
动力学展开 (f ϕ f_\phi f ϕ ): 使用车辆动力学随时间向前传播运动学状态。
位姿投影 (h h h ): 从完整的状态向量中提取平面位置 ( x , y ) (x, y) ( x , y ) 。
模型实例化: 该框架通过两种特定的车辆模型进行实例化:
运动学单轮车模型 (KBM): 一种捕捉非完整约束的单轨模型,通过欧拉法或龙格-库塔法 (RK4) 进行集成。
连续曲率路径规划器 (CCPP): 一个利用回旋曲线(clothoid arcs)生成平滑轨迹的模型,以确保曲率连续性,避免直线-圆弧路径带来的转向不连续问题。
MLP 基线: 也使用多层感知机作为一个数据驱动的提升算子,以便与基于物理的模型进行对比。
训练流水线: 策略网络 (N θ N_\theta N θ ) 根据观测和指令预测动作。这些动作通过可微提升算子传递,生成预测路点。计算预测路点与地面真值路点之间的加权 L1 损失。梯度通过提升算子回传以更新策略参数,而车辆模型参数保持固定。
3. 主要贡献
本文概述了三个主要贡献:
基于路点的动作策略训练目标: 作者证明,将动作策略耦合到其框架中并使用路点空间损失进行监督,与标准的动作空间目标相比,能实现更稳定的评估、更高的闭环性能以及与驾驶结果更强的相关性。
可微且确定性的框架: 本研究首次引入了一个确定性且可微的车辆动力学框架,专门设计用于将低级动作提升至路点,从而使其能够应用于标准基准测试。
跨范式的统一比较: 通过使用 KBM 和 CCPP 实例化该框架,作者使得基于动作和基于路点的策略能够在相同的路点协议下进行训练和评估,而无需更改现有的基准测试接口。
4. 实验结果
该框架在四个具有挑战性的基准测试中进行了评估:NAVSIM navtest、NAVSIM navhard、Bench2Drive 以及一个基于 CARLA 的协议。
NAVSIM navhard (反应式): 该方法在纯视觉模型中达到了最先进的性能(SOTA) 。具体而言,结合了 CCPP 提升算子的 MILE 实现了 29.5 的扩展预测驾驶模型得分(EPDMS),超越了最强的纯视觉基线(Latent TransFuser)。
NAVSIM navtest (非反应式): 该框架使基于动作的策略能够匹配或接近基于路点的基线。结合 KBM 的 CIL++ 实现了 83.3 的规划偏差度量得分(PDMS),与最先进的路点唯一模型(LAW)的差距仅为 1.5%。
Bench2Drive (闭环): 该框架显著提升了闭环性能。对于 CIL++ 基线,驾驶得分(DS)提升高达 61.1% (从 43.6 提升至 66.9,使用 CCPP 时),路径完成率(RC)提升超过 30%。
训练稳定性: 与欧拉积分相比,使用 RK4 积分(特别是配合 CCPP 时)显著降低了训练动力学的方差,从而实现了更稳健的模型选择。
相关性研究: 论文发现,由该框架生成的路点级误差与闭环成功率的相关性比原始动作空间误差更强,这表明轨迹级监督是衡量现实世界性能更好的代理指标。
5. 重要性与主张
本文声称其框架有效地弥合了自动驾驶中基于动作与基于路点的方法论分歧。通过允许基于动作的策略在占主导地位的以路点为中心的基准测试生态系统中进行训练和评估,这项工作消除了开发和比较控制类方法的一个重要障碍。
作者强调,该方法不需要修改现有的基准测试协议,使其成为一种适配基于动作策略的通用机制。他们指出,虽然该框架假设平面运动 (R 2 R^2 R 2 ) 并忽略了如路面坡度或悬挂系统等 3D 效应,但它成功地利用物理车辆模型提高了端到端学习的稳定性和性能。该工作表明,通过可微提升引入运动学结构是有益的,特别是在误差会随时间累积的反应式环境中。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。