想象一下,你正在通过向自动驾驶汽车展示一段人类驾驶员在繁忙街道上行驶的视频来教导它。正如论文所指出的,这种方法的弊端在于,视频仅展示了人类驾驶员选择的一种驾驶方式。也许他们提前刹车了,也许他们变道了,或者也许他们稍微加速了。但视频并未展示当时同样可行的其他有效选项。
如果你训练计算机仅仅复制那一段视频,它就会陷入“死胡同”。它学会了只做它看到的那件事,而忽略了处理该情况的所有其他安全且明智的方法。作者将这种现象称为**“模式崩溃”**。这就像一个学生死记硬背了一道数学题的某个特定答案,但当数字发生微小变化时却束手无策,因为他们从未掌握底层逻辑或其他可能的解法。
以下是论文提出的新方法——DIAL(驾驶意图增强学习)——如何通过两个巧妙的步骤来解决这一问题:
问题所在:“单线思维”
在旧有的训练方式(监督微调或 SFT)中,人工智能观察场景并尝试预测路径。由于训练数据中它只见过一条路径,它所有的预测都会紧密地聚集在这条单一线条周围。
- 类比:想象你向一位厨师展示了一道特定食谱,然后让他烹饪这道菜。如果你要求提供"100 种变体”,厨师只会给你 100 个同一道菜的略微不同版本。他从未想过尝试完全不同的风味组合(例如从意大利面换成汤),因为他从未被告知这些选项的存在。
- 结果:即使你从 128 个猜测中挑选出“最佳”的一个,它们实际上也没有比原始人类驾驶员的视频更好。人工智能被困住了。
解决方案:DIAL(驾驶意图增强学习)
作者引入了一种两阶段的训练过程来打破这一困境。
第一阶段:“意图菜单”
他们不再仅仅询问人工智能“我应该走哪条路径?”,而是首先要求它从包含 8 个具体选项的菜单中选择一个驾驶意图:巡航、向左变道、向右变道、左转、右转、掉头、加速或减速。
- 类比:这就像在厨师开始烹饪之前,先给他一份不同风格的菜单。“今天,我们要做一道辣味炒菜,”或者“今天,我们要做一道奶油浓汤。”
- 工作原理:人工智能被训练为根据特定意图生成路径。如果意图是“左转”,它就生成一条左转路径;如果是“加速”,它就生成一条快速路径。
- 神奇之处:通过迫使人工智能在这些不同的类别中进行思考,它不再围绕单一线条聚集。它学会了探索不同的行为“盆地”。突然间,当你要求 128 种变体时,你得到的是 128 种不同类型的驾驶操作,而不仅仅是 128 个相同操作的复制品。
- 结果:仅凭这一步,人工智能的最佳猜测就超越了原始人类视频,仅仅是因为它最终探索了人类视频中未展示的选项。
第二阶段:“味觉测试”(强化学习)
现在人工智能拥有了多样化的选项菜单,他们需要教导它哪一个选项实际上对当前情况是最佳的。他们使用了一种称为多意图 GRPO的系统。
- 类比:想象一位美食评论家(“评分者”)品尝厨师制作的所有 16 道菜(8 种风格各 2 道)。评论家并非挑选最像原始食谱的那一道,而是挑选味道最好的那一道。
- 避免的陷阱:如果厨师只制作了 16 份“辣味炒菜”,评论家就无法判断“辣味炒菜”是否真的比“奶油浓汤”更好。这种比较是不公平的。
- 修正:DIAL 迫使厨师为每一个场景制作每种风格(左转、右转、加速等)的 2 份菜品。然后评论家对所有菜品进行比较。这教会了人工智能:“哦,在这个特定的交通拥堵中,‘减速’风格得分最高,而不是‘加速’风格。”
- 结果:人工智能学会了为当前情况选择正确的意图,而不仅仅是复制路径。它保留了在第一阶段学到的多样性,而不是重新坍缩回单一的习惯。
最终得分
论文在真实世界的驾驶数据集(Waymo)上测试了该方法。
- 旧方法:即使有 128 个猜测,它们能做到的最好结果也只是略逊于人类驾驶员的原始视频。
- DIAL:通过利用“意图菜单”和“公平味觉测试”,人工智能的最佳猜测得分高于人类驾驶员的视频。其得分为 9.14(在人类驾驶员得分为 8.13 的评分标准下),证明人工智能找到了比最初被记录的人类驾驶员更好的驾驶方式。
总结
论文认为,教导自动驾驶汽车的瓶颈不仅仅在于让人工智能更擅长模仿;而在于确保人工智能不会陷入认为只有一种驾驶方式的思维定势。通过明确教导人工智能以不同的“模式”(意图)进行思考,然后奖励其选择最佳模式,他们解锁了以往方法无法达到的性能水平。
技术摘要:驾驶意图增强面向规划的强化学习(DIAL)
1. 问题陈述
该论文指出,**模式崩溃(mode collapse)**是将基于偏好的强化学习(RL)应用于基于单场景单演示轨迹训练的连续动作驾驶策略时的主要瓶颈。
- 单演示监督微调(SFT)的局限性: 当策略通过监督微调(SFT)在单一记录轨迹上进行训练时,生成的采样分布会紧密聚集在该特定机动周围。即使使用具有表达力的动作头(如流匹配或扩散模型),策略也无法表示语义上截然不同的替代方案(例如,更早或更晚刹车、变道或保持车道)。
- 基于偏好的 RL 的失效: 基于偏好的评估(例如 Best-of-N)依赖于策略生成多样化的候选方案以选择评分最高者。然而,如果采样分布坍缩在单一模式周围,“神谕选择”(oracle selection)无法恢复那些从未被采样的高质量轨迹。因此,无论样本预算(N)如何,Best-of-N 的性能都会停滞在低于原始人类演示的质量水平。
- 核心洞察: 瓶颈不在于策略更新机制本身,而在于采样分布。标准的组相对策略优化(GRPO)之所以失败,是因为从单一意图(或噪声种子)中抽取的 rollout 会导致组内重新坍缩,从而提供无信息的组相对优势(低偏好对比度)。
2. 方法论:DIAL 框架
作者提出了DIAL(Driving-Intent-Amplified Learning,驾驶意图增强学习),这是一个两阶段框架,旨在首先扩展采样分布,然后在偏好 RL 过程中保持这种扩展。
第一阶段:基于意图的条件无分类器引导(CFG)
- 目标: 通过沿语义上截然不同的机动模式扩展采样分布,打破单演示模式崩溃。
- 机制:
- 流匹配动作头以离散意图标签 c 为条件。
- 意图集由八个基于规则推导的类别组成:巡航、变道(左/右)、转弯(左/右)、U 型转弯、加速、减速。
- 无分类器引导(CFG): 在训练期间,意图标签以概率 pdrop 被随机丢弃(替换为无条件占位符)。这教会模型生成条件(特定意图)和无条件动作分布。
- 推理: 一个轻量级前缀分类器根据视觉上下文预测意图。生成器随后使用预测的意图解码轨迹,结合条件和无条件速度预测。
- 结果: 此阶段允许策略为同一场景生成多样化的轨迹(例如,左转与保持车道),而不仅仅是对单一路径进行坐标级别的扰动。仅凭基于意图的采样就显著提高了 Best-of-N 的上限。
第二阶段:多意图组相对策略优化(GRPO)
- 目标: 在 RL 微调过程中保持扩展的多样性,并将策略优化至符合人类偏好。
- 机制:
- 意图平衡的 Rollout: 对于每个场景,系统为 C=8 个意图中的每一个采样 S 条轨迹,创建一个包含 K=C×S 个提案的组(例如,当 S=2 时,K=16)。
- 组相对优势: 为所有 K 条轨迹计算奖励反馈分数(RFS)。优势值在整个池化组中进行归一化。由于该组涵盖了所有意图类别,RL 更新接收到跨越不同机动模式的有意义偏好信号,防止组内重新坍缩到单一首选模式。
- 奖励黑客意识(Reward-Hacking Awareness): 训练奖励修改了标准 RFS 以防止过拟合:
- 用标签 softmax 聚合替代对评分者轨迹的硬最大值。
- 将评分锚点从 {3s,5s} 细化为 {1s,2s,3s,4s,5s},以惩罚不合理的中间运动。
- 策略更新: 使用带有截断的 GRPO 目标,并针对第一阶段 SFT 检查点施加参考策略惩罚(KL 散度)。
3. 主要贡献
- 模式崩溃的识别: 论文确立,对于连续动作策略,偏好 RL 的上限受限于采样分布。具有竞争力的 SFT 基线在 Best-of-128 RFS < 8.13 时即达到饱和,低于人类演示,因为它们无法采样不同的机动模式。
- 基于意图的条件 CFG: 证明了将动作头以离散意图为条件可以打破采样上限。基于意图的采样实现了 Best-of-128 RFS 为9.14,首次超越了之前的最佳规划器 RAP(8.5)和人类演示(8.13)。
- DIAL 框架: 引入了一个结合意图-CFG 扩展与多意图 GRPO 的两阶段流程。这保持了第一阶段建立的多样性,将保留集单轨迹 RFS 从7.681 提升至 8.211。
- 多样性的实证验证: 表明单一意图变体(即使具有最优意图选择)无法匹配 DIAL 的性能,并最终退化,证明了在偏好组内覆盖完整意图集对于稳定的 RL 是必要的。
4. 实验结果
在WOD-E2E数据集上使用 RFS 基准(Waymo Open Dataset End-to-End)进行评估:
- 基线性能: 四个具有竞争力的 SFT 基线(WAM-Flow, Curious-VLA, AutoVLA, ReCogDrive)在保留集上显示出 RL 带来的收益微乎其微(例如,ReCogDrive +0.315, WAM-Flow +0.087)。它们的 Best-of-N 性能始终低于人类演示。
- DIAL 性能:
- 保留集 RFS: 从 7.696(SFT 初始化)提升至8.211(+0.515),是所有 RL 训练系统中增益最高的。
- 全数据集 RFS: 从 7.369 提升至8.631。
- Best-of-128: 基于意图的采样达到9.14,超过了人类演示(8.13)和之前的最先进规划器 RAP(8.5)。
- 消融研究结果:
- 多意图与单意图: 单意图 GRPO 变体(为单一意图使用 K=16 个噪声种子)峰值较低(最高 7.992),并在训练结束时出现退化。
- 每意图样本数(S): S=2(总计 K=16)被确定为峰值性能的“甜蜜点”。
- 奖励塑形: 使用 softmax 聚合和密集锚点防止了奖励黑客行为并提高了稳定性。
5. 意义与主张
该论文主张,偏好对齐的连续动作驾驶的根本挑战不仅仅在于如何更新策略,而在于如何扩展并保持被优化的采样分布。
- 范式转变: 该工作认为,如果策略无法生成语义上截然不同的替代方案,偏好 RL 就是无效的。“瓶颈”在于提案机制,而非优化器。
- 实际影响: 通过显式建模驾驶意图并通过多意图 GRPO 保持这种多样性,DIAL 成功摆脱了模式崩溃,使策略能够在 Best-of-N 设置中达到并超越人类演示的质量,并显著提升了单轨迹部署的性能。
- 谦逊声明: 作者承认局限性,指出这八个意图源自手工编码的几何规则(可能遗漏长尾行为),且 RL 训练数据(438 个序列)相对于完整的 Waymo 数据集而言规模较小。
总之,DIAL 证明了意图多样化的提案是端到端驾驶中成功进行偏好优化的先决条件,使策略能够探索所有可接受机动的全空间,而不是坍缩为单一的几何模仿。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。