← 最新论文
💻 computer science

Driving Intents Amplify Planning-Oriented Reinforcement Learning

本文介绍了 DIAL,这是一个两阶段框架,它将基于意图条件的流匹配与多意图偏好强化学习相结合,以克服连续动作驾驶策略中的模式崩溃问题,使其在性能上超越以往的最先进模型和人类驾驶演示。

原作者: Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在通过向自动驾驶汽车展示一段人类驾驶员在繁忙街道上行驶的视频来教导它。正如论文所指出的,这种方法的弊端在于,视频仅展示了人类驾驶员选择的一种驾驶方式。也许他们提前刹车了,也许他们变道了,或者也许他们稍微加速了。但视频并未展示当时同样可行的其他有效选项。

如果你训练计算机仅仅复制那一段视频,它就会陷入“死胡同”。它学会了只做它看到的那件事,而忽略了处理该情况的所有其他安全且明智的方法。作者将这种现象称为**“模式崩溃”**。这就像一个学生死记硬背了一道数学题的某个特定答案,但当数字发生微小变化时却束手无策,因为他们从未掌握底层逻辑或其他可能的解法。

以下是论文提出的新方法——DIAL(驾驶意图增强学习)——如何通过两个巧妙的步骤来解决这一问题:

问题所在:“单线思维”

在旧有的训练方式(监督微调或 SFT)中,人工智能观察场景并尝试预测路径。由于训练数据中它只见过一条路径,它所有的预测都会紧密地聚集在这条单一线条周围。

  • 类比:想象你向一位厨师展示了一道特定食谱,然后让他烹饪这道菜。如果你要求提供"100 种变体”,厨师只会给你 100 个同一道菜的略微不同版本。他从未想过尝试完全不同的风味组合(例如从意大利面换成汤),因为他从未被告知这些选项的存在。
  • 结果:即使你从 128 个猜测中挑选出“最佳”的一个,它们实际上也没有比原始人类驾驶员的视频更好。人工智能被困住了。

解决方案:DIAL(驾驶意图增强学习)

作者引入了一种两阶段的训练过程来打破这一困境。

第一阶段:“意图菜单”

他们不再仅仅询问人工智能“我应该走哪条路径?”,而是首先要求它从包含 8 个具体选项的菜单中选择一个驾驶意图巡航、向左变道、向右变道、左转、右转、掉头、加速或减速。

  • 类比:这就像在厨师开始烹饪之前,先给他一份不同风格的菜单。“今天,我们要做一道辣味炒菜,”或者“今天,我们要做一道奶油浓汤。”
  • 工作原理:人工智能被训练为根据特定意图生成路径。如果意图是“左转”,它就生成一条左转路径;如果是“加速”,它就生成一条快速路径。
  • 神奇之处:通过迫使人工智能在这些不同的类别中进行思考,它不再围绕单一线条聚集。它学会了探索不同的行为“盆地”。突然间,当你要求 128 种变体时,你得到的是 128 种不同类型的驾驶操作,而不仅仅是 128 个相同操作的复制品。
  • 结果:仅凭这一步,人工智能的最佳猜测就超越了原始人类视频,仅仅是因为它最终探索了人类视频中未展示的选项。

第二阶段:“味觉测试”(强化学习)

现在人工智能拥有了多样化的选项菜单,他们需要教导它哪一个选项实际上对当前情况是最佳的。他们使用了一种称为多意图 GRPO的系统。

  • 类比:想象一位美食评论家(“评分者”)品尝厨师制作的所有 16 道菜(8 种风格各 2 道)。评论家并非挑选最像原始食谱的那一道,而是挑选味道最好的那一道。
  • 避免的陷阱:如果厨师只制作了 16 份“辣味炒菜”,评论家就无法判断“辣味炒菜”是否真的比“奶油浓汤”更好。这种比较是不公平的。
  • 修正:DIAL 迫使厨师为每一个场景制作每种风格(左转、右转、加速等)的 2 份菜品。然后评论家对所有菜品进行比较。这教会了人工智能:“哦,在这个特定的交通拥堵中,‘减速’风格得分最高,而不是‘加速’风格。”
  • 结果:人工智能学会了为当前情况选择正确的意图,而不仅仅是复制路径。它保留了在第一阶段学到的多样性,而不是重新坍缩回单一的习惯。

最终得分

论文在真实世界的驾驶数据集(Waymo)上测试了该方法。

  • 旧方法:即使有 128 个猜测,它们能做到的最好结果也只是略逊于人类驾驶员的原始视频。
  • DIAL:通过利用“意图菜单”和“公平味觉测试”,人工智能的最佳猜测得分高于人类驾驶员的视频。其得分为 9.14(在人类驾驶员得分为 8.13 的评分标准下),证明人工智能找到了比最初被记录的人类驾驶员更好的驾驶方式。

总结

论文认为,教导自动驾驶汽车的瓶颈不仅仅在于让人工智能更擅长模仿;而在于确保人工智能不会陷入认为只有一种驾驶方式的思维定势。通过明确教导人工智能以不同的“模式”(意图)进行思考,然后奖励其选择最佳模式,他们解锁了以往方法无法达到的性能水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →