← 最新论文
💻 computer science

CLOVER: Closed-Loop Value Estimation \& Ranking for End-to-End Autonomous Driving Planning

CLOVER 是一个闭环价值估计与排序框架,它通过采用结合伪专家轨迹与保守自蒸馏的生成器 - 评分器架构,解决了端到端自动驾驶中训练与评估不匹配的问题,从而在 NAVSIM 基准测试中实现了最先进的性能。

原作者: Sining Ang, Yuguang Yang, Canyu Chen, Yan Wang

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Sining Ang, Yuguang Yang, Canyu Chen, Yan Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人开车。长期以来,教导这个机器人的标准方法是给它看一段人类完美驾驶的视频,然后说:“完全照此复制。”

问题出在哪里?有时,机器人会过于字面地模仿人类。如果人类犯了一个微小的错误或做了一个奇怪的举动,机器人可能会复制这个错误,即使这样做很危险。反之,有时机器人本可以找到一种更好的驾驶方式(例如,稍微变换车道以避开一辆慢速卡车),但由于那条路径并未出现在它看到的单一视频中,它从未想过尝试。

这就是论文中描述的“训练与测试”不匹配问题。机器人被训练去模仿单一路径,但它在测试时却要面对一套复杂的安全、舒适和进度规则清单。

CLOVER 登场:机器人驾驶教练

作者提出了一种名为CLOVER(闭环价值评估与排序)的新系统。不要把 CLOVER 想象成一个单一的学生,而应将其视为一所拥有两个不同角色的驾驶学校生成器(学生驾驶员)和评分器(严格的驾驶教练)。

以下是其工作原理,使用简单的类比说明:

1. 旧方法 vs. CLOVER 方法

  • 旧方法:学生驾驶员只被允许练习教练昨天驾驶的那一条路线。如果教练转了一个急弯,学生也必须转那个急弯,即使存在一条更直、更安全的路线。
  • CLOVER 方法:鼓励学生驾驶员为每种情况生成64 条不同的可能路线。也许其中一条很快,一条超级安全,一条非常平稳,还有一条有点冒险。

2. 两阶段训练过程

第一阶段:构建创意的“安全网”
系统不再仅仅复制一条路径,而是创建一个**“伪专家”库**。

  • 类比:想象教练不只是展示一段视频,而是生成一堆“如果……会怎样”的情景:“如果我们慢 5 英里/小时行驶会怎样?”“如果我们向左偏移 2 英尺会怎样?”“如果我们提前刹车会怎样?”
  • 系统使用一本严格的规则手册(评估器)来筛选这些情景。它保留那些安全且合法的情景,即使它们并非人类所走的精确路径。
  • 学生驾驶员(生成器)随后被训练去覆盖所有这些不同的“安全”可能性,而不仅仅是原始的那一条路径。这确保了机器人拥有一个广泛的良好选项菜单供其选择。

第二阶段:“闭环”辅导
现在学生拥有了广泛的选项菜单,他们需要学习如何挑选最佳的那一个。

  • 类比:学生生成 64 条路线。严格的教练(评分器)审视这些路线,并根据现实世界的规则手册(安全、舒适、速度)给出评分。
  • 转折:教练并非完美无缺。有时他们可能会给出略微错误的评分。因此,CLOVER 使用一位“导师”(系统的冻结版本)来指导学生。导师说:“不要盲目追逐最高分;看看排名前 10 的最佳路线,以及那些在平衡安全与速度方面表现最佳的路线。”
  • 学生随后优化其驾驶表现,以匹配这些“顶级”示例,同时不丧失生成多样化选项的能力。这就像教练说:“你在寻找好路线方面越来越擅长,现在让我们打磨你的选择技能,但不要让你变得僵化。”

3. 为何有效(“魔法”条件)

论文提出了一个明智的问题:如果教练(评分器)犯错怎么办?
作者从数学上证明,只要教练在统计上优于随机猜测——即他们通常能区分“好”路线和“坏”路线——该系统就会进步。它不需要一个完美的教练;只需要一个足以将学生引向正确方向的教练即可。

结果

当他们在NAVSIM驾驶基准测试(相当于自动驾驶汽车的“期末考试”)上测试 CLOVER 时:

  • 它取得了94.5分(满分 100),超越了所有先前的方法。
  • 它在处理困难、棘手的驾驶场景(NavHard)方面表现尤为出色,达到了有史以来报告的最佳结果。
  • 关键的是,它不仅仅在挑选唯一最佳路线方面变得更好;它实际上在最初生成更广泛的高质量路线方面也变得更好了。

总结

CLOVER 就像是将驾驶学生从“完全复制教练的动作”升级为“生成多种安全的可能性,然后利用一位聪明的教练帮助你挑选绝对最佳的那一个”。它通过教导机器人探索多种良好选项并仔细对其进行排序,解决了机器人过于僵化的问题,从而实现了更安全、更像人类的自动驾驶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →