← 最新论文
🤖 machine learning

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

本文介绍了 DriveJudge,一种新型自动驾驶评估智能体,它将视觉语言模型的推理能力与基于物理法则的规则函数相结合,从而在符合人类标准的基准任务上实现了卓越、可解释且具备上下文感知能力的性能。

原作者: Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人开车。你教会了它交通规则:“保持在车道内”、“不要撞到人”以及“保持前进”。但现实生活是复杂的。有时,为了避开一个坑洼或一辆停着的卡车,机器人可能需要短暂地跨越车道线或意外减速。

这正是衡量机器人表现的旧方法失效的地方,而新的方法——DriveJudge——应运而生。

问题所在:“僵化的规则手册” vs. “困惑的裁判”

该论文指出了目前人们尝试评估自动驾驶汽车的两主要方式,且两者都存在缺陷:

  1. 僵化的规则手册(老派做法):
    想象一位严格的老师,手里只有一份清单。如果汽车跨越了白线,老师就判定错误;如果汽车停顿了3秒,老师也判定错误。

    • 缺陷: 这种老师不理解语境。如果汽车为了躲避掉落的树枝而跨越了线,规则手册仍然会判定为“错误”。它惩罚了明智且安全的决策,因为这些决策在技术层面上违反了规则。
  2. 困惑的裁判(新型 AI):
    最近,人们开始使用高级 AI(称为视觉语言模型,即 VLMs)来充当裁判。这些 AI 能“看到”场景并理解“哦,汽车跨线是为了避开树木,这没问题”。

    • 缺陷: 这些 AI 擅长理解故事,但它们在测量精确距离方面表现糟糕。它们可能会说“汽车很安全”,但实际上汽车可能即将发生碰撞,因为它们无法精确计算英寸级的距离。此外,它们的评价也比较模糊,让人很难知道为什么给出这样的分数。

解决方案:DriveJudge(“聪明的工头”)

作者创建了 DriveJudge,它的角色就像建筑工地上的一个聪明的工头

DriveJudge 不仅仅是观察汽车并进行猜测,也不仅仅是检查一份清单,它进行的是一种两步走的“舞蹈”:

  1. “观察与思考”阶段: AI(工头)观察场景并询问:“这里实际发生了什么?”它利用大脑来理解语境。是出现了施工区域?还是有一辆停下的卡车?
  2. “工具选择”阶段: 根据它所看到的场景,它决定使用哪些特定的工具。
    • 场景 A: 汽车正在高速公路上正常行驶。工头拿起**“车道保持”工具和“速度”**工具。
    • 场景 B: 汽车正在绕过施工障碍物。工头心想:“啊,现在车道保持并不重要;为了安全,汽车需要进入另一条车道。”于是,它放下“车道保持”工具,转而拿起**“碰撞规避”**工具。

通过根据情况有选择性地开启或关闭规则,DriveJudge 兼具了两者的优点:它拥有僵化规则手册的精确性(因为它使用了真实的数学工具),同时也拥有智能 AI 的理解力(因为它知道何时该忽略规则)。

他们是如何测试的

为了证明其有效性,团队并没有仅仅靠猜测。他们构建了一个庞大的“驾驶考试”数据集:

  • 他们收集了超过 33,000 段棘手的驾驶片段(即驾驶中的“长尾场景”,即发生奇特情况的时刻)。
  • 他们要求人类对这些片段进行标注:“即使违反了规则,这种驾驶行为是否合理?”
  • 他们利用这些数据来训练 DriveJudge,使其表现得像一位人类专家。

测试结果

当他们将 DriveJudge 与旧方法进行对比测试时:

  • 击败了规则手册: DriveJudge 能更好地识别出那些会被旧规则手册不公平惩罚的“合理”驾驶行为。
  • 击败了困惑的 AI: 相比于那些仅凭“感觉”进行猜测的 AI,DriveJudge 能更好地选择最安全的路径。
  • 得分: 简单来说,DriveJudge 获得了更高的成绩(在一项测试中高出 21 分,在另一项测试中高出 6.5%),优于之前的最佳方法。

核心启示

论文认为,要让自动驾驶汽车真正变得安全且聪明,我们不能仅仅依赖于一份规则清单,也不能仅仅依赖于聊天机器人的观点。我们需要一个既能理解道路故事,又能应用正确数学逻辑来评判的系统。DriveJudge 就是这样一个系统:一个知道何时该严厉、何时该灵活的裁判。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →