← 最新论文
🤖 AI

LightEMMA: A Longitudinal Evaluation of Vision-Language Models for Autonomous Driving

该论文介绍了 LightEMMA,这是一个纵向评估框架,它证明了视觉语言模型的连续迭代并不总能持续提升在 nuScenes 基准测试上的自动驾驶性能,从而强调了进行领域特定适配以解决重复性失效模式并确保安全性的必要性。

原作者: Zhijie Qiao, Haowei Li, Zhong Cao, Henry X. Liu

发布于 2026-09-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhijie Qiao, Haowei Li, Zhong Cao, Henry X. Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,自动驾驶汽车一直依赖于遵循严格脚本的僵化规则系统,或是通过学习型框架将原始传感器数据直接映射到转向指令。尽管这些方法取得了显著进展,但它们往往在面对意外情况时显得力不从心:例如那些超出其训练数据的罕见且复杂的场景,如建筑工人挥手示意或突然出现的模糊交通模式。为了弥补这一差距,研究人员转向了视觉语言模型。这些强大的人工智能系统经过训练,能够同时理解图像和人类语言,能够像人类驾驶员一样对场景进行推理——描述他们所见、解释意图,并基于上下文做出决策。人们普遍希望,随着这些模型变得更加先进和具备更强的通用推理能力,它们自然会变得更擅长驾驶,最终超越那些仅为道路设计的专业化系统。

密歇根大学的一个研究小组致力于通过一项严谨的长期观察,来测试这一假设,即这些模型实际表现如何。他们引入了一个名为 LightEMMA 的新评估框架,旨在不给予任何特殊训练或调整其内部设置的情况下,衡量这些模型的驾驶技能。研究人员并没有教这些模型如何驾驶,而是简单地要求它们观察街道场景并预测车辆下一步应该如何行驶。他们测试了来自五个主要家族的十五个不同模型,涵盖了三年的快速发展期,并使用了一个具有挑战性的真实城市驾驶场景数据集。其目标是观察最新的、最强大的模型是否确实比其前身更擅长驾驶,还是说通用智能的飞跃未能转化为更安全、更准确的驾驶能力。

这项纵向研究的结果揭示了一个令人惊讶的脱节现象。尽管这些模型变得规模更大、通用推理速度更快、对复杂语言的理解能力更强,但它们在预测车辆轨迹方面并未持续进步。事实上,一些最新一代的模型表现甚至不如同一家族的旧版本。当研究人员将预测路径的准确性与真实车辆行驶的路径进行对比时,发现较新的模型往往产生更大的误差。例如,虽然 GPT 系列中表现最好的模型之一在三秒的预测窗口内实现了仅略高于一米的平均误差,但来自同一家族或其他家族的其他较新模型显示出了更高的误差率,有时甚至超过了两米。这表明,仅仅让模型在通用意义上变得“更聪明”,并不一定会使其成为更好的驾驶员。

研究还揭示了这些模型在面对真实驾驶场景时的具体失败方式。一种常见的错误涉及对车辆近期历史的过度依赖。如果一辆车刚刚在交叉路口右转,即使车辆已经转正且前方道路畅通,模型也往往会继续预测一个向右的曲线运动。它们难以根据当前的视野更新其心理模型,而是将之前的动作向前投影。在其他情况下,模型无法协调冲突的视觉线索。当交通灯变绿但前方有一辆车停住时,一些模型正确预测了车辆应当等待,而另一些模型则忽略了障碍物,预测车辆会冲过路口。同样,在接近红灯时,一些模型预测的是突然的剧烈停车而非平稳减速,而另一些模型则完全未能减速。

除了准确性之外,研究人员还考察了使用这些模型的实际成本。他们发现,推理时间(即模型处理图像并生成预测所需的时间)差异巨大。最快的模型处理单帧图像约需 4.5 秒,而最慢的模型则需要超过 40 秒。对于在高速公路上行驶的汽车来说,等待几秒钟来做出决策实在是太长了;实时驾驶需要在毫秒内做出决策。此外,使用商业模型执行此任务的成本也很高,某些模型每帧的成本达数美分,这对于持续运行而言将产生难以承受的费用。研究还指出,即使是最好的模型偶尔也会无法遵循指令,产生难以读取或解析的输出,不过研究人员开发了一种方法来纠正大多数此类格式错误。

最终,这项工作表明,利用视觉语言模型实现安全自动驾驶的路径不仅仅是等待下一代通用人工智能的到来。这些模型能够描述场景并理解语言,但它们缺乏导航物理世界所需的特定领域训练直觉。研究人员得出结论,要使这些系统具备可行性,它们需要专门的适配,以学习驾驶的具体规则和动力学特性,而不仅仅是依赖其广泛的通用推理能力。LightEMMA 框架现在已成为社区用于持续测试和改进这些模型的工具,以确保人工智能的未来进步能转化为道路上切实的改进。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →