← 最新论文
💻 computer science

Benchmarking Vision Foundation Models for Input Monitoring in Autonomous Driving

本文提出并评估了一种新颖的无监督框架,该框架将视觉基础模型与密度估计技术相结合,以有效检测自动驾驶中的语义分布偏移和协变量分布偏移,在识别高风险分布外输入方面优于现有方法。

原作者: Mert Keser, Halil Ibrahim Orhan, Niki Amini-Naieni, Gesina Schwalbe, Alois Knoll, Matthias Rottmann

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Mert Keser, Halil Ibrahim Orhan, Niki Amini-Naieni, Gesina Schwalbe, Alois Knoll, Matthias Rottmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对该论文的解读。

核心难题:道路上的“意外”

想象一下,你利用德国晴天拍摄的海量照片库来训练一辆自动驾驶汽车,让它认识这个世界。这辆车学会了在那特定图库中“汽车”、“行人”和“停车标志”长什么样。

但现实世界是混乱的。如果这辆车突然遇到以下情况,会发生什么:

  1. 一种新型物体:一个巨大的、漂浮的气球动物,看起来既不像车也不像人(这是一种语义偏移)。
  2. 一种怪异的气象条件:刺眼的镜头光晕或浓雾,即使物体本身没变,也让一切看起来截然不同(这是一种协变量偏移)。

汽车的“大脑”可能会感到困惑并犯下危险的错误,因为它从未见过这些“意外”。本文旨在构建一个安全卫士,它站在汽车大脑旁边,说道:“等一下,这个输入与我们研究过的照片完全不像。我们现在不应该信任我们的决定。”

解决方案:“超级读者”与“密度图”

作者提出了一种构建该安全卫士的新方法。他们不是从头开始训练一个新的专用模型,而是利用视觉基础模型(VFMs)

  • 类比:想象一个标准的 AI 模型就像一个只为特定数学考试而学习的学生。如果你问他们一个关于历史的问题,他们会不知所措。
  • 视觉基础模型(VFM):想象视觉基础模型是一位博学的图书管理员,他读过数百万本书,见过数十亿张图片,并理解几乎所有视觉事物的深层“氛围”或“本质”。他们虽然并非专门针对自动驾驶进行训练,但对世界的理解极其深刻。

本文测试了四种这样的“超级读者”(如 CLIP、DINO 和 Grounding DINO),以观察哪一种最擅长发现这些“意外”。

卫士如何工作:“拥挤房间”测试

一旦“超级读者”查看了一张图像,它就会将其转化为数学代码(即“特征向量”)。随后,本文使用一种称为密度建模的技术来判断该代码是“正常”还是“怪异”。

  • 类比:想象训练数据(汽车研究过的照片)是一个挤满了穿蓝色衬衫的人的拥挤房间
    • 正常输入(分布内):一个穿着蓝色衬衫的新人走了进来。他们完全融入其中。卫士会说:“安全,继续前行。”
    • 协变量偏移:一个穿着蓝色衬衫的人走了进来,但他们浑身是泥,或者光线让他们看起来呈紫色。他们仍然在“蓝衬衫人群”中,但看起来有点不对劲。
    • 语义偏移:一只巨大的绿色龙走了进来。它完全在“蓝衬衫人群”之外。

本文测试了不同的数学工具(如归一化流高斯混合模型),以绘制出那个“拥挤房间”的地图。如果新图像落在地图之外,卫士就会将其标记为潜在的故障风险。

他们的发现:“超级读者”胜出

研究人员进行了一项大规模测试(即“基准测试”),将这些“超级读者”与旧的、标准的 AI 方法进行了比较。

  1. 优于旧卫士:在发现“绿龙”(新物体)和“沾泥的蓝衬衫”(怪异天气)方面,“超级读者”的表现远优于传统方法。
  2. 最佳组合:他们发现,将一种特定的“超级读者”——Grounding DINO(它非常擅长理解复杂场景)与一种特定的数学工具——归一化流相结合,是“冠军”。它在识别汽车何时看到了不应信任的事物方面几乎完美无缺。
  3. 现实世界证明:他们并未止步于检测。他们表明,如果在汽车做决定之前利用该卫士过滤掉那些怪异的图像,汽车的实际驾驶性能会显著提高。这就像俱乐部的保镖将那些喧闹、不可预测的人拒之门外,从而让里面的派对对所有人来说更安全。

核心结论

本文证明,我们不需要为每一辆自动驾驶汽车构建一个新的专用安全系统。相反,我们可以利用这些强大的、预训练的“超级读者”(基础模型)作为通用的安全监控器。它们可以实时告诉我们,当汽车看到了它无法理解的事物时,系统可以在事故发生前暂停或切换到备用方案。

关键要点:通过使用“超级读者”来描绘“正常”的模样,我们可以比以往更好地捕捉危险的意外(无论是新物体还是怪异天气),从而使自动驾驶更安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →