← 最新论文
💻 computer science

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

本文通过引入“危险”(hazard)与“异常”(anomaly)之间的关键区别来评估视觉语言模型,揭示了当前模型经常将场景中的不规则现象误解为危险,并证明了将这两个概念区分开来比传统的二元判断能更准确地评估安全推理能力。

原作者: Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu, Stephanie Lukin, Cynthia Matuszek

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu, Stephanie Lukin, Cynthia Matuszek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是某台高科技救援机器人的队长,任务是扫描混乱的灾难区域以确保人们的安全。你的机器人大脑是一个“视觉语言模型”(VLM),它是一个超级聪明的 AI,能够观察一张图片并描述它所看到的内容,就像一个非常爱说话、观察敏锐的朋友一样。但棘手的部分在于,在真实的紧急情况下,你的机器人需要能够区分什么是“奇怪的”以及什么是“致命的”。一堆色彩鲜艳、被遗弃的玩具可能看起来很奇怪且格格不入,但它们不会伤害任何人。然而,一堆带电的电线则是危险的,即便它们看起来完全正常。如果你的机器人无法区分“古怪”与“危险”,它可能会对着一件红色的戏服大喊“着火啦!”,从而分散救援人员对真正威胁的注意力;或者更糟,它可能会因为某个陷阱看起来太熟悉而忽略了它。这篇论文深入探讨了我们目前的 AI 机器人是否足够聪明,能够做出这种至关重要的区分,还是仅仅根据一个场景看起来有多“异常”来进行猜测。

这项研究背后的研究人员,Murali Indukuri 及其团队,决定用一种全新的考试方式来测试这些 AI 大脑。他们没有只是问机器人“这是安全还是不安全?”(一个简单的是非题),而是要求它们将场景归入四个特定的类别:安全(一切正常)、异常(有些奇怪或格格不入,但安全)、危险(某些东西很危险,但看起来很正常)以及异常-危险(既奇怪又危险)。他们创建了一个包含 610 张图像的特殊数据集来充当测试题。

当他们进行测试时,发现机器人表现出一种有趣但令人担忧的习惯。这些 AI 模型就像是过度热情的报警器,把“奇怪”误认为“可怕”。如果一个场景看起来很不寻常——比如一个烤面包机放在浴缸里——即使这个烤面包机没插电且完全安全,AI 也经常会大喊“危险!”。研究表明,这些模型过于依赖场景呈现出的“不规则感”来判断是否危险,而不是真正理解情况背后的物理逻辑。这就像是机器人认为:“这看起来不对劲,所以它一定是个怪物!”

团队还尝试了不同的提问方式,以观察是否可以修复这个问题。他们使用了三种主要策略:

  1. 零样本学习 (Zero-Shot):仅给出定义并让机器人进行猜测。
  2. 少样本学习 (Few-Shot):在要求机器人判断新场景之前,先给它看一些“奇怪但安全”和“危险”场景的例子。
  3. 思维链 (Chain-of-Thought):要求机器人像做数学题一样,逐步说出自己的推理过程。

结果显示,虽然通过正确的提示词,机器人识别实际危险(危害)的能力有所提高,但在区分“奇怪”与“致命”方面仍然很吃力。表现最好的模型(如 GPT-4.1 和 Gemini 3 Flash)在识别危险方面达到了约 85% 的准确率,但在识别那些仅仅是奇怪但安全的事物时,信心却要低得多。即使是最聪明的模型也会犯错,有时会漏掉真正的危险,或者将无害的奇特事物标记为威胁。

有趣的是,研究人员还测试了如果只给机器人一段关于图片的文字描述(“密集描述”)而不是图片本身会怎样。令人惊讶的是,只用文本时机器人的表现反而更差了!这似乎表明,对于这项特定的工作,亲眼看到实际图像仍然至关重要,仅仅阅读描述并不足以帮助 AI 理解语境。

论文总结道,虽然这些 AI 模型正在变得越来越擅长它们的工作,但它们还没有准备好成为安全关键场景的唯一守护者。它们往往会对任何看起来不寻常的事物反应过度。作者建议,通过强制 AI 在训练和测试中明确区分“奇怪”与“危险”,我们可以帮助它变得更加可靠。他们还发现,他们这种更详细的测试方法比旧的“安全 vs 不安全”测试更能捕捉到这些错误。虽然目前的模型是朝着正确方向迈出的一步,但研究表明,我们需要不断改进教导它们思考的方式,确保它们不会因为一个小丑的红鼻子而惊慌失措,却忽略了真正的火灾。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →