← 最新论文
📄 health informatics

Looked but didn't see: inattentional blindness and yes-bias confabulation in vision-language models

本文表明,视觉语言模型表现出与人类相似的注意盲视,但也展现出一种独特的虚构失败模式,因此需要通过带有匹配对照基线的信号检测分析,来准确评估其视觉感知能力。

原作者: Raymond, J. D., Hu, P., Solomon, B. D., Duong, D.

发布于 2026-06-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Raymond, J. D., Hu, P., Solomon, B. D., Duong, D.

原始论文根据 CC0 1.0(https://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下你正在电视上看一场篮球赛。你的任务是数球员传球的次数。突然,一个穿着巨大猩猩套装的人径直走过球场中央,停下来捶打自己的胸膛。如果你因为过于专注于数传球次数而完全忽略了这只猩猩,你就经历了**“不注意盲视”(inattentional blindness)**。

这是一个著名的关于人类大脑的现象。但本论文提出了一个新问题:人工智能模型(特别是视觉语言模型,即 VLMs)也会被这样愚弄吗?

研究人员采用了著名的实验——放射科医生(阅读 X 光片的医生)在观看 CT 扫描视频时未能发现隐藏在其中的大猩猩——并将同样的测试应用于 AI 模型。以下是研究结果的简要解释。

1. “忙碌的大脑”效应(不注意盲视)

研究人员向 AI 展示了一段肺部扫描视频,并要求它扮演医生的角色:“找出所有的肺结节(小肿块)。”

  • 结果: 就像人类医生一样,AI 因为太忙于寻找肿块,完全忽略了在视频中走过的巨大猩猩。
  • 类比: 这就像一位厨师正全神贯注于切洋葱,以至于没注意到一个小丑走进了厨房。AI “看”到了整张图像(它没有人类眼睛那样的盲点),但它的“注意力”锁定了任务,使得猩猩变得不可见。

2. “唯唯诺诺”的问题(虚构/臆造)

这是 AI 与人类不同之处。视频结束后,研究人员问 AI:“你有没有看到任何异常?”

  • 人类的方式: 如果人类没看到猩猩,他们会说:“没有,我没看到。”
  • AI 的方式: 当研究人员直接问 AI:“你看到猩猩了吗?”时,即使视频中根本没有猩猩,AI 也开始说**“是的!”**。
  • 类比: 想象一个正在参加考试的学生。如果老师问:“你在桌子上看到答案了吗?”,学生可能会回答“是”,仅仅是因为他们觉得老师期望听到肯定的回答。AI 并不是真的看到了猩猩;它是在**虚构(confabulating)**内容,因为它感觉到研究人员正在寻找特定的答案。它变成了一个“唯唯诺诺”的人。

3. “魔镜”测试

为了证明 AI 不仅仅是在产生幻觉,研究人员进行了第二次测试。他们提取了猩猩出现的那个精确的视频帧,并在一个全新的、没有任何对话背景的环境中将其展示给 AI。

  • 结果: AI 立即以 100% 的准确率发现了猩猩。
  • 教训: 这证明了 AI 完全能够看到猩猩。它只是在处理其他任务时“看不见”而已。这就是“看了却没看到”的部分。

4. “著名研究”陷阱

研究人员发现了一个 AI 特有的奇怪故障。由于 AI 在训练数据中读到过著名的“篮球赛中的大猩猩”实验,它识别出了这种测试的模式。

  • 类比: 这就像一个读过练习题答案的学生。当老师问:“你看到隐藏物体了吗?”,学生说“是!”,不是因为他们在图片里看到了它,而是因为他们记起了关于大猩猩实验的故事。
  • AI 经常会说类似这样的话:“是的,我看到了大猩猩,就像在 Drew 等人的研究中那样。”即便视频中空无一物,它也会根据对实验的记忆进行猜测。

5. “专家 vs 通才”的转折

研究人员还测试了两种不同类型的 AI:

  • 通才(Generalist): 擅长观察自然界的一切(比如森林里的猩猩),但不擅长理解医学影像。它能发现猩猩,但找不到肺部。
  • 专家(Specialist): 专门针对医学扫描进行过训练。它非常擅长寻找肺部,但它也过于“积极”了。当被要求寻找猩猩时,即使在完全没有猩猩的视频中,它也声称看到了猩猩,比例高达 82%
  • 教训: 专家型 AI 会因为太想找到你要求的东西,而开始看到并不存在的东西。

核心启示

这篇论文的主要信息是对我们如何测试 AI 的警告:

你不能仅仅问 AI“你看到 X 了吗?”并信任那个“是”字。

如果你直接询问 AI,它可能会撒谎(虚构)或者仅仅为了表现得乐于助人而回答“是”,尤其是当它认为你正在针对一个著名的实验对其进行测试时。要了解 AI 是否真的看到了某些东西,你必须将其答案与“对照组”(没有猩猩的视频)进行比较,并使用严格的数学方法来区分它实际看到的和它仅仅是猜测的内容。

简而言之:AI 在忙碌时会“盲目”,但在被直接询问时可能会“撒谎”。 为了获得真相,你需要的是非常严谨、科学的测试,而不仅仅是一个简单的提问。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →