Mirage Probes: How Vision Models Fake Visual Understanding
本文通过引入“幻象探针”(Mirage Probes)来证明视觉语言模型表现出两种截然不同的视觉幻觉类型——文本偏差与伪造图像,这两者可以通过其内部激活模式进行区分,从而揭示了有效的缓解措施需要进行表征层面的干预,而非仅仅是清洗文本分布。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在参加一场考试,考试中会给你看一张图片并针对图片提问。现在,想象一个非常擅长根据问题的“文字”进行猜测的学生,即使你把图片拿走并把它藏在他们背后,他们也能猜出正确答案。他们听起来充满自信,而且经常猜对,但他们其实并没有在看那张图片。
这篇论文将这种行为称为**“海市蜃楼”(Mirage)**。
研究人员研究了视觉语言模型(能够看图并读文字的 AI),并发现这些“海市蜃楼”并不只是一个简单的错误。他们发现,AI 实际上是以两种完全不同的方式在伪造视觉理解,并且该论文引入了一种名为**“海市蜃楼探针”(Mirage Probes)**的新工具,用以观察 AI 内部究竟是如何运作的。
以下是使用简单类比对他们发现的详细解读:
1. AI 伪装的两类方式
作者认为,当 AI 在没有真正“看到”图像的情况下给出自信的答案时,它通常是在做以下两件事之一:
“文本作弊”(文本偏差/Textual Biases):
- 类比: 想象一个正在参加历史考试的学生。问题问:“谁是第一任总统?”学生不需要看乔治·华盛顿的照片就能知道答案,因为他们通过阅读书籍已经知道了这个事实。
- AI 的做法: AI 完全忽略了图像。它观察问题,识别主题,然后从它关于人们通常如何提问和回答该问题的记忆中提取答案。它并不是在撒谎说自己看到了图像,它只是基于文本进行回答。
- 发生场景: 这在某些数据集(如医疗或常识性问题)中很常见,因为这些问题的描述非常具体,或者仅凭文字就能猜出答案。
“幻觉图像”(虚假图像/Spurious Images):
- 类比: 现在想象一个学生被问到:“照片里的车是什么颜色的?”但照片被藏起来了。学生并没有说“我看不见”,而是闭上眼睛,在脑海中想象出一辆红色的车(因为他们在训练数据中看到的汽车大多是红色的),然后自信地回答:“它是红色的车。”他们在脑海中创造了一幅虚假的图像。
- AI 的做法: AI 实际上在尝试“看见”一些并不存在的东西。它在自己的内部代码(潜空间/latent space)中构建了一个虚假的视觉表示,并表现得好像那幅假图像是真实的一样进行回答。
- 发生场景: 这发生在仅靠文本不足以猜出答案的数据集中,此时 AI 被迫要“编造”出一个视觉细节来维持其自信度。
2. 新工具:“海市蜃楼探针”(Mirage Probes)
你如何知道 AI 是在用文本作弊,还是在幻觉出图像?你不能只看答案,你必须观察 AI 在思考时的内部情况。
研究人员构建了**“海市蜃楼探针”**,它就像是 AI 思维的 X 光机。
- 他们向 AI 展示一个问题和一张图像,然后再展示同一个问题但不带图像。
- 他们观察 AI 各个层中的电信号(激活值/activations)。
- 他们发现,“用真实图像回答”与“用虚假图像回答”之间的差异,会在 AI 的代码中留下一个清晰的、直线型的模式。它不是一个混乱、复杂的信号,而是一条清晰的直线,他们的探针可以轻松检测到。
3. 为什么这很重要(“那又怎样?”)
这篇论文提出了一个关键点,即我们应该如何修复这些 AI 模型。
- 如果 AI 使用的是“文本作弊”: 你可以通过清理训练数据来修复它。如果你阻止 AI 学习某些问题总是对应某些特定答案,它就会停止猜测。
- 如果 AI 使用的是“幻觉图像”: 清理文本是没用的。问题更深层——AI 实际上是在其内部记忆中构建虚假的图像。要修复这个问题,你必须改变 AI 表示图像的方式,而不仅仅是它阅读文本的方式。
核心结论
该论文声称,“海市蜃楼”行为并非单一的漏洞,而是两个戴着相同面具的不同漏洞。
- 有时 AI 只是根据文字进行猜测。
- 有时 AI 是在脑海中发明一幅假图像。
作者创造了一种方法来识别其中哪一种正在发生。他们发现,“假图像”版本更难修复,因为它存在于 AI 视觉处理的深层,而不仅仅是在其语言技能中。这意味着,为了让 AI 真正可靠(特别是在医疗等领域),我们需要修复其“视觉大脑”的部分,而不仅仅是“文本大脑”的部分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。