← 最新论文
💻 computer science

Where To Look? : Causal Tracing of Vision Encoders in VLM

本文通过因果追踪发现,视觉语言模型经常依赖目标区域之外的视觉标记,并利用外观线索来理解结构,从而揭示了其高性能描述与对视觉信息的实际空间定位或结构推理能力之间存在根本性的差距。

原作者: Naren Kumar S, Tirth Bhatt, Mayank Singh

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Naren Kumar S, Tirth Bhatt, Mayank Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

侦探的困境:AI 的眼睛究竟是如何“看”的?

想象一下,你正试图教会一个机器人理解世界。你给了它一个摄像头和一个大脑,并要求它描述一张狗的照片。多年来,科学家们一直对这些“视觉语言模型”(VLMs)能够如此精准地完成任务感到惊叹。但一个挥之不去的疑问始终存在:它们究竟是“如何”做到的?它们是真的像我们一样“看到”了那只狗,还是仅仅根据微小的、隐藏的线索在进行猜测?

为了回答这个问题,研究人员使用了一种叫做**因果追踪(causal tracing)**的技术。你可以把它想象成侦探手中的“假设”情景。如果你从机器人的大脑中取走一段特定的信息,并用另一段不同的信息替换它,答案会改变吗?如果答案发生了剧烈变化,那么这段信息就是“具有因果重要性”的。通常,我们会假设如果一个机器人在谈论一只狗,那么它大脑中最重要的部分一定正盯着那只狗看。但如果机器人实际上是在关注草地、天空或阴影,并仅仅是“猜”出了那里有一只狗呢?这篇论文深入探讨了这个谜团,探讨了 AI 中起关键作用的部分是否真的在注视着正确的地点。


该看哪里?AI 的大误导

在这项研究中,来自 LINGO 研究小组的研究人员决定玩一场“找不同”的游戏,对象是世界上一些最聪明的 AI 模型。他们想知道:当一个 AI 回答关于图像的问题时,其大脑中承担重任的部分,是否真的在注视着目标物体?

为了找出答案,他们使用了一个巧妙的技巧——激活修补(activation patching)。想象一下,AI 的大脑是一个拥有数千名工人(称为“标记/tokens”)在传送带上传递笔记的巨大工厂。

  1. 清晰运行(The Clean Run): 他们向 AI 展示一张清晰的照片和一个问题,例如“穿蓝衣服的女士在哪里?”AI 会给出一个反映其对图像理解程度的分数。
  2. 损坏运行(The Corrupted Run): 他们使用同一张照片,但加入大量的静态噪声(就像把电视调到雪花频道),让 AI 变得困惑,从而导致其分数下降。
  3. 修补运行(The Patched Run): 这是神奇的一步。他们取出那张“困惑”的噪声照片,但在工厂流水线中偷偷混入一张来自原始照片的单一、清晰的笔记。如果 AI 突然记起了答案,且分数回升,那么这个特定的笔记就是那个“英雄”标记(hero token)。

随后,研究人员提出了一个简单的问题:这个“英雄”标记是否来自于显示那位穿蓝衣女士的部分图像? 为了衡量这一点,他们使用了一个名为 IoU(交并比)的数学工具,这是一种高级的表达方式,本质上是在问:“这个笔记与实际的女士有多大的重叠程度?”

震惊的发现:AI 正在看向除了正确位置之外的所有地方

结果有点像发现你的好朋友在解数学题时,不是盯着数字看,而是盯着天花板。

团队测试了从经典的 CLIP 模型到庞大的现代巨头,如 DeepSeek-VL、Qwen-2.5 和 LLaVA。他们原本预期会发现那些最具“因果性”的标记(即英雄们)会聚集在目标物体上方。然而,他们发现这种联系非常微弱,几乎不存在。

  • 数据不会撒谎: 在 CLIP 模型中,“重要性”与“处于正确位置”之间的相关性仅为 0.062。这几乎等于零。
  • 模式依然存在: 即使在更大、更聪明的模型中,数值依然很低。对于 DeepSeek-VL,一种噪声下的相关性为 0.0531 ± 0.0334,另一种为 0.0520 ± 0.0041。对于 Qwen-2.5,相关性为 0.0912 ± 0.0422
  • “零重叠”的惊喜: 在一个特定的例子中,一个对答案有巨大影响的标记(因果分数为 0.718)与目标物体的重叠度极低(IoU 仅为 0.049)。这就像是 AI 通过观察背景而非主体来解开了谜题。

作者认为,这些模型非常擅长“利用”视觉信息,但它们并不一定“锚定(grounded)”在信息的特定位置。它们可能依赖于一个“分布式”的线索网络——比如天空的颜色、地板的纹理或场景的整体氛围——而不是聚焦于特定的物体。

规模更大意味着更好吗?

你可能会想:“也许旧的、较小的模型只是在这方面表现不好,而新的超级 AI 已经解决了这个问题。”研究人员也对此进行了检查。他们观察了从 2023 年到最新的 2025 年发布的模型。

结论是:并没有。 模式并未改变。即使是最先进的模型,能够完美回答复杂问题并遵循指令,仍然表现出这种脱节。作者指出,仅仅因为一个模型在测试中获得了高分,并不意味着它发展出了更好的“空间映射”。这表明,强大的性能并不自动意味着 AI 正在看向正确的地方;它只意味着它非常擅长利用它能找到的任何线索来猜出正确的答案。

“绳索”测试:它们理解形状吗?

为了进一步挖掘,团队提出了一个不同的问题:如果你拿走了物体的“外观”,但保留了它的形状,AI 还能识别吗?他们使用了一个涉及绳索(线条)的任务,其中保持几何结构(形状和连接)不变,但改变外观。

他们发现,模型会利用视觉线索来理解视觉结构。当这些基于外观的线索被移除时,模型很难维持对结构的理解。这表明,AI 并不是在一种独立于外观的深层结构化方式下“看到”形状;它高度依赖于这些表层外观的“小技巧”来理解连接。当这些技巧消失时,AI 就迷失了。

这对未来意味着什么

论文以一个清晰、甚至略显不安的信息结尾:“看见”与“推理”之间存在着鸿沟。

这些模型并没有坏掉,它们只是以一种我们未曾预料的方式在工作。它们就像一个侦探,可以通过注意到嫌疑人总是戴红帽子来破案,而无需真正看向嫌疑人的脸。它们大脑中的“因果”部分确实在发挥作用,但它们并不一定在注视着目标。

作者目前计划研究更多的模型和不同类型的相机架构,以观察这是一种适用于所有现代 AI 的普遍规律,还是仅仅是他们所测试模型的特质。目前来看,他们建议我们不要认为仅仅因为一个 AI 能完美描述图像,它就是在以我们理解的方式“注视”着物体。AI 可能看到了整幅画面,却忽略了我们所关心的那个特定点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →