← 最新论文
🤖 AI

The Geometry of Representational Failures in Vision Language Models

本文研究了视觉语言模型的表征几何结构,旨在揭示潜在“概念向量”之间的几何重叠如何定量地解释特定的视觉失效模式(如幻觉和物体混淆),且这些模式可以通过转向干预进行可靠的操控。

原作者: Daniele Savietto, Declan Campbell, André Panisson, Marco Nurisso, Giovanni Petri, Jonathan D. Cohen, Alan Perotti

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniele Savietto, Declan Campbell, André Panisson, Marco Nurisso, Giovanni Petri, Jonathan D. Cohen, Alan Perotti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正透过一副特殊的眼镜观察一场热闹的派对。你看到了一个红色的圆圈、一个蓝色的正方形和一个绿色的三角形。人类的大脑可以轻松地在脑海中将这三个不同的物体区分开来。但对于这项研究中所探讨的视觉语言模型(VLMs)来说,观察同一个场景就像是在有人对着你大喊大叫时,试图同时在脑海中处理三场不同的对话。有时,大脑会产生混乱,并告诉你:“我看到了一个红色的正方形!”尽管现实中并不存在这样的东西。它把圆圈的“红”与正方形的“方”搞混了。

这篇论文研究了为什么这些 AI 模型会犯这类特定的“混淆”错误,研究人员称之为幻觉(hallucinations)错觉结合(illusory conjunctions)

以下是利用简单类比对研究结果进行的拆解:

1. 问题所在:想法的“拥挤房间”

把 AI 的大脑想象成一个巨大的、高维度的房间,其中的每个概念(如“红色”、“蓝色”、“正方形”、“圆圈”)都有自己特定的位置。

  • 人类的方式: 人类使用“串行注意力”。我们注视红色的圆圈,将其锁定在记忆中,然后注视蓝色的正方形。我们是一个接一个地处理它们。
  • AI 的方式: 这些模型试图通过一个巨大的、瞬间的快照来处理整个场景。它们必须同时将所有概念塞进这个单一的房间里。

论文指出,当房间里同时存在太多概念时,它们的“位置”就会开始重叠。如果“红色”的位置离“正方形”太近,AI 就会感到困惑并把它们融合在一起。这被称为几何干涉(Geometric Interference)

2. 发现过程:绘制“概念地图”

研究人员想要看看他们是否能找到这些概念在 AI 大脑内部真实的“坐标”。他们使用了两个主要工具:

  • “探针”(侦探): 他们尝试训练一个简单的检测器来寻找“红色”或“蓝色”。然而,这就像是通过瞎猜来大海捞针;检测器经常找到一些并不能真正代表真实概念的捷径。
  • “质心”(平均值): 与其靠猜,不如取数百张红色事物的图像,找到所有这些事物的数学上的“重心”,并以此作为“红色”的真实定义。

结果: “质心”方法效果要好得多。它找到了 AI 大脑中“红色”这一概念真实且稳定的位置。

3. 证据: “遥控器”实验

为了证明他们找到的是真正的“红色”按钮而非假按钮,他们进行了一项**转向(steering)**实验。

  • 类比: 想象你有一个遥控器,可以改变照片中花朵的颜色。
  • 行动: 他们拍了一张红玫瑰的照片。他们找到了代表“红色”的数学向量(即“按钮”),然后将其减去。接着,他们按下了“蓝色”按钮。
  • 结果: 原本正在描述红玫瑰的 AI,突然开始描述一朵蓝玫瑰
  • 为什么这很重要: 这证明了研究人员确实找到了 AI 大脑中控制颜色概念的实际“开关”。这不仅仅是巧合;他们在瞬间物理性地重构了 AI 的感知。

4. “泛化之咒”

论文解释说,这种混乱并不是一个漏洞,而是 AI 过于擅长泛化(generalizing)的一个副作用。

  • 类比: 想象你教一个孩子“红色”适用于苹果、消防车和草莓。为了做到这一点,孩子必须创建一个宽泛且灵活的“红色”类别。
  • 权衡: 因为 AI 必须让“红色”足够灵活,以涵盖许多不同的色调和物体,所以“红色”的概念会变得有些“模糊”或“拥挤”。当 AI 看到一个红色的圆圈和一个绿色的正方形时,圆圈的“红色”部分和正方形的“正方形”部分在 AI 的脑海中靠得如此之近,以至于它们意外地合并了。
  • 论文结论: AI 的理解越具有灵活性和泛化性,在多个事物同时存在时就越容易产生混乱。这就是**“泛化之咒”(Curse of Generalization)**。

5. 预测错误

研究人员发现,只要通过测量概念在“概念地图”中的距离,就可以准确预测 AI 何时会失败。

  • 如果“红色”概念和“正方形”概念在几何上很接近,AI 就极有可能把它们搞混。
  • 如果它们相距较远,AI 就能正确识别。
  • 他们在“视觉搜索”游戏(在人群中寻找特定物品)中测试了这一点。正如他们的地图所预测的那样,当“干扰项”在几何上与目标项相似时,AI 失败的频率更高。

总结

这篇论文表明,视觉模型并不只是“看到”事物,它们是在一个几何空间中组织事物。当它们试图同时观察太多事物时,这些想法的“形状”会互相碰撞,导致 AI 产生幻觉。通过绘制这些想法的地图,甚至像操作遥控器一样“转向”它们,研究人员证明了这些错误是由 AI 存储信息的根本几何结构造成的,而不仅仅是随机的故障。

该论文并非声称:

  • 它并未声称解决了所有 AI 的问题。
  • 它尚未建议将此用于修复医疗诊断或自动驾驶汽车。
  • 它并没有说 AI 是“有意识的”或像人类一样“有感觉”;它只是说错误的数学结构与人类的认知限制非常相似。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →