← 最新论文
💬 NLP

Pathways of Visual Information Flow in Vision-Language Models

本文揭示了视觉语言模型利用两条截然不同的、依赖于任务的视觉信息流路径——一条是直接路径,另一条是文本介导路径——这两条路径展现出了卓越的灵活性,并且能够在特定的干预下切换至回退机制。

原作者: Israfel Salazar, Stella Frank, Dan Oneata, Desmond Elliott, Constanza Fierro

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Israfel Salazar, Stella Frank, Dan Oneata, Desmond Elliott, Constanza Fierro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将视觉语言模型(VLM)视为一名精明干练的侦探,正试图根据一张照片和一个书面问题来破解谜题。这篇论文提出了一个简单但深刻的问题:这个侦探究竟是如何通过观察照片来寻找答案的? 侦探是直接观察照片,还是先向同事描述照片,再由同事告诉侦探答案?

研究人员发现,这些 AI 模型并不只使用一种思考方式。相反,它们拥有两条不同的“路径”或通道,将视觉信息传递给最终答案,并会根据具体情况在两者之间切换。

以下是利用简单的类比对研究结果进行的拆解:

1. 两条路径

把 AI 的大脑想象成一个繁忙的办公室,有两个方式将文件从“图像部门”传递到“最终决策者”(即输入最终答案的最后一个 token)。

  • 直接高速公路(直接路径):

    • 运作方式: 最终决策者直接看向图像部门。他们直接抓取视觉信息,就像直接从桌子上拿走一份文件一样。
    • 使用场景: 研究发现,这是进行物体识别(例如:“这是什么物体?”)的主要路径。它既快速又直接。模型看到一颗星星,直接说出“星星”,无需先进行一番描述。
  • 信使路径(文本中介路径):

    • 运作方式: 图像部门并不直接与最终决策者交谈。相反,他们将视觉信息交给“问题撰写者”(即文本 token)。问题撰写者处理图像,将其转化为文字,然后将信息传递给最终决策者。
    • 使用场景: 这是进行空间关系任务(例如:“杯子相对于盘子的位置在哪里?”)的主要路径。模型似乎需要在用语言“思考”这种关系后才能给出答案。

2. 切换机制

最令人惊讶的发现是,模型并不会困在某一条路径上。它就像一名司机,通常走高速公路,但如果高速公路被封堵,它可以瞬间切换到小路。

  • 任务依赖性: 模型根据任务类型选择路径。
    • 简单识别任务: 使用直接高速公路。
    • 复杂关系任务: 使用信使路径。
  • 数据依赖性: 路径会根据图片类型而改变。例如,在识别物体位置(定位)时,当面对简单的计算机生成图形时,模型使用直接高速公路;但当观察复杂的真实世界照片时,它会切换到信使路径。
  • 提示词依赖性: 甚至你提问的方式也会改变路径。如果你给模型一个多选题列表(例如:“是 A、B 还是 C?”),它往往会切换到信使路径。如果你让它自由回答,它通常会采取直接高速公路。

3. “备用方案”的发现

这是这篇论文最关键的部分。研究人员测试了如果“破坏”其中一条路径会发生什么。

  • 实验方法: 他们使用了“因果修补”(causal patching,想象一下将侦探的记忆替换为另一种情景)和“注意力敲除”(attention knockouts,想象一下给侦探戴上眼罩,使其无法直接观察照片)的技术。
  • 结果:
    • 当他们封锁了直接高速公路时,模型并没有失败。相反,它立即切换到了信使路径,并依然得到了正确答案!
    • 即使对于那些模型通常会直接观察照片的任务(如识别物体),如果你强迫它停止观察,它仍然可以通过依赖过程中生成的文本描述来解决问题。

4. 为什么这很重要(“顿悟”时刻)

论文解释了为什么之前的研究会产生混淆,因为他们只看到了故事的一面。

  • 有些研究人员封锁了直接路径,发现模型仍在工作,因此得出结论认为模型始终使用文本路径。
  • 其他研究人员观察正常行为,看到模型正在直接观察图像,因此得出结论认为文本路径是不需要的。

真相是: 模型同时激活了两条路径。它通常会根据特定任务选择最高效的那一条。然而,如果你干扰模型(比如封锁了一条路径),它就会启动它的“备用方案”。

核心启示: 你不能仅仅通过破坏模型的一部分来假设你知道 AI 是如何思考的。如果你破坏了“直接高速公路”,AI 可能会转而通过“信使路径”来解决问题并取得成功,这会让它看起来好像从未需要过那条高速公路一样。这篇论文表明,这些模型具有极强的灵活性,能够根据你的提问方式和允许的操作权限,通过多种方式来解决同一个谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →