← 最新论文
🤖 machine learning

Diagnosing Visual Ignorance in Vision-Language Models

本文通过层级分析揭示内部路由失败,并证明当前的基准测试往往通过一种渐进式视觉衰减指标来奖励视觉忽视,从而研究了视觉语言模型对语言先验而非视觉证据的系统性依赖。

原作者: Runyu Zhou, Qi Zhang, Qixun Wang, Yisen Wang

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Runyu Zhou, Qi Zhang, Qixun Wang, Yisen Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:那个“不看图”的聪明学生

想象一个正在参加考试的学生。这个学生读过数百万本书,根据以往的阅读经验,几乎能回答任何问题。然而,考试中也包含了一些图片,而这些图片本应是寻找答案的依据。

这篇论文发现的问题是,这个学生经常忽略图片。即使图片很模糊、颠倒或者完全是黑色的,这个学生也会自信满满地写下他们认为基于阅读经验“最可能”的答案,而不是根据图片实际内容给出的答案。论文将这种现象称为**“视觉无知”(Visual Ignorance)**。

研究人员想要探究:

  1. 模型是如何决定忽略图片的?(内部机制)
  2. 这个问题在标准测试中到底有多严重?(外部行为)

第一部分:机器内部(“工厂”类比)

为了理解模型是如何运作的,请将 AI 的大脑想象成一条拥有 30 多个工作站(层)的长长的工厂流水线。图像和问题从起点进入,最终答案在终点输出。

研究人员发现,这个工厂存在两个阶段的故障

  1. 中间站(“丢包”问题):
    在流水线的中间,工人们(层)理应抓取图像中的视觉细节。但通常情况下,他们会把包裹弄丢。他们无法捕捉到特定的、微小的细节(比如精确计算一只动物有多少条腿)。他们太忙于关注文本指令了。

  2. 最后站(“否决经理”问题):
    即使中间的某个工人确实设法抓住了正确的视觉细节,流水线末端的经理们(最后的层)也往往会将其丢弃。他们会说:“不,这不符合我们书本上的知识。”他们主动压制了视觉真相,并用基于语言模式的猜测来取代它。

实验过程:
研究人员尝试用经过训练、能够关注图片的“聪明”工人,去替换不同站点的工人。

  • 结果: 只更换最后的经理们效果有限;只更换中间的工人也效果有限。他们必须同时更换两者才能解决问题。这证明了“视觉无知”是中间层和末端层共同协作的结果。

第二部分:“模糊照片”测试(“眯眼”类比)

为了观察这个问题在现实世界测试中的严重程度,研究人员发明了一种新的评分方式。

想象你正在参加一场选择题考试。通常,如果你不知道答案,你可能会瞎猜。但如果题目很难,你可能会碰巧猜对。为了防止模型通过这种方式“走运”,研究人员使用了**“渐进式模糊”(Progressive Blur)**测试:

  1. 他们拍摄一张清晰的照片并提问。
  2. 然后,他们让照片变得稍微模糊(就像眯起眼睛看)。
  3. 接着,让它变得非常模糊(就像透过雾气浓重的窗户看)。
  4. 最后,让它变成一个完全的灰色色块(根本没有图像)。

衡量指标:
他们检查:模型在每一步是否都给出了完全相同的答案?

  • 如果模型随着图片的变模糊而改变答案,说明它确实在看图片。
  • 如果模型即使在图片变成灰色色块时仍给出相同的答案,这意味着模型完全忽略了图像,只是在根据文本进行猜测。

令人震惊的结果:
在许多热门测试中,即使图像被完全破坏,20% 到 40% 的问题依然能被答对。这些模型本质上是在通过利用其语言模式的记忆进行“作弊”,而不是观察视觉证据。


第三部分:为什么这很重要(“坏地图”类比)

论文指出,我们目前测试 AI 的方式就像是在使用一张坏地图

  • 问题所在: 这些测试(基准测试)的设计方式允许 AI “作弊”。因为问题往往具有可以通过单纯阅读文字来解决的模式,AI 学会了跳过最难的部分(观察图像)。
  • 后果: 我们以为 AI 变得更聪明了,因为它的分数很高,但实际上它只是变得更擅长根据文本进行猜测了。这就像一个通过背诵答案解析而不是学习学科知识的学生。

结论:如何修复

论文建议,我们不能仅仅让 AI 变得更大或更聪明,我们必须改变游戏规则。

  1. 修复工厂: 我们需要训练“中间”和“末端”的工人协同工作,确保视觉信息不会被丢弃。
  2. 修复地图: 我们需要创建新的测试,使答案无法仅通过文本来猜测。问题的设计必须确保:如果你不看图片,你根本无法解开谜题。

简而言之: 目前 AI 正在产生视觉上的“幻觉”,因为它信任自己的阅读习惯胜过自己的眼睛。研究人员找到了这种现象在大脑中发生的具体位置,并证明了我们目前的测试过于简单,让 AI 能够逃避“观察”这一环节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →