← 最新论文
🤖 AI

Visual Credit Audit for Multimodal Spatial Reasoning

本文介绍了视觉信用审计(Visual Credit Audit, VCA),这是一个无需训练且无需标签的框架,它将多模态空间推理性能分解为正确性、视觉支持和特定关系响应,从而揭示了大量基准测试中的正确答案实际上并未获得视觉证据的归功。

原作者: Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在参加一场考试,老师给你看了一张猫坐在电视机下的照片,并问你:“电视是在猫的上方吗?”你回答“是”,然后得到了一个金星。但如果这个金星并不是因为你真的看了图片,而是因为你仅凭文字就猜对了呢?也许你听过这句话无数次,或者你只是知道电视通常挂在墙上,而猫在地上。在人工智能领域,特别是对于“多模态大语言模型”(能够看图并阅读的 AI)来说,这是一个棘手的问题。这些模型就像是读遍了图书馆所有书籍的超级学霸,但有时它们会通过分析问题的措辞来“作弊”猜出答案,而不是真正去分析图像。科学家们想要知道:当 AI 说“是”的时候,它是真的“看到”了电视在猫的上方,还是仅仅基于文本进行了一次幸运的猜测?

这正是名为《视觉信用分配用于多模态空间推理》(Visual Credit Assignment for Multimodal Spatial Reasoning)的一篇新论文所解决的谜题。研究人员构建了一个特殊的审计工具,叫做视觉信用审计(Visual Credit Audit, VCA)。把 VCA 想象成一个严格的侦探,他不只检查答案是否正确,还要调查为什么正确。他们提出了两个核心问题:首先,与仅阅读文本相比,图片是否真的为 AI 做出该决策提供了额外的帮助?其次,如果交换图片中的关系(比如把猫放在电视上面),AI 是否会改变主意?研究发现,即使 AI 给出了正确的答案,它们也经常通过依赖文本线索而非视觉证据来进行“作弊”。事实上,对于某些模型,它们在空间测试中正确答案里的高达 26.25% 实际上是“未获信用的”——它们答对了,但图像并没有对它们起到任何帮助。

侦探的工具箱:VCA 如何运作

要理解研究人员是如何抓到这些“作弊者”的,请想象一场由一个非常固执的机器人进行的“找不同”游戏。

设置:“无图像”对照组
研究人员设计了一个聪明的实验。他们拿出一个类似“电视是在猫的上方吗?”的问题,并以三种不同的方式展示给 AI:

  1. 原始情况: 问题加上真实的图片。
  2. 仅文本: 只有问题,没有任何图片(只有一个空白区域)。
  3. 空白画布: 问题加上一个原本应该是图片位置的灰色空框。

如果 AI 在这三种场景下都以同样的置信度回答“是”,研究人员就会说:“啊哈!图片并没有发挥作用。”AI 只是根据文本在瞎猜。但如果 AI 在有图片时表现得更加自信,那么图片就为这个答案获得了“信用”。这是审计的第一部分:图像依赖性(Image Dependence)

反转:“关系反转”
等等,还有第二个陷阱。如果 AI 对图片很敏感,但只是以一种奇怪的方式敏感呢?也许它看到了电视和猫,但它并不真正理解谁在上谁在下。为了捕捉这一点,研究人员使用了一个“因子化”测试。他们创建了一些场景:文本说“电视是在猫的上方吗?”,但图片显示的却是电视在猫的下方。

如果 AI 真的聪明,当图片与文本矛盾时,它应该回答“不是”。如果它仍然回答“是”,因为它忽略了图片,那么它就没能通过第二个测试:关系一致性(Relation Consistency)

大揭秘:“正确但未获信用”

研究人员使用两种不同的空间推理基准测试,对四种不同的 AI 模型(Qwen、InternVL、LLaVA 和 Ministral)进行了这项审计。结果令人震惊。

他们发现,AI 的大量“正确”答案实际上是**正确但未获信用(Correct-but-Uncredited, C-U)**的。

  • GSR-COCO 数据集上,Qwen 模型答对了 90.91% 的题目。但当研究人员应用审计时,发现只有 78.18% 的答案是由图像支持的。这意味着有 12.73% 的时间,模型虽然答对了,但图像完全没有提供帮助。
  • 对于同一个数据集上的 LLaVA 模型,差距甚至更大:其正确答案中有 26.25% 是未获信用的。

论文明确排除了这些模型仅仅是“空间推理能力差”的可能性。事实上,这些模型对视觉变化是敏感的。当研究人员交换图片中物体的相对位置(即“关系反转”)时,81.57% 到 100.00% 的模型确实朝着正确的方向改变了答案。这证明模型能够分辨差异,但在标准测试中,它们往往并不需要通过观察就能得到正确答案。它们依赖的是捷径。

为什么这很重要(不使用术语)

你可以把它想象成一个学生在参加数学考试。

  • 准确率(Accuracy) 仅仅是成绩:“他算对数字了吗?”
  • VCA 则是老师在检查学生的草稿纸:“他是真的做了数学运算,还是因为知道老师喜欢数字 42 而直接猜了一个答案?”

这篇论文表明,目前的 AI 基准测试就像是一场老师不小心在题目措辞中泄露了答案的考试。模型拿到了高分,但它们并不一定是在学习如何更好地“看”。

研究人员还测试了如果将图片更换为完全无关的图像(例如将猫/电视的照片换成一张海滩的照片)会发生什么。当他们这样做时,模型的“信用”得分下降了 21.25 到 47.80 分。这证实了原始图片确实为那些特定的正确答案提供了重大的支撑作用,如果没有这张图,模型就会出错。

总结

这篇论文并不是说 AI 坏掉了或者它不会看东西。相反,它提供了一种衡量成功的新方法。它建议我们不应仅仅计算 AI 答对了几次。我们需要计算 AI 为了得到那个答案,究竟在多少次情况下需要用到图片。

通过将“正确性”与“视觉支持”区分开来,研究人员发现,我们认为的许多“智能视觉”实际上只是“智能猜测”。他们提出,未来的 AI 测试应该包含这些“信用审计”,以确保当 AI 说“我看到了那只猫”时,它真的意味着它在看那只猫,而不是仅仅在背诵一段它记住了的短语。这是一个呼吁:停止仅仅庆祝分数,开始检查作业。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →