← 最新论文
💻 computer science

Ill-Posed by Design: Probing Evidence Use in VLMs

本文引入了 Metric VQA,一个病态的目标尺寸估计基准,旨在揭示即使是大型视觉语言模型也无法有效地利用场景几何进行度量推理,并过度依赖目标身份而非鲁棒的证据整合,而这一局限性在经过反事实分析和微调后依然存在。

原作者: Boaz Meivar, Shaked Perek, Shani Shvartzman, Eli Schwartz, Shai Avidan

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Boaz Meivar, Shaked Perek, Shani Shvartzman, Eli Schwartz, Shai Avidan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:“单照之谜”

想象一下,你给一个聪明的 AI 看一张咖啡杯的照片,并问它:“这个杯子有多高(厘米)?”

在现实世界中,这是一个棘手的问题(或者说论文中所称的“病态/不适定”任务)。如果你只看一张咖啡杯的照片,仅凭像素是无法得知其真实尺寸的。如果一个玩具杯离镜头很近,而真正的咖啡杯离得很远,它们在照片里看起来可能完全一样大。

为了猜出尺寸,人类(和 AI)必须使用线索

  • 它是什么?(它是个杯子,所以大概有 10 厘米高)。
  • 它旁边有什么?(它在键盘旁边,所以它可能比较小)。
  • 它看起来有多大?(它占据了很大一部分屏幕,所以也许它很大?)。
  • 房间的形状如何?(桌子的透视线可能会告诉我们它离多远)。

这篇论文探讨的是:当 AI 回答这个问题时,它到底是在使用哪些线索?

问题所在:“线索过多”陷阱

通常,科学家在测试 AI 时,会使用那些所有线索都指向同一个答案的简单问题。

  • 例子: “这张图片里有一只猫吗?”
  • 陷阱: 如果你把猫的尾巴涂掉,AI 仍然能看到耳朵和毛发,然后说“是的”。科学家会想:“太棒了,AI 看到了猫!”但实际上,AI 可能完全忽略了尾巴。因为线索太多了,即使移除其中一个,也不会改变答案,所以我们无法判断 AI 真正依赖的是什么。

解决方案:“蒙眼侦探”测试

作者创建了一个特殊的测试,称为 Metric VQA。他们强迫 AI 去解决这个“单照之谜”,在这个谜题中,没有任何单一线索足以得出正确答案

为了弄清楚 AI 在想什么,他们在将图像展示给 AI 之前对其进行了“手术”。他们称之为反事实干预(Counterfactual Interventions)。你可以把它想象成一名侦探通过移除犯罪现场的证据,来观察嫌疑人的供词是否会发生变化。

他们通过以下方式测试了 12 种不同的 AI 模型(包括一些非常小的模型和一些巨大的模型):

  1. “幽灵”测试: 给 AI 展示问题,但完全不给图片。(它是否仅仅根据文字进行猜测?)
  2. “替换”测试: 保留图片,但把杯子换成烤面包机。(AI 是否意识到它看错了物体?)
  3. “缩放”测试: 让杯子在照片中看起来比原来大两倍,但不改变物体本身。(AI 会不会因此感到困惑,并认为这个杯子变得巨大无比?)
  4. “畸变”测试: 像哈哈镜一样扭曲图片。(AI 是否利用房间的形状来猜测大小?)

令人震惊的结果

以下是研究结果,使用了简单的比喻:

1. “纯文本”作弊码
即使是那些拥有数千亿参数、最庞大、最昂贵的 AI 模型,其表现甚至不如一个完全看不见图片的纯文本 AI

  • 比喻: 这就像一个数学考试的学生,由于背诵课本的能力太强,如果他蒙上眼睛只读题目而不看图表,反而能拿到更高的分数。AI 主要是根据物体的名称进行猜测(例如:“‘笔记本电脑’通常有 30 厘米宽”),而不是通过观察图像。

2. “身份”拐杖
AI 唯一真正观察到的东西是物体是什么

  • 比喻: 如果你把杯子换成烤面包机,AI 的答案会发生剧烈变化。它知道:“哦,那是烤面包机,不是杯子!”但它并不一定是在观察烤面包机的像素来测量它;它只是切换到了它内部的“平均烤面包机尺寸”的猜测。

3. “尺寸”混乱
当研究人员放大物体使其看起来很大时,AI 并没有说:“哇,那是一个巨大的杯子!”

  • 比喻: AI 就像一个知道狗通常有 50 厘米高的人。如果你展示一张因为离相机很近而看起来巨大的狗的照片,AI 不会说:“那是一只 2 米高的狗!”它只是忽略了照片中的尺寸,而坚持它记忆中“狗”通常的大小。

4. “房间”盲区
AI 几乎完全忽略了房间的几何结构(透视、消失点)。

  • 比喻: 即使图片被扭曲得像哈哈镜一样,AI 的答案也几乎没有变化。它并没有利用房间的形状来帮助它猜测大小。

“微调”修复(以及为什么它没有完全奏效)

研究人员尝试通过专门针对测量尺寸进行额外训练(LoRA 微调)来“教导”AI 变得更好。

  • 奏效了吗? 是的,得分提高了。
  • 它学会了“看”吗? 没有。
  • 比喻: 这就像教一个数学很差的学生去背诵特定练习题的答案。他们考试成绩提高了,但他们并没有学会几何学的概念。他们只是变得更擅长根据现有的线索(如物体的名称或周围环境)进行猜测。他们仍然没有学会使用“房间形状”这一线索。

总结

论文得出结论:当我们要求这些 AI 模型从单张照片中测量物体时,它们并不是在真正地“测量”。它们大多是基于它们对物体名称的认知进行猜测,并辅以对物体身份的观察。

它们之所以是“由设计而产生的病态/不适定”,是因为仅凭一张照片完美解决该任务是不可能的,而这种不可能的任务揭示了 AI 正在采取捷径。作者发布了这些测试数据,以便其他人可以检查新的 AI 模型是否真的学会了如何“观察”和测量,还是仅仅变得更擅长于猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →