MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
该论文介绍了 MissingBench-Verified,这是一个基准测试,旨在证明领先的视觉语言模型由于固有的偏差和训练数据的匮乏,在检测缺失物体部件方面始终存在失败的情况,且这种局限性在使用了外部工具、扩展推理或微调后依然存在,从而揭示了当前视觉语言模型中存在的根本性架构缺陷。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人如何观察世界。你给它看了一百万张猫、狗和飞机的照片,它由此学会了规则:“猫有尾巴”、“飞机有翅膀”以及“iPhone 有 Home 键”。这就是**视觉语言模型(VLMs)**的世界。这些是超级聪明的计算机程序,它们可以观察一张图片并用文字进行描述,或者回答关于它们所见之物的提问。它们就像一位读过宇宙中每一本书的图书管理员,只需看一眼封面就能立刻告诉你故事的情节。
但棘手的地方在于:有时,这位图书管理员会对自己的知识过于自信。如果你给他们看一只失去了尾巴的猫的照片,他们的脑海里可能会尖叫:“这不可能!所有的猫都有尾巴!”于是他们可能会坚持认为尾巴还在那里,即便他们的眼睛清楚地看到尾巴已经没了。这被称为幻觉(Hallucination)。这并不是说机器人在撒谎;而是因为它们的内部知识过于强大,以至于覆盖了它们实际看到的景象。科学家们之所以关注这一点,是因为如果我们希望这些机器人能帮助我们检查桥梁、查看医学影像或监控工厂,它们必须能够说出“嘿,某个部件缺失了”,而不是凭空捏造。
伟大的“缺失部件”之谜
MissingBench-Verified 是一个旨在测试这种固执性的全新实验。研究人员想要了解:如果我们从一架飞机的照片中“手术式”地移除其引擎,机器人会承认引擎不见了,还是会产生幻觉,认为引擎依然存在?
为了找出答案,团队创建了一组特殊的 118 张图像。他们选取了日常物品的真实照片——比如一个删除了 Home 键的手机,或者一个没有尾巴的飞机——并将它们展示给市场上十个最顶尖的 AI 模型。他们提出了一个简单的问题:“这个部件可见吗?”模型必须在“清晰可见”、“难以看清”或“不可见”之间做出选择。
结果令人震惊。即使是最先进的 AI 模型,那些通常在各项测试中表现优异的模型,也表现得一塌糊涂。当引擎消失时,模型坚持认为引擎仍在。事实上,近一半的模型出错率超过了 50%。表现最差的模型 Claude Sonnet 4.6,仅在 44.1% 的情况下正确识别出了部件缺失。这就像机器人戴上了由自身记忆制成的眼罩,拒绝相信自己的眼睛。
“失效的魔法工具”
研究人员并没有止步于要求机器人“看得更仔细”。他们尝试利用一整套工具箱来辅助它们,希望能让它们从白日梦中清醒过来。他们尝试了三种主要策略:
- “侦探报告”(外部工具): 他们给了模型一份来自超精确目标检测器的虚假报告,报告称:“我检查过了,我确实没有发现引擎。”他们希望模型能信任这份报告。然而,大多数模型忽略了报告,依然固执己见。即便“完美的检测器”说物体已不在,模型仍然幻觉它还在。
- “变焦镜头”(图像处理): 他们允许模型使用裁剪、调亮或锐化图像的工具,希望通过近距离观察能揭示真相。其中一个模型甚至使用了裁剪工具去放大一个缺失飞机尾巴的空间,看到了那片空白,却仍然声称尾巴在那儿,并将其归咎于“裁剪错误”而非承认它已经消失了。
- “深度思考”(更多时间): 他们强迫模型在回答之前进行更多的思考和推理,希望更多的脑力能解决错误。令人惊讶的是,增加思考时间并没有帮助;在某些情况下,这反而让它们对错误的答案更加深信不疑。
结论:这不是漏洞,而是(损坏的)特性
论文指出,这不仅仅是一个可以通过快速提示(Prompt)或多思考一会儿就能纠正的简单错误。问题根植于深处。模型学习到了一种“先验知识(Prior)”——一种认为飞机必须拥有引擎才能飞行的强烈信念。当视觉证据(空旷的空间)与这种根深蒂固的信念发生冲突时,信念占据了上风。模型本质上是在说:“我知道飞机长什么样,所以这张照片不对,我会按照我预期中的样子来描述这架飞机,而不是按照它实际的样子。”
研究人员试图通过提供更好的工具和更多的时间来修复这个问题,但论文得出结论,这些方法带来的改进微乎其微。失败率依然高居不下,大多数模型即使在获得帮助后,仍无法正确识别缺失的部件。
这项研究并非声称解决了问题。相反,它是在敲响警钟。它表明,对于检查机器零件是否缺失或安全装置是否完好等任务,我们目前的顶尖 AI 模型是极其不可靠的。它们如此笃信自己的内部知识,以至于无法覆盖它,即便证据就在它们的“眼前”。论文指出,修复这个问题不会通过更好的提示词或更多的思考时间来实现;它可能需要对这些模型的构建或训练方式进行彻底的变革,以便它们学会信任所见,而非仅仅相信所想。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。