← 最新论文
💻 computer science

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

本文引入了一种以操作为中心的机制框架,用于分析视觉语言模型在组合式视觉问答(VQA)中的失效问题,揭示了四种截然不同的失效模式,并证明了这些失效通过特定的、解离的计算路径进行传播,从而为针对性的可靠性提升奠定了基础。

原作者: Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

侦探、地图与故障的大脑

想象一下,你正试图教一个机器人成为一名侦探。你给它一张凌乱房间的照片,并提出了一个问题,比如:“红色的猫是否坐在蓝色的椅子上?”为了回答这个问题,机器人不能仅仅靠猜测;它必须执行一系列心理步骤。首先,它必须找到那只猫(目标选择)。然后,它必须检查这只猫是否是红色的(属性验证)。最后,它必须观察椅子并弄清楚它们之间的空间关系(推理)。这个研究领域被称为视觉-语言建模(Vision-Language Modeling),即计算机尝试同时理解图像和文本。

长期以来,这些机器人在整体回答问题方面变得非常出色。但问题在于:它们有时在“作弊”。它们并没有真正观察图片,而是根据人类语言中词汇通常如何组合来猜测答案。例如,如果被问到“天空通常是蓝色的吗?”,机器人甚至不用看图像就会回答“是的”。科学家们想知道:当这些机器人出错时,为什么会失败?是因为它们看不见物体吗?是因为它们无法理解关系吗?还是因为它们完全忽略了图片?理解这一点至关重要,因为如果我们希望这些机器人在现实世界中成为可靠的助手,我们就需要确切知道它们的哪个“大脑部分”出了故障,以便进行修复。

以运算为中心的尸检

在这篇论文中,研究人员决定不再仅仅关注最终得分,而是开始对机器人的大脑进行“机械性尸检”。他们使用了一个名为 GQA 的特定数据集,其中包含需要像食谱一样将多个步骤串联起来的问题。他们关注的模型是 Qwen2.5-VL-3B,这是一个带有视觉组件的大型语言模型。他们不再只是问“它答对了吗?”,而是问“它是如何得出答案的,以及信号在哪里中断了?”

他们开发了一种巧妙的方法来测试机器人的内部布线。想象机器人的大脑是一个拥有两条主要装配线的工厂:一条是注意力线(Attention Line),机器人的“眼睛”通过这条线扫描图像并决定关注哪些部分;另一条是 MLP 线(前馈网络),机器人通过这条线处理并将信息转化为最终的想法。研究人员使用了“因果干预(causal interventions)”,这是一种高级说法,指的是他们暂时破坏了机器人大脑的特定部分,以观察会发生什么。他们会阻断机器人观察特定物体或处理该物体细节的能力,然后观察答案是否发生了变化。

机器人的四种失败方式

通过以非常特定的方式破坏机器人的大脑,作者发现机器人并不只有“正确”和“错误”两种答案。实际上存在着四种截然不同的失败方式,且每种失败都发生在工厂的不同部分:

  1. “盲点”式失败(定位失败/Grounding Failure):
    这种情况发生在机器人根本找不到图片中的物体时。就像试图在停车场里寻找一辆特定的红车,但机器人的眼睛闭上了。研究人员发现,当机器人在这类问题上出错时,是因为它从未真正锁定物体的视觉细节。这种失败是由 MLP 线(处理工厂)处理的。如果你阻止 MLP 处理该物体,机器人就会完全失败。这表明机器人难以将原始图像数据转化为大脑中可识别的“物体”。

  2. “过度关注”式失败(推理失败/Reasoning Failure):
    这是最有趣且违反直觉的一种。在这种情况下,机器人确实完美地看到了物体,但它却陷入了死盯着看的状态。想象机器人看到了猫和椅子,但它没有思考“猫在椅子上”,而是沉迷于观察猫毛的纹理,从而忘记了将其与椅子进行比较。机器人处于“过度定位(over-grounded)”状态。研究发现,这种特定的失败通过注意力线(扫描机制)传播,特别是在大脑的后期层级中。机器人看对了东西,却无法利用这种观察来进行逻辑连接。

  3. “属性错误”式失败(属性提取失败/Attribute Extraction Failure):
    在这种场景下,机器人找到了物体并准确知道它的位置,但弄错了细节。它看到的是金色的车,却称之为银色的。机器人拥有视觉信号,但在将该信号转化为单词的最后一步失败了。这也发生在 MLP 线中,特别是在生成答案的最后阶段。这就像工厂拥有正确的原材料,但负责盖上最终标签的机器坏了。

  4. “作弊者”式失败(语言先验占主导/Language Prior Dominance):
    有时,机器人甚至根本不看图片。如果问题是“链条是黑色的还是黄色的?”,而机器人从训练中学到链条通常是黑色的,它就会直接猜“黑色”,而不去检查图像。研究人员发现,对于这类问题,机器人的视觉大脑几乎处于不活跃状态。它完全依赖于其“语言大脑”来猜测答案。这是对视觉系统的完全绕过。

伟大的路径分歧

论文中最显著的发现是“路径解离(pathway dissociation)”。研究人员展示了不同类型的错误会在机器人大脑中通过不同的线路传输。

  • 如果机器人无法找到物体(定位失败),或者无法描述正确(属性提取失败),问题出在 MLP 处理线
  • 如果机器人无法推理物体间的关系(推理失败),问题则出在 注意力扫描线

这是一个重大发现,因为它意味着你不能用同一种工具来修复所有的机器人错误。如果你试图通过调整物体处理线来修复“推理”错误,你是不会成功的。你必须针对出错的具体线路进行处理。

这种情况发生在所有机器人身上吗?

研究人员还检查了这种现象是否也适用于另一个机器人 LLaVA-1.5。他们发现,“作弊者”和“属性错误”失败在两个机器人中都存在,这表明这些是关于机器人如何生成答案的根本性问题。然而,“盲点”和“过度关注”失败仅出现在第一个机器人(Qwen2.5-VL)中。为什么呢?因为第一个机器人的视觉编码器保留了关于物体位置的非常详细、像素级的精确信息。而第二个机器人(LLaVA)使用的视觉编码器会对图像进行更宽泛的总结,丢失了一些精细的空间细节。由于第二个机器人没有同样详细的“地图”,它不会遭受相同类型的“盲点”或“过度关注”错误。这表明,某些错误只有在机器人拥有高分辨率地图并可能在其中“迷失”时才会发生。

核心结论

论文得出结论,我们不能再将视觉-语言模型视为一个要么工作、要么不工作的单一“黑盒”。它们是拥有不同作业装配线的复杂机器。当它们失败时,是以特定且可预测的方式失败的:有时是看不见,有时是想不通,有时则是瞎猜。通过确定每种类型的问题对应哪根“断掉的电线”,作者为构建更可靠、能真正“看图说话”的机器人提供了路线图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →