Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
原作者: Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou
原作者: Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:未见即视:视觉 - 语言基准测试是否真的检验了视觉能力?
问题陈述
视觉 - 语言模型(VLMs)在多项旨在评估具象化视觉理解和物体幻觉的基准测试中取得了高分。然而,这些分数究竟在多大程度上真实反映了模型对细粒度视觉证据的依赖,还是源于对粗糙视觉线索、表征冗余或强语言先验的利用,目前仍不明确。作者观察到一个关键脱节:在 POPE 等广泛使用的基准测试中,随机移除大量图像令牌(高达 75%)仅导致准确率出现边际下降。这表明,标准基准测试指标可能不足以检测详细视觉具象化的缺失,从而可能导致对模型在视觉推理和幻觉缓解方面能力的过度自信结论。
方法论
作者对多个开源 VLM(包括 LLaVA-1.5、Qwen3-VL、Gemma-3、InternVL3 和 Molmo)及基准测试(POPE、A-OKVQA、MME 和 AMBER)进行了全面的多层级诊断分析。该研究采用了三类主要干预措施:
视觉级干预:
- 令牌丢弃: 在图像令牌进入语言解码器之前,在嵌入层面随机移除图像令牌。
- 全局退化: 通过“无图像”(虚拟黑图)、“黑色”遮挡(掩蔽特定图像区域)和“模糊”(与噪声混合)系统地削弱视觉证据。
- 实体级操纵: 针对真值正样本,作者使用分割模型(Grounding DINO、SAM2)执行精确干预:
- BlackMask(黑掩): 仅掩蔽查询实体的像素。
- BlackBox(黑框): 遮挡实体的整个边界框(移除局部上下文)。
- EntitySwap(实体交换): 使用图像编辑模型将查询实体替换为无关物体。
任务形式干预:
- 扩展答案空间: 引入显式的“未知”选项,以测试当视觉证据退化时,模型是否能表达不确定性。
- 开放式生成: 将二元问题重构为开放式生成任务,以评估目标实体在输出分布中的排序和概率(使用平均倒数排名和平均概率)。
表征分析:
- 逐层几何结构: 分析视觉编码器内部状态以测量空间判别力。作者计算了网络各层中令牌表征的块内与块间余弦相似度、k-means 空间紧凑性以及有效秩,以确定随着信息向模型更深层传播,空间区分度是否退化。
主要结果
- 对视觉损失的鲁棒性: 在 POPE 上,即使丢弃 75% 的图像令牌,准确率也几乎保持不变。同样,与视觉破坏的严重程度相比,重度模糊或部分黑色遮挡等全局退化导致的准确率下降比例极小。
- 实体级不敏感性: 即使特定查询实体被完全掩蔽(BlackMask)或替换(EntitySwap),模型通常仍保持较高的“是”率。虽然决策边界(“是”与“否”之间的 logit 差值)减小,但分布仍偏向肯定答案,这表明周围场景上下文或语言先验维持了预测。
- 未能表达不确定性: 当提供“未知”选项时,大多数模型极少选择它,即使在严重视觉退化(如无图像或高噪声)的情况下。它们继续产生自信的二元判断。
- 实体表征薄弱: 在开放式生成任务中,即使目标实体可见,其在模型生成分布中的排名往往较低。这表明模型在其输出概率中并未强烈编码特定实体信息。
- 空间判别力退化: 表征分析显示,随着视觉令牌通过视觉编码器的更深层,块间相似度增加,而块内相似度降低。在最终层,来自不同空间区域的令牌在方向上变得无法区分,表征的有效秩发生崩溃。这表明模型内部处理过程中细粒度空间结构的丢失。
主要贡献
- 测量差距的识别: 本文指出,标准基准测试指标(Top-1 准确率)往往在相应的视觉证据被大幅削弱或移除时,并未出现显著退化,表明其对细粒度具象化缺乏敏感性。
- 多层级诊断框架: 作者开发了一个系统框架,涉及令牌级缩减、全局退化、实体级遮挡、语义操纵和决策级分析,以探测 VLM 性能的真实依赖关系。
- 浅层视觉依赖的证据: 研究表明,当前的 VLM 即使在丢失详细视觉证据的情况下也能保持正确的预测,转而依赖粗糙的场景线索、冗余和语言先验。这揭示了基准测试成功与对问题相关视觉证据的真实依赖之间的系统性差距。
意义与主张
本文认为,当前的基准测试不足以可靠地评估 VLM 中的细粒度视觉具象化。作者声称,高基准测试分数可能会高估模型的视觉能力及其对视觉扰动的鲁棒性。因此,旨在改善视觉具象化、缓解幻觉或提高推理效率(例如通过丢弃图像令牌)的方法可能显得有效,仅仅是因为它们利用了数据集先验或粗糙线索,而非真正的视觉理解。
作者得出结论,评估必须超越 Top-1 准确率,明确测试模型预测是否对视觉证据的变化做出适当响应。他们指出,观察到的性能稳定性并非稳健视觉理解的标志,而是对视觉输入浅层依赖的症状,需要更诊断性的评估协议来准确评估模型能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。