NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models
该论文介绍了 NumerosityVLM,这是一个受认知启发的基准测试,包含 10,800 张受控的合成图像,它揭示了视觉语言模型的数量感知主要由其架构和语言组件而非视觉条件决定,且线性可分的数量信号在视觉编码器的早期阶段便已出现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人类拥有一种卓越的、天生的能力,能够在不逐一计数的情况下识别出一组物体中有多少个。在学会说话之前,婴儿就能分辨出三块饼干和四块饼干的区别,这依赖于一种在发育中的大脑中自然涌现的数量感。这种被称为“数量感知”(numerosity perception)的技能,是我们理解世界的基础组成部分。近年来,科学家们将注意力转向了人工智能,特别是被称为“视觉语言模型”(vision-language model)的一种计算机系统。这些系统旨在观察图像并回答相关问题,在处理复杂任务时通常表现出类人的流利度。然而,一个悬而未决的问题仍然存在:这些机器是真的理解“有多少”这个概念,还是仅仅根据它们记忆中的视觉模式进行猜测?
为了回答这个问题,研究团队创建了一个名为 NumerosityVLM 的新测试场。他们构建了一套包含 10,800 张计算机生成图像的集合,旨在消除可能误导机器的陷阱。在现实世界中,计数往往会被其他视觉线索所干扰。例如,一大组较大的物体可能会比一小组较小的物体占据更多的空间,导致系统仅仅因为后者占据的面积更大而认为前者数量更多。为了防止这种情况,研究人员控制了图像中的每一个细节。他们创建了一些场景,在这些场景中,物体的数量发生变化,但它们占据的总空间保持不变,反之亦然。他们还分阶段去除了纹理、形状和颜色,只留下简单的点,以观察模型是依赖于物体的外观还是实际的数量。他们测试了七种不同的开源模型,从较小、较旧的系统到更大、更先进的系统,要求它们计算每张图像中的项目数量。
结果揭示了模型之间明显的鸿沟。那些拥有更大内部结构的更先进系统表现得显著更好,即使在视觉线索具有误导性时也能实现高准确度。较小的旧模型则表现挣扎,经常无法区分不同的数量,并且无论图中有什么内容,都会产生同一组有限的答案。研究人员发现,决定成功的最大因素不是图像的视觉条件,而是模型本身的架构。机器的构建方式远比测试中使用的特定视觉技巧更为重要。这表明,计数的能力不仅是清晰观察的问题,更是拥有能够处理该信息的正确内部结构的问题。
通过深入研究这些模型的工作原理,团队观察了机器处理流程中的不同阶段。他们发现,区分数字的能力实际上出现得很早,就在机器第一次观察图像时。即使是那些不太成功的模型,也能在其初始视觉层中检测到项目数量。问题在于,它发生在稍后的阶段。能够良好计数的模型与不能计数的模型之间的区别,在于它们如何将这些视觉信号转化为文字。更成功的模型更擅长将它们已经看到的数值信息转化为正确的文本答案。而不太成功的模型在从“看”到“说”的过程中,似乎丢失了这些信息。
该研究还考察了这些机器如何处理数字的规模。表现最好的模型在计数四个及以下的小组时几乎是完美的,这一范围人类可以瞬间识别。随着数字变大,它们的准确率下降,并开始一致地给出低于实际计数的预测。这种低估的模式随着数字的增加而增强,镜像了人类感知中的一个已知局限——即在估计大量数量时精确度会降低。然而,最先进的模型比较弱的模型更晚才表现出这种偏差,这表明它们对较大数字有着更稳健的掌握。
最终,研究表明,目前的视觉语言模型确实拥有一种形式的数量理解,但这种理解是脆弱的,并且严重依赖于它们的设计。这种“有多少”的视觉能力存在于这些系统的早期视觉处理中,但将这种感知转化为可靠答案的最后一步,正是机器经常失败的地方。研究得出结论,性能差距并非由于缺乏视觉数据,而是由于不同的模型如何构建来解释和表达这些数据。通过分离这些因素,研究人员为人工智能在迈向真正数量认知之旅中所处的位置提供了一份更清晰的地图,表明虽然机器的“眼睛”可以看到数量,但机器的“大脑”仍需学习如何计数。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。