CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
本文介绍了 CompareBench,这是一个包含 TallyBench、OmniCaps 以及一个包含 1,200 个问题的视觉比较数据集的综合基准测试套件,旨在评估并揭示当前视觉语言模型在物体计数、几何、空间和时间推理方面的系统性缺陷。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人类的视觉不仅仅在于“看”,更在于“比较”。当我们观察一个房间时,我们并不仅仅是记录下椅子和桌子的存在;我们会瞬间判断哪把椅子更高,哪张桌子更近,柜台上放了多少个杯子,或者一张照片展示的是过去还是现在的场景。这种衡量一物与另一物之间关系的能力,是我们理解世界的基本方式。近年来,计算机已经学会了以惊人的技巧来“看”,能够描述图像并回答有关其包含内容的问题。这些被称为“视觉语言模型”的系统,是许多现代工具背后的引擎,它们可以解读图表、描述照片或解决视觉谜题。然而,尽管这些机器在识别和描述方面已变得十分熟练,但它们是否拥有人类每秒都在使用的这种直觉式的比较能力,目前仍不明确。
一位研究人员现在构建了一个专门的测试来回答这个问题,创建了一个旨在隔离特定视觉信息比较行为的新型评估套件。他们发现,虽然最先进的计算机系统在通用任务上表现出色,但在被要求对数量、大小、距离或时间进行直接比较时,却表现得相当吃力。研究表明,即使是最智能的模型,也会在计数清晰可见的物体、判断两个物体中哪个更长,或是在分辨哪个人离摄像头更近这类任务上出错。研究人员发现,这些系统经常在对人类而言极其简单的任务上跌倒,这表明比较视觉细节的能力仍然是当前人工智能的一个系统性弱点。
为了调查这一差距,研究人员构建了一套名为 CompareBench 的综合测试集,该测试集由他们开发的另外两个资源——TallyBench 和 OmniCaps 提供支持。TallyBench 是一个包含两千张图像的集合,每张图像都配有一个简单的提问,要求计算机计算特定类型物体的数量,例如狗、书或勺子。这一资源作为测试模型能否准确计数单个物品的基础,同时也为数量比较任务提供了源图像。OmniCaps 是一个规模较小的集合,包含七百一十六张关于历史事件、著名地标和知名人物的图像,每张图像都标记了特定的日期。这一集合使研究人员能够通过按时间顺序排列图像,来测试模型是否能理解时间的流逝。主测试 CompareBench 将这些元素整合在一起,形成了一千二百个问题,要求计算机进行直接比较。这些问题分为四类:比较数量、比较几何属性(如长度和厚度)、判断空间关系(如深度和高度)以及对事件进行时间排序。其中的数量比较子集专门从 TallyBench 中提取,形成了六百个问题。
研究人员测试了来自三家主要科技公司的九个不同版本的领先计算机视觉系统。他们要求这些模型解决一千二百个比较问题和两千个计数任务。结果显示出人类表现与机器表现之间的明显鸿沟。人类在几乎所有任务上都取得了接近完美的成绩,能够轻松计数物体并判断大小。然而,计算机模型则表现出持续性的错误。在计数任务中,最好的模型大约能答对百分之八十七的题目,这意味着它们在每十张图像中也会漏掉或数错一个以上的物体。在比较任务中,表现因类别而异。模型在比较数量方面表现尚可,但在空间推理方面却表现得很挣扎,经常无法判断哪个物体离摄像头更近,或哪个点离地面更高。它们在几何比较(例如判断两本书中哪一本更厚)方面也遇到了困难。
一个最令人惊讶的发现出现在时间(即基于时间的)比较类别中。在这一部分,模型被要求观察历史场景、地标或名人图像,并判断哪一个出现在更早的历史时期。在这里,计算机模型的表现实际上超过了人类受试者。人类受限于只能观察图片中的视觉证据,由于图像看起来非常相似,往往无法确定正确的顺序。然而,计算机模型拥有关于历史、建筑和名人的海量预存知识。它们可以利用这些内部数据库来正确排列图像顺序,即使视觉线索本身并不充分。这表明,虽然模型缺乏真正的空间和大小视觉理解力,但它们有时可以通过利用其庞大的事实记忆来解决需要外部知识的问题,从而进行补偿。
尽管有这些偶尔的成功,这项研究仍强调,人工智能尚未完全掌握比较视觉元素的核心能力。研究人员观察到,模型经常混淆物体的长度与高度,或者无法区分前景物体与背景物体。他们还发现,在计数时,模型经常会遗漏部分遮挡的物体,而这是人类能够本能处理的任务。研究人员得出结论,目前的系统在处理需要精细视觉比较的任务时尚不够可靠,且这些失败并非随机错误,而是模型处理视觉信息时的系统性局限。通过提供一套专注于隔离这些特定技能的测试集,这一新的基准测试为衡量该领域的进展提供了一种清晰的方法。研究人员希望,通过公开其数据和方法,其他科学家将能够利用这些工具来构建更好的模型,从而最终实现与人类在观察、比较和理解周围世界方面相匹配的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。