More Accurate, Less Human: Gestalt Grouping in Vision Models
本文介绍了一种行为测试集,该测试集通过在四个格式塔分组任务上将 45 个视觉模型与人类感知数据进行对比评估,揭示了与人类视觉组织的一致性是一个独特且关键的指标,而传统的基准测试往往无法捕捉到这一点,特别是对于闭源基础模型而言。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:更准确,却更不像人:视觉模型中的格式塔分组
问题陈述
视觉语言模型(VLMs)正越来越多地被部署在可视化流程中,用于解释图表、评估设计,并作为人类观察者的代理。虽然这些系统在任务完成度的基准测试中表现出极高的准确性,但目前仍无法验证它们是否根据支配人类视觉的感知规律来组织视觉信息。传统的评估侧重于衡量能力(例如可视化素养得分),却无法区分那些源自类人感知分组的正确答案与那些源于本质上不同的非人类机制的正确答案。本文认为,高准确性并不等同于建立了“类人性”的感知组织,因此有必要从任务性能指标转向与既定认知心理学的一致性行为评估。
方法论
作者引入了一套基于格式塔心理学的行为评估工具包,专门测试了闭合性(对不完整结构的感知补全)和相似性(通过共享属性进行分组)原则。该方法论并未收集新的人类数据,而是重复使用了先前感知研究中的刺激物和已发表的人类行为数据作为评估目标。
该工具包包含两个维度(基于图表的任务和自然图像控制组)下的四个任务:
- 轮廓识别(闭合性): 一个针对填充轮廓的16向强迫选择任务,其中移除了纹理和内部细节。人类锚点为十名观察者的众数响应。
- 标记-颜色异类识别(相似性): 基于颜色识别标记中的离群值,其评分标准参照众包的感知内核。
- 颜色序列计数(相似性): 计算图表中不同的颜色序列,其评分标准参照已发表的人类容量区间(6–12 个类别)。
- 物体异类识别(相似性): 在自然图像中识别语义离群值,其评分标准参照 THINGS 数据集的重测信度天花板。
研究评估了 45 个模型,涵盖五个训练家族:监督式编码器、自监督编码器、对比式视觉-语言编码器、开源权重 VLM 以及闭源基础模型。
指标
三种互补的指标量化了行为一致性:
- 行为一致性 (): 模型响应与人类目标(众数选择或容量区间)匹配的速率。这衡量的是“类人性”,而非仅仅是技能。
- 行为误差一致性 (): 衡量模型是否在人类出错的特定项目上同样出错,且这种程度超出了基于各自准确率所预期的随机性。该指标是与人类-人类一致性天花板进行对比。
- 行为效应复制 (): 模型在不同序列计数下的准确率剖面是否模仿了人类容量曲线的形状。
关键结果
- 准确性与类人性的脱节: 高基准准确性并不保证与人类感知组织的一致性。模型在不同分组任务中的排名经常发生易位(例如,一个在颜色相似性方面表现顶尖的模型,在语义分组方面可能表现平平)。
- 误差一致性差异: 虽然 45 个模型中有 34 个超过了人类准确率,但只有 4 个模型达到了或超过了人类-人类一致性()的天花板。许多模型(包括一些闭源基础模型)表现出高准确性,但在复制人类误差模式方面却失败了。
- 家族特有属性:
- 开源权重 VLM: 整体表现较差,大多数模型在语义任务上甚至未能突破位置猜测的底线,这表明其生成的答案并未反映其底层视觉塔的分组能力。
- 闭源基础模型: 表现出向类人分组转变的块级偏移,其中若干模型(如 Claude-Opus-4.6)同时实现了高于人类的准确率和人类水平的误差一致性。然而,这种一致性在整个层级中并不统一。
- 训练目标: 模型展现出的分组类型与其训练目标相关,而非其架构。自监督训练在颜色相似性方面领先,而对比式视觉-语言训练在语义分组和形状方面领先。
- 任务特异性: 类人分组并非一种全局特征;一个在某一任务上与人类一致的模型,在另一任务上可能会产生剧烈分歧。
意义与主张
本文声称提供了一个可重复使用的、由理论驱动的标准,用于审计进入可视化流程的视觉模型。通过利用现有的心理物理学数据,该方法允许研究人员在无需开展新用户研究的情况下,确定一个模型是否以人类观众的方式“看待”图表。
作者断言:
- 行为基础是可衡量的: 量化模型是否通过人类式的格式塔原则来组织视觉内容是可能的。
- 准确性是不充分的: 传统指标忽略了感知组织中的关键差异;一个模型可以“更准确”,但在其分组逻辑上却“更不像人”。
- 需要任务索引式评估: 没有单一的分数可以证明一个模型是人类代理。审计必须针对特定任务(例如,分组标记与识别形状)以及训练家族。
- 当前局限性: 本研究侧重于孤立的标记和物体(图表的构建模块),而非完整的图表语境(坐标轴、图例),且仅涵盖了两种格式塔原则(闭合性和相似性)。
研究结论指出,虽然一些闭源基础模型已经达到了可以作为特定任务的人类代理的行为一致性水平,但这种能力是通过特定的训练方案而非单纯的规模化获得的,并且仍然具有任务依赖性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。