← 最新论文
🤖 AI

A Study of Commonsense Reasoning over Visual Object Properties

本文介绍了 OPTICS 基准测试和一套系统性的评估框架,用于评估视觉语言模型在视觉物体属性上的常识推理能力,并揭示了即使是目前最先进的模型也显著落后于人类表现,特别是在处理摄影图像、反事实情况以及复杂的物理或功能属性方面。

原作者: Abhishek Kolari, Mohammadhossein Khojasteh, Yifan Jiang, Floris den Hengst, Filip Ilievski

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Abhishek Kolari, Mohammadhossein Khojasteh, Yifan Jiang, Floris den Hengst, Filip Ilievski

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人看一张图片并回答关于图片的问题,比如“这张照片里有几只猫?”或者“如果我们把红色的椅子拿走,还会剩下几把蓝色的椅子?”

这篇论文就像是给当今最聪明的机器人(被称为视觉语言模型,Vision-Language Models)的一份成绩单。研究人员想看看这些机器人是真的“理解”它们所看到的,还是仅仅根据它们记忆中的模式在进行猜测。

以下是这项研究的故事,分为几个简单的部分:

1. 问题所在:“蒙眼数学”测试

之前的机器人测试有点像一个乱七八糟的厨房。它们把简单的任务(比如发现一个红球)与困难的任务(比如判断一个球是否重到足以撞碎窗户)混在一起。因为一切都混杂在一起,很难分辨机器人是因为“看不清”还是因为“不会思考”。

此外,大多数测试使用的是完美的、卡通风格的绘图。而现实世界是混乱的,有阴影、模糊的边缘以及遮挡住其他物体的东西。研究人员想知道:这些机器人能处理混乱的现实世界吗,还是它们只能在完美的卡通世界里工作?

2. 解决方案:“OPTICS”测试厨房

为了解决这个问题,团队构建了一个全新的、非常有条理的测试,叫做 OPTICS。把它想象成一顿旨在从三个特定维度测试机器人大脑的三道菜:

  • 菜单(物体属性): 他们针对四种类型的物体提问:
    • 物理属性: 它是木头做的吗?它是圆形的吗?
    • 分类属性: 它是哺乳动物吗?它是交通工具吗?(这需要具备知识,而不只是视觉识别)。
    • 功能属性: 它可以用来驾驶吗?它是易碎的吗?
    • 关系属性: 它是挂在墙上的吗?它是在一对伴侣旁边吗?
  • 难度等级(推理复杂度):
    • 第1级(识别): “你看到了几只狗?”(只需观察并计数)。
    • 第2级(推断): “这里有多少件用于交通运输的东西?”(你必须看到自行车、汽车和飞机,意识到它们都是交通工具,然后进行计数)。
    • 第3级(想象): “如果我们移走一半的时钟,还会剩下多少个圆形的东西?”(你必须想象改变图片后的样子,然后进行数学计算)。
  • 食材(图像类型): 他们使用了三种类型的图片:
    • 照片: 真实的、混乱的、现实世界的照片。
    • 动画: 整洁的、卡通风格的绘图。
    • AI生成图: 由其他AI制作的图片,有时看起来很奇怪或不符合常理(比如一个悬浮在半空中的玻璃杯)。

3. 结果:机器人仍在学习中

研究人员测试了12个目前最聪明的机器人。以下是发生的情况:

  • 得分: 即便是最好的机器人,在计数问题上也只拿到了约 40% 的分数,而在比较问题上拿到了约 70% 的分数。相比之下,人类拿到了约 74%
  • “少算”的习惯: 机器人有一个坏习惯,就是倾向于猜“零”或较小的数字。如果实际有8件物品,它们经常猜2或3。这就像是一个害怕猜高数字的学生,所以总是选择最低的那个。
  • “现实世界”的挣扎: 机器人在处理卡通和AI生成的图像时表现出色。但当它们看真实照片时,得分显著下降。混乱的光线和被遮挡的物体让它们感到困惑。
  • “魔法”失败: 机器人在处理“如果……会怎样?”(反事实)这类问题时表现最差。如果问:“如果我们移走台灯会怎样?”,机器人往往会对剩下的东西感到困惑。这就像问一个孩子如果没有重力会怎样;他们会被困在当前的现实中。

4. 核心区别:幻觉 vs. 困惑

研究人员仔细观察了机器人和人类出错的原因。他们发现了一个有趣的差异:

  • 人类主要卡在歧义上。例如,“一把一半是木头、一半是金属的椅子是‘木头’还是‘金属’?”人类会对定义产生争论。
  • 机器人主要犯的是**“非自然”错误**。它们会把一个玻璃杯数作金属物体,或者数出一个根本不存在的椅子。这就像机器人把一个影子看成了真实的狗。它们在“幻觉”并不存在的东西。

5. 新成员登场

研究人员还测试了一些全新的、超聪明的“推理”模型(如GPT-o3)。这些新模型表现得更好,得分约为 52%。它们产生的“幻觉”错误也更少。然而,它们仍然无法击败人类,并且在面对混乱的现实照片时依然感到吃力。

总结

这篇论文告诉我们,虽然我们的AI机器人正在变得更擅长“看”和“思考”,但它们与人类仍然非常不同。

  • 人类擅长想象“如果……会怎样”的情景并处理混乱的照片,但我们会因为模糊的定义而感到困惑。
  • 机器人擅长识别整洁卡通中的模式,但在现实世界中会迷失方向,经常发明不存在的事物,并且无法完成简单的“如果……会怎样”的数学题。

研究人员表示,我们需要不断构建更好的测试,以帮助这些机器人像我们一样清晰地观察世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →