Probing Perceptual Constancy in Large Vision-Language Models
本研究通过对 155 个视觉-语言模型在颜色、大小和形状恒常性方面的 236 场实验进行了评估,揭示了显著的性能差异,以及形状恒常性能力与颜色及大小恒常性能力之间的明显解离。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在看着一个红苹果。如果你走远一点,它看起来就会变小;如果你用蓝色的手电筒照它,它看起来会变成紫色;如果你从侧面看它,它看起来会是一个椭圆而不是一个圆。
人类的大脑非常神奇,因为它知道无论发生这些变化,那个苹果依然是一个又大、又红、又圆的苹果。它不会被距离、奇怪的光线或角度所迷惑。这种超能力被称为知觉恒常性(Perceptual Constancy)。
这篇论文就像是一份针对 155 种不同的“AI 大脑”(称为视觉语言模型,Vision-Language Models)的巨大成绩单,旨在测试它们是否也拥有这种超能力。研究人员构建了一个名为 ConstancyBench 的特殊测试,来检查三种特定的技能:
1. 测试的三种技能
把这些技能想象成三个不同等级的游戏关卡:
- 色彩恒常性(“光照”关卡): AI 能否分辨出即使在黄灯或蓝色霓虹灯照射下,白墙依然是白色的吗?
- 测试方法: AI 在奇特的光线下观察一个魔方,并必须猜出中间方块的真实颜色。
- 大小恒常性(“距离”关卡): AI 能否理解远处的汽车和近处的汽车其实大小一样,尽管远处的汽车在屏幕上看起来很小?
- 测试方法: AI 观察两个导弹,一个在远处,一个在近处,并需要判断它们实际上是大小不同,还是仅仅因为透视关系看起来不同。
- 形状恒常性(“角度”关卡): AI 能否知道一个倾斜的圆盘即便看起来像个椭圆,它仍然是一个圆?
- 测试方法: AI 观察一扇稍微打开并倾斜的门,使其看起来像个梯形,并需要意识到它实际上是一个长方形。
2. 测试结果:谁通过了?
研究人员测试了 155 种不同的 AI 模型,涵盖了从小型、轻量级模型到庞大、超级智能的模型(如 GPT-4o)。以下是他们的发现:
- “形状”技能比较简单: AI 模型在形状恒常性方面表现得惊人地好。这就像它们非常擅长识别事物的“轮廓”。即使是较小的模型也能分辨出倾斜的长方形仍然是一个长方形。
- “颜色”和“大小”技能比较困难: 模型在颜色和大小方面表现得挣扎得多。它们经常被光线或距离所迷惑。就好像它们只是在看一张平面照片,而忘记了世界是三维的且光影在变化。
- “大脑”越大,表现越好: 存在一个明显的规律:AI 模型越大,在这些测试中的表现就越好。
- 小型模型经常失败,会被简单的陷阱搞混。
- 那些庞大的模型(AI 世界里的“巨人”)表现得好得多,尤其是在理解大小和距离方面。看来,随着你给予 AI 更多的“脑力”(参数),它就会变得更擅长理解三维世界。
3. 核心结论
论文得出结论,AI 目前还没有拥有单一、完美的“类人”视觉。相反,它拥有的是一种**分层(stratified)**的视觉:
- 它擅长简单的几何学(形状)。
- 它正在变得更好地理解世界的规模和光照(大小和颜色),但前提是模型必须足够庞大。
作者们指出,虽然这些 AI 模型正在变得越来越聪明,但它们可能并不像人类那样在“看”这个世界。它们可能只是根据训练数据中见过的模式进行非常高明的猜测,而不是真正理解物理规律。
简而言之: 如果你让 AI 识别一个形状,它通常很聪明。但如果你让它在光照或距离复杂的情况下,去判断某个东西“真实”的大小或颜色,它仍在学习阶段。而且,AI 越大,就越不容易被愚弄。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。