← 最新论文
🤖 AI

Probing Perceptual Constancy in Large Vision-Language Models

本研究通过对 155 个视觉-语言模型在颜色、大小和形状恒常性方面的 236 场实验进行了评估,揭示了显著的性能差异,以及形状恒常性能力与颜色及大小恒常性能力之间的明显解离。

原作者: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Ho
发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Hokin Deng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看着一个红苹果。如果你走远一点,它看起来就会变小;如果你用蓝色的手电筒照它,它看起来会变成紫色;如果你从侧面看它,它看起来会是一个椭圆而不是一个圆。

人类的大脑非常神奇,因为它知道无论发生这些变化,那个苹果依然是一个又大、又红、又圆的苹果。它不会被距离、奇怪的光线或角度所迷惑。这种超能力被称为知觉恒常性(Perceptual Constancy)

这篇论文就像是一份针对 155 种不同的“AI 大脑”(称为视觉语言模型,Vision-Language Models)的巨大成绩单,旨在测试它们是否也拥有这种超能力。研究人员构建了一个名为 ConstancyBench 的特殊测试,来检查三种特定的技能:

1. 测试的三种技能

把这些技能想象成三个不同等级的游戏关卡:

  • 色彩恒常性(“光照”关卡): AI 能否分辨出即使在黄灯或蓝色霓虹灯照射下,白墙依然是白色的吗?
    • 测试方法: AI 在奇特的光线下观察一个魔方,并必须猜出中间方块的真实颜色。
  • 大小恒常性(“距离”关卡): AI 能否理解远处的汽车和近处的汽车其实大小一样,尽管远处的汽车在屏幕上看起来很小?
    • 测试方法: AI 观察两个导弹,一个在远处,一个在近处,并需要判断它们实际上是大小不同,还是仅仅因为透视关系看起来不同。
  • 形状恒常性(“角度”关卡): AI 能否知道一个倾斜的圆盘即便看起来像个椭圆,它仍然是一个圆?
    • 测试方法: AI 观察一扇稍微打开并倾斜的门,使其看起来像个梯形,并需要意识到它实际上是一个长方形。

2. 测试结果:谁通过了?

研究人员测试了 155 种不同的 AI 模型,涵盖了从小型、轻量级模型到庞大、超级智能的模型(如 GPT-4o)。以下是他们的发现:

  • “形状”技能比较简单: AI 模型在形状恒常性方面表现得惊人地好。这就像它们非常擅长识别事物的“轮廓”。即使是较小的模型也能分辨出倾斜的长方形仍然是一个长方形。
  • “颜色”和“大小”技能比较困难: 模型在颜色大小方面表现得挣扎得多。它们经常被光线或距离所迷惑。就好像它们只是在看一张平面照片,而忘记了世界是三维的且光影在变化。
  • “大脑”越大,表现越好: 存在一个明显的规律:AI 模型越大,在这些测试中的表现就越好。
    • 小型模型经常失败,会被简单的陷阱搞混。
    • 那些庞大的模型(AI 世界里的“巨人”)表现得好得多,尤其是在理解大小和距离方面。看来,随着你给予 AI 更多的“脑力”(参数),它就会变得更擅长理解三维世界。

3. 核心结论

论文得出结论,AI 目前还没有拥有单一、完美的“类人”视觉。相反,它拥有的是一种**分层(stratified)**的视觉:

  • 它擅长简单的几何学(形状)。
  • 它正在变得更好地理解世界的规模和光照(大小和颜色),但前提是模型必须足够庞大。

作者们指出,虽然这些 AI 模型正在变得越来越聪明,但它们可能并不像人类那样在“看”这个世界。它们可能只是根据训练数据中见过的模式进行非常高明的猜测,而不是真正理解物理规律。

简而言之: 如果你让 AI 识别一个形状,它通常很聪明。但如果你让它在光照或距离复杂的情况下,去判断某个东西“真实”的大小或颜色,它仍在学习阶段。而且,AI 越大,就越不容易被愚弄。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →