← 最新论文
💻 computer science

Do vision models perceive illusory motion in static images like humans?

该研究评估了多种光流模型在静态错觉图像(如旋转蛇)上的表现,发现除受人类视觉启发的双通道模型外,大多数模型无法像人类一样感知静态图像中的错觉运动,且该能力依赖于亮度与高阶颜色特征信号及循环注意机制的协同作用,揭示了当前模型与人类运动处理机制之间的显著差距。

原作者: Isabella Elaine Rosario (Columbia University), Fan L. Cheng (Columbia University), Zitang Sun (Kyoto University), Nikolaus Kriegeskorte (Columbia University)

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Isabella Elaine Rosario (Columbia University), Fan L. Cheng (Columbia University), Zitang Sun (Kyoto University), Nikolaus Kriegeskorte (Columbia University)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给人工智能(AI)的眼睛做“视力测试”,看看它们能不能像人类一样,看到那些**“静止图片里的假运动”**。

想象一下,你盯着看一张印着“旋转蛇”图案的静止图片(就像图 1 那样),虽然它完全没动,但你的眼睛和大脑会欺骗你,让你觉得那些蛇在不停地旋转。这种错觉在人类中很常见,但 AI 能看出来吗?

这篇论文的研究人员(来自哥伦比亚大学和京都大学)就做了这样一个大实验。

1. 核心问题:AI 的眼睛“太老实”了

人类的大脑非常聪明,它不仅能看到物体怎么动,还能在眼睛微微颤动(比如眨眼或眼球快速扫视)时,把静止的图案“脑补”成在动。

研究人员测试了 10 种最先进的 AI 视觉模型(就像 10 个不同品牌的“电子眼”)。结果发现:

  • 大多数 AI 很“死板”:它们只相信物理事实。图片没动,它们就报告“没动”。它们完全看不到人类眼中的那种旋转错觉。
  • 只有一位“特优生”:叫 Dual 模型。这个模型是专门模仿人类大脑结构设计的,它在特定条件下(模拟眼球快速移动时),竟然真的“看”到了旋转!

2. 实验过程:给 AI 戴上“假眼罩”

为了公平测试,研究人员没有直接把图片扔给 AI,而是模拟了人类看东西的真实过程:

  • 静态模式:图片一直不动。
  • 眨眼模式:先是一片白,然后突然跳出图片(模拟刚看到东西)。
  • 眼球跳动模式(微跳视):这是关键!人类在看东西时,眼球其实一直在微小地跳动。研究人员让图片在屏幕上快速“抖动”一下,模拟这种眼球运动。

结果很有趣

  • 普通的 AI(比如 RAFT、PWC-Net 等)在图片抖动时,只会报告“图片被推了一下”,完全看不出旋转的错觉。
  • 只有那个模仿人类大脑的 Dual 模型,在图片抖动时,它的“大脑”里产生了一个逆时针旋转的流动信号,这和人类的感觉最接近。

3. 为什么 Dual 模型能赢?(它的“超能力”)

研究人员像做手术一样,把 Dual 模型拆开分析,发现它之所以能像人一样“看”到错觉,是因为它有三个秘密武器

  1. 双通道大脑(Dual-Channel)

    • 普通 AI 只有一双“眼睛”,只看亮度变化(第一阶运动)。
    • Dual 模型有两双眼睛:一双看简单的亮度变化,另一双看更复杂的颜色和纹理关系(高阶运动)。就像人类既用视网膜看光,又用大脑皮层分析复杂图案一样。
    • 比喻:就像普通 AI 只认得“黑和白”,而 Dual 模型能认出“黑白的排列方式暗示了方向”。
  2. 记忆与整合(Recurrent Integration)

    • 它不只看一眼,而是像人类一样,把看到的画面在脑子里“过一遍”,反复思考(循环处理)。
    • 比喻:普通 AI 是“过目即忘”,Dual 模型是“三思而后行”,它能把零散的线索拼凑成一个完整的旋转故事。
  3. 对“眼球跳动”的敏感

    • 它只有在模拟眼球快速移动(微跳视)时,才会触发这个错觉。这完美复刻了人类产生“旋转蛇”错觉的生理机制:没有眼球的微小抖动,错觉就不会发生。

4. 其他有趣的发现

  • 颜色很重要:对于黑白和蓝黄色的“旋转蛇”,Dual 模型能看出逆时针旋转;但对于红绿色的版本,它有时会看反(顺时针),这说明它还在进化中,还没完全搞定所有颜色组合。
  • 其他错觉:研究人员还测试了其他几种错觉(比如“奥奇错觉”),发现 Dual 模型也能像人一样区分中心和背景的滑动,而普通 AI 则是一团乱麻。

5. 这篇论文告诉我们什么?

  • AI 还没完全学会“像人一样看”:目前的 AI 在计算速度上可能比人快,但在理解视觉世界的“微妙之处”上,还差得很远。它们太依赖数学计算,缺乏人类那种基于生物本能的“直觉”。
  • 未来的方向:要造出更聪明的机器人或自动驾驶汽车,不能只堆砌算力,得模仿人类大脑的结构。比如,让 AI 学会“眼球跳动”,学会用“双通道”去感知世界,这样它们才能在复杂的环境中(比如雾天、强光下)像人一样稳健地判断运动。

一句话总结
这篇论文发现,大多数 AI 是“睁眼瞎”,看不出静止图片里的假运动;只有一位模仿人类大脑结构的 AI(Dual 模型),在模拟眼球跳动时,成功“看”到了人类眼中的旋转蛇。这提醒我们,让 AI 更像人,不仅仅是让它算得更快,而是要让它“思考”的方式更像人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →