这篇论文就像是在给人工智能(AI)的眼睛做“视力测试”,看看它们能不能像人类一样,看到那些**“静止图片里的假运动”**。
想象一下,你盯着看一张印着“旋转蛇”图案的静止图片(就像图 1 那样),虽然它完全没动,但你的眼睛和大脑会欺骗你,让你觉得那些蛇在不停地旋转。这种错觉在人类中很常见,但 AI 能看出来吗?
这篇论文的研究人员(来自哥伦比亚大学和京都大学)就做了这样一个大实验。
1. 核心问题:AI 的眼睛“太老实”了
人类的大脑非常聪明,它不仅能看到物体怎么动,还能在眼睛微微颤动(比如眨眼或眼球快速扫视)时,把静止的图案“脑补”成在动。
研究人员测试了 10 种最先进的 AI 视觉模型(就像 10 个不同品牌的“电子眼”)。结果发现:
- 大多数 AI 很“死板”:它们只相信物理事实。图片没动,它们就报告“没动”。它们完全看不到人类眼中的那种旋转错觉。
- 只有一位“特优生”:叫 Dual 模型。这个模型是专门模仿人类大脑结构设计的,它在特定条件下(模拟眼球快速移动时),竟然真的“看”到了旋转!
2. 实验过程:给 AI 戴上“假眼罩”
为了公平测试,研究人员没有直接把图片扔给 AI,而是模拟了人类看东西的真实过程:
- 静态模式:图片一直不动。
- 眨眼模式:先是一片白,然后突然跳出图片(模拟刚看到东西)。
- 眼球跳动模式(微跳视):这是关键!人类在看东西时,眼球其实一直在微小地跳动。研究人员让图片在屏幕上快速“抖动”一下,模拟这种眼球运动。
结果很有趣:
- 普通的 AI(比如 RAFT、PWC-Net 等)在图片抖动时,只会报告“图片被推了一下”,完全看不出旋转的错觉。
- 只有那个模仿人类大脑的 Dual 模型,在图片抖动时,它的“大脑”里产生了一个逆时针旋转的流动信号,这和人类的感觉最接近。
3. 为什么 Dual 模型能赢?(它的“超能力”)
研究人员像做手术一样,把 Dual 模型拆开分析,发现它之所以能像人一样“看”到错觉,是因为它有三个秘密武器:
双通道大脑(Dual-Channel):
- 普通 AI 只有一双“眼睛”,只看亮度变化(第一阶运动)。
- Dual 模型有两双眼睛:一双看简单的亮度变化,另一双看更复杂的颜色和纹理关系(高阶运动)。就像人类既用视网膜看光,又用大脑皮层分析复杂图案一样。
- 比喻:就像普通 AI 只认得“黑和白”,而 Dual 模型能认出“黑白的排列方式暗示了方向”。
记忆与整合(Recurrent Integration):
- 它不只看一眼,而是像人类一样,把看到的画面在脑子里“过一遍”,反复思考(循环处理)。
- 比喻:普通 AI 是“过目即忘”,Dual 模型是“三思而后行”,它能把零散的线索拼凑成一个完整的旋转故事。
对“眼球跳动”的敏感:
- 它只有在模拟眼球快速移动(微跳视)时,才会触发这个错觉。这完美复刻了人类产生“旋转蛇”错觉的生理机制:没有眼球的微小抖动,错觉就不会发生。
4. 其他有趣的发现
- 颜色很重要:对于黑白和蓝黄色的“旋转蛇”,Dual 模型能看出逆时针旋转;但对于红绿色的版本,它有时会看反(顺时针),这说明它还在进化中,还没完全搞定所有颜色组合。
- 其他错觉:研究人员还测试了其他几种错觉(比如“奥奇错觉”),发现 Dual 模型也能像人一样区分中心和背景的滑动,而普通 AI 则是一团乱麻。
5. 这篇论文告诉我们什么?
- AI 还没完全学会“像人一样看”:目前的 AI 在计算速度上可能比人快,但在理解视觉世界的“微妙之处”上,还差得很远。它们太依赖数学计算,缺乏人类那种基于生物本能的“直觉”。
- 未来的方向:要造出更聪明的机器人或自动驾驶汽车,不能只堆砌算力,得模仿人类大脑的结构。比如,让 AI 学会“眼球跳动”,学会用“双通道”去感知世界,这样它们才能在复杂的环境中(比如雾天、强光下)像人一样稳健地判断运动。
一句话总结:
这篇论文发现,大多数 AI 是“睁眼瞎”,看不出静止图片里的假运动;只有一位模仿人类大脑结构的 AI(Dual 模型),在模拟眼球跳动时,成功“看”到了人类眼中的旋转蛇。这提醒我们,让 AI 更像人,不仅仅是让它算得更快,而是要让它“思考”的方式更像人。
这是一份关于论文《Do vision models perceive illusory motion in static images like humans?》(视觉模型是否像人类一样感知静态图像中的错觉运动?)的详细技术总结。
1. 研究背景与问题 (Problem)
- 核心问题:尽管深度神经网络(DNN)在光流估计(Optical Flow Estimation)任务上表现优异,但它们是否具备像人类视觉系统那样感知静态图像中的错觉运动(Illusory Motion)的能力?
- 具体挑战:人类视觉系统在处理如“旋转蛇”(Rotating Snakes)等静态图像时,会产生强烈的运动错觉(通常由微小的眼球运动或亮度不对称引起)。然而,现有的计算机视觉模型大多基于像素位移跟踪,缺乏对这种非真实运动(Anomalous Motion)的感知机制。
- 研究缺口:虽然部分基于神经科学的模型能复现动态错觉(如反向 phi 效应),但现代 DNN 能否在静态图像中复现复杂的错觉运动(特别是依赖于微眼球运动和亮度梯度的错觉)尚不清楚。
2. 方法论 (Methodology)
研究团队采用了一种计算心理物理学(In silico psychophysics)的方法,系统性地评估了多种光流模型。
2.1 实验刺激设计
- 主要对象:旋转蛇错觉(Rotating Snakes Illusion)。该错觉由同心圆环组成,包含特定的亮度不对称序列,导致人类观察者感知到旋转。
- 变体:包括灰度(G)、蓝 - 黄(B-Y)和红 - 绿(R-G)三种颜色方案。
- 控制组:通过置换重复单元内的亮度或颜色序列生成控制图像,消除驱动错觉的局部亮度梯度,但保持整体空间布局不变。
- 其他错觉:还测试了周边漂移错觉(Peripheral Drift Illusions)、中心漂移错觉(Central Drift Illusions)和 Ouchi 错觉。
2.2 模拟观看条件 (Viewing Conditions Simulation)
为了模拟人类观看时的视网膜图像变化,研究设计了四种输入序列:
- 静态(Static):帧内容完全相同。
- 刺激呈现(Stimulus Onset):模拟刺激突然出现(从白屏到图像)。
- 微眼球运动(Microsaccade):模拟微小的眼球颤动(位移 15-120 像素)。
- 扫视(Saccade):模拟较大的眼球快速运动。
2.3 模型评估
- 模型集合:评估了 10 种代表性模型,分为三类:
- 多尺度架构(如 PWC-Net, LFN2)。
- 循环解码架构(如 RAFT, CCMR)。
- 生物启发式架构(Bio-inspired,如 FFV1MT, DorsalNet, ME-Attention, Dual)。
- 评估指标:
- 构建了一个人类感知光流目标(Human Percept Optical Flow):基于心理物理学研究,模拟人类感知到的刚性旋转流场。
- 归一化相关性(Normalized Correlation, ρ):衡量模型预测流场与人类感知流场在方向上的一致性(ρ=1 为完美对齐,ρ=−1 为反向)。
2.4 深入分析
- 探针分析(Probing):在 Dual 模型的不同处理阶段(一阶通道、二阶通道、循环迭代)解码光流,定位错觉信号产生的位置。
- 消融实验(Ablation):移除训练数据子集(如非纹理、非扩散物体运动)或移除特定通路(一阶/二阶),观察对错觉感知能力的影响。
3. 主要结果 (Key Results)
3.1 模型表现差异
- 传统 DNN 失败:大多数标准光流模型(如 PWC-Net, RAFT, LFN2)在静态条件下几乎不产生有意义的流场;在微眼球运动条件下,它们的预测主要受位移方向主导,无法复现人类感知的旋转错觉。
- 生物启发模型的表现:
- Dual 模型:表现最佳。在模拟微眼球运动(特别是 30-60 像素位移)条件下,Dual 模型能生成与人类感知方向一致(逆时针)的流场,尤其是在灰度和蓝 - 黄变体上。
- 其他模型:ME-Attention 和 DorsalNet 等模型仅产生微弱、噪声大或方向错误的流场。
- 颜色依赖性:Dual 模型在红 - 绿变体上常产生负相关(即感知到反向旋转),这与其训练数据中的亮度不对称特性有关,表明模型确实响应了刺激结构而非随机偏差。
3.2 机制分析(针对 Dual 模型)
- 双通道机制至关重要:消融实验表明,一阶运动(亮度定义)和二阶运动(特征定义)通道的结合是产生错觉感知的必要条件。仅有一阶通道无法生成旋转信号。
- 循环整合(Recurrent Integration):错觉信号在循环迭代(Transformer 模块)过程中被显著放大和稳定。仅靠前馈处理不足以产生全局一致的旋转。
- 训练数据的作用:训练数据中包含“非纹理”和“非扩散”物体运动对于模型学习高阶运动感知至关重要。移除这些数据会显著降低模型与人类错觉感知的一致性。
- 局部单元响应:一阶通道单元对错觉刺激的响应是弥散且对称的,不足以形成连续旋转;必须经过高阶特征融合和循环整合才能形成全局旋转感知。
3.3 其他错觉
- 在 Ouchi 错觉中,Dual 和 ME-Attention 能表现出类似人类的“图 - 底”分离(中心与背景相对滑动),这主要依赖一阶运动能量机制。
- 在周边漂移错觉中,仅 Dual 在微眼球运动下表现出部分一致性。
4. 关键贡献 (Key Contributions)
- 系统性评估:首次大规模评估了包括现代 DNN 和生物启发模型在内的多种架构在静态图像错觉运动感知上的表现,揭示了当前光流模型与人类视觉系统的巨大鸿沟。
- 统一实验框架:提出了一套结合受控比较、模拟观看条件(微眼球运动/扫视)和定量评估指标的统一实验流程。
- 机制发现:
- 证明了微眼球运动(眼动瞬变)是触发此类错觉感知的关键条件,而现有模型普遍缺乏对此的模拟。
- 揭示了双通道(一阶 + 二阶)与循环注意力机制对于复现人类错觉感知是不可或缺的。
- 指出单纯的一阶运动能量模型(如 FFV1MT)不足以解释复杂的静态运动错觉。
5. 意义与启示 (Significance)
- 对计算机视觉的启示:
- 现有的光流模型在“鲁棒性”和“人类对齐”方面存在缺陷。为了构建更可靠、以人为中心的 AI 系统,未来的模型设计需要引入生物启发的组件(如运动能量滤波器、高阶路径、循环整合)。
- 训练数据中应包含模拟自然眼动统计特性(如微眼球运动)的视频,以提高模型在复杂视觉环境下的泛化能力。
- 对神经科学的启示:
- 研究结果支持了人类视觉系统处理异常运动错觉的机制不仅仅是简单的对比度延迟,还需要高阶特征处理和循环整合。
- 不同类型的错觉(如旋转蛇 vs. Ouchi)可能依赖不同的计算机制(前者需高阶 + 循环,后者主要靠一阶),这为理解大脑视觉皮层(V1, MT 等区域)的功能分工提供了计算层面的证据。
- 未来方向:开发结合周边视觉机制和更逼真眼动统计的生物启发式运动模型,以弥合机器视觉与人类感知之间的差距。
总结:该论文通过严谨的对比实验证明,目前的先进光流模型大多无法像人类一样感知静态图像中的错觉运动。只有结合了双通道处理、循环整合以及模拟眼动输入的生物启发式模型(如 Dual)才能在特定条件下展现出类似人类的感知行为。这为下一代鲁棒、类人的计算机视觉系统的设计指明了方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。