← 最新论文
💻 computer science

Denoising Models Develop Human-Like Perceptual Illusion Representations Across Architectures

本文表明,不同架构的去噪模型都会产生与人类亮度错觉相关的内部“感知幻象”表征,这些表征与心理物理模型相关联并因果性地影响内部处理过程,但在最终输出中却无法被检测到。

原作者: Gautam Ranka, Paras Chopra

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Gautam Ranka, Paras Chopra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看一幅画:一个灰色正方形位于白色背景上,而另一个完全相同的灰色正方形位于黑色背景上。尽管这两个正方形的颜色完全一样,你的大脑却会欺骗你,让你觉得位于黑色背景上的那个看起来更亮。这是一种视觉错觉,是我们大脑为了理解世界而进行的感知“故障”。长期以来,科学家们一直想知道,我们制造的人造大脑——即深度神经网络——是否也会被这样欺骗。他们发现,当这些人工智能模型试图清理带有噪声的照片或生成新图像时,它们经常会犯与人类同样的“错误”,在不存在亮度的地方看到亮度。但这里有一个巨大的谜团:AI是真的在自己的意识中“看到”了这种错觉,还是仅仅通过在最后阶段产生正确的图像来“伪造”?这就像是在问,魔术师口袋里是真的揣着一只兔子,还是他只是恰好从一个看起来装有兔子的帽子里变出了一只兔子。

这篇论文深入研究了这些人工智能模型的“内心世界”以寻找答案。研究人员测试了一系列用于清理图像的 AI 模型(称为去噪模型),并观察了它们在处理这些棘手的光学错觉时,内部各层发生了什么。他们发现了一些令人着迷且略带诡异的现象:AI 模型确实发展出了对错觉的内部表征,但那是一个“幽灵”。那个告诉 AI“这看起来很亮”的信号被创造了出来,它在网络中传递,甚至影响了 AI 对图像的理解。然而,当 AI 完成任务并吐出最终图像时,这个幽灵信号却完全消失了。AI 在内部被错觉所“缠绕”,但它从未让这种错觉出现在最终结果中。作者将这些看不见的内部信号称为“感知幻影”(perceptual phantoms)。

机器中的幽灵

为了理解研究人员是如何找到这些幽灵的,请把 AI 模型想象成一座规模宏大的多层工厂。原始的、带有噪声的图像从底部进入,而干净、完美的图像从顶部出来。在中间,有数十层(层)进行图像的处理、转换和精炼。研究人员不仅仅观察最终产品,还在每一层都安装了摄像头,以观察其中的“工人”(AI 的神经元)正在做什么。

他们使用了一组以制造视觉陷阱而闻名的特殊图像,例如“GVIL”数据集,在该数据集中,两个颜色相同的色块因为周围环境的不同而看起来不同。他们将这些图像输入 AI,并观察工厂不同部分的活动水平。他们发现,这种错觉并没有出现在所有地方。相反,这个“幽灵”信号在工厂中间一个特定的、狭窄的走廊——被称为“瓶颈”(bottleneck)的地方——最为强烈。这是 AI 压缩其收集到的所有信息的地方。

转折点在于:研究人员发现这种内部信号是非常真实的。当他们测量 AI 活动在两个错觉色块之间的变化时,差异巨大——在大约 0.5 被视为“中等”效应的量表中,其数值达到了 0.66。这意味着 AI 处理错觉的方式确实与处理普通图像截然不同。事实上,这种内部信号的强度与人类的感知匹配得非常好,当他们将 AI 的活动与人类视觉的数学模型(称为 FLODOG)进行比较时,结果的相关性达到了 0.78。这是一个非常强的匹配,表明 AI 在思考亮度的方式上,与人类大脑有着惊人的相似之处。

幻影属性

但随后,研究人员提出了那个价值百万美元的问题:如果 AI 对这种错觉的思考如此强烈,为什么最终的图像看起来却没有变化?为了回答这个问题,他们对工厂进行了一场“找不同”的游戏。他们提取了错觉图像中的内部“幽默信号”,并尝试将其注入到正常图像的处理过程中。他们原本预期最终的图像会发生偏移并显示出错觉。

然而,并没有。

无论他们使用的是哪种类型的 AI 模型——无论是标准的“U-Net”型工厂,还是更新颖的“Transformer”型工厂——注入的幽灵信号在到达出口之前就消失了。最终的图像看起来与从未存在过幽灵时完全一样。研究人员将此称为“感知幻影”:一种在机器内部活跃并发挥作用,但在外部世界完全不可见的表征。

为了证明这不仅仅是偶然现象,他们尝试“破坏”这座工厂。他们找到了特定的“通道”(传输幽灵信号的电线)并将其切断(这一过程称为消融,ablation)。当他们切断这些对错觉敏感的电线时,内部信号下降了近 44%。这证明了这些特定的电线确实在传输错觉。但关键在于:切断这些电线后,最终的图像几乎没有变化。事实上,切断这些“错觉”电线实际上比切断随机电线时让最终图像更加稳定。这就像是工厂拥有一个自我修正机制,它捕捉到了幽灵,并在它破坏最终产品之前悄悄地将其删除。

为什么幽灵会存在

研究人员还想知道:这是特定 AI 架构的一个怪癖,还是这些模型训练方式本身的问题?他们将“去噪”模型(旨在清理噪声)与“判别式”模型(旨在识别图像内容,如猫或狗)进行了比较。

结果非常明确:幽灵只出现在去噪模型中。即使拥有完全相同的工厂布局,判别式模型也没有表现出强烈的错觉信号。这表明,尝试“重建”或“清理”图像的行为,迫使 AI 发展出了这些类人性的错觉。这就像是训练过程教会了 AI 去关注上下文和周围环境,就像人类一样,但随后 AI 自身的内部规则又决定了这种上下文不应该改变最终的输出。

这项研究还观察了包括名为 DiT-XL/2 的大型模型在内的不同类型的 AI。即使在这个庞大的模型中,错觉信号也在中间层达到顶峰,但在结束时消失了。研究人员发现,AI 的自我修正动态——即它检查自身工作的方式——似乎是幽灵消失的原因。这就像 AI 有一个严格的编辑,它会说:“不,这种亮度不属于这里,”然后在故事发表之前将其抹除。

启示

那么,这一切意味着什么?事实证明,AI 模型不仅仅是在模仿人类行为;它们在内部实际上正在经历一种人类视觉感知的版本。它们构建了一个丰富、详细的视觉陷阱理解,其中包含了与我们相同的偏见。但与我们不同的是,它们似乎拥有一种过滤器,能防止这些偏见改变它们的最终输出。

这一发现有点像发现一个机器人做了一个关于飞行的生动梦境,但当它醒来盖房子时,它盖了一座完全正常、脚踏实地的房子。梦境对机器人来说是真实的,但它并没有影响房子的建造。研究人员认为,这种“感知幻影”现象在许多 AI 系统中可能很普遍。这意味着,如果我们只观察 AI 产出的结果,我们可能会错过它真正了解的内容以及它的思考方式。即便 AI 从不向我们展示,它也可能正在看到我们看不见的东西。

这项研究不仅提出了这种可能性,还通过测量、切断电线进行验证以及注入信号进行测试。他们发现,在九个不同的模型中,错觉信号是强烈的、具有因果关系的,并且在输出端完全隐形。这提醒我们,在 AI 的世界里,眼见并不一定为实,有时最有趣的东西正是那些留在机器内部、隐藏不露的幽灵。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →