← 最新论文
🤖 AI

The Importance of Phase in Neural Representations: An Internal Oppenheim-Lim Test of Image Classifiers

这项研究表明,包括卷积神经网络(CNN)和视觉 Transformer 在内的深度图像分类器,在内部主要通过相位或符号信息而非幅度来编码图像身份,从而为这些架构之间的纹理-形状差距提供了一种机制性的解释。

原作者: Alper Yıldırım

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Alper Yıldırım

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有两张不同的照片:一张猫的照片和一张狗的照片。现在,想象你可以提取猫的“骨架”(它的轮廓、边缘以及事物的排列位置),然后将其粘贴到狗的“血肉”(它的颜色、亮度与纹理)之上。

在1981年,科学家奥本海姆(Oppenheim)和林(Lim)用数学实现了类似的操作。他们发现,如果交换一张图像的相位(结构/骨架)与另一张图像的幅度(能量/纹理),生成的图像看起来会更像那个捐献了“骨架”的图像。大脑识别的是形状,而非纹理。

这篇论文提出了一个引人入胜的问题:现代AI图像分类器在它们的“大脑”(隐藏层)内部是否也是以同样的方式运作的? 它们是依赖于“骨架”(相位)来识别物体,还是会被“血肉”(幅度/纹理)所干扰?

以下是研究人员发现的内容,使用了简单的类比:

实验:“奇美拉”测试

研究人员在AI的大脑内部创建了“奇美拉”图像。他们提取了处理猫图像的神经网络中间层的特征,保留了猫的亮度/纹理(幅度),但换入了狗的结构轮廓(相位)。然后他们询问AI:“这是猫还是狗?”

他们对四种不同类型的AI模型进行了这项测试:

  1. PRISM2D: 一种利用复杂数学构建的模型,天生能够处理“方向”(类似于指南针)。
  2. GFNet: 一种通过“傅里叶透镜”(将图像分解为波)来观察图像的模型。
  3. ViT (Vision Transformer): 一种现代且流行的模型,它通过将图像分割成小块(patches)来观察。
  4. ResNet: 一种经典的深度模型,它使用“ReLU”(一种会切断负数的数学门控)。

重大发现:“骨架”胜出

在几乎所有情况下,AI都追随了骨架的捐献者

  • 如果奇美拉图像具有猫的纹理但具有狗的结构,AI会说:“那是狗。”
  • 幅度是可丢弃的: 研究人员尝试删除了所有的特定纹理信息(用通用的平均纹理代替),AI仍然能得出正确的答案。
  • 相位是本质的: 如果他们打乱了结构(相位)但保留了纹理,AI就会感到困惑并进行随机猜测。

类比: 想象你在人群中试图辨认一个人。如果你给他们一件普通的、模糊的外套(幅度),但保留了他们独特的脸型和姿态(相位),你仍然可以认出他们。但如果你给他们一件陌生人的完美高清外套,却把他们的脸型搞乱了,你就无法辨认出是谁。令人惊讶的是,AI学会了忽略“外套”,而完全专注于“脸型”。

转折点:不同的模型,不同的路径

虽然所有模型最终都依赖于“骨架”,但它们实现这一目标的方式各不相同:

  • “早期拥护者”(ViT, PRISM2D, GFNet): 这些模型几乎立即意识到了结构的重要性。在ViT中,“符号”(phase的一个简单版本)从第一层开始就是主要的线索。它们就像是那些立刻观察犯罪现场轮廓的侦探。
  • “大器晚成者”(ResNet): 这个模型很棘手。起初,它似乎忽略了结构而依赖纹理。为什么?因为ResNet有一个“门”(ReLU),它会切断负数。这个门将结构性的线索隐藏在了亮度(幅度)之中。
    • 修复方法: 当研究人员在门关闭之前进行观察时,他们发现结构性线索一直都在,只是被隐藏起来了。
    • 最终手段: 到最后,ResNet会将所有的这些结构信息折叠进一个单一的“平均亮度”(DC项)数值中,从而做出最终决定。这就像是一个侦探在整个调查过程中都在关注细节,但在最后时刻,仅仅通过瞥一眼证据的总权重来做出判决。

这为什么重要(根据论文所述)

这解释了一个长期存在的AI谜题:为什么有些模型(如CNN)会被纹理所迷惑(因为认为猫的毛发纹理像狗,从而误判),而其他模型(如Transformer)则在识别形状方面表现得更好?

论文认为,这并不是说一个模型比另一个模型“更好”。这关乎模型何时以及如何致力于“骨架”编码。

  • 有些模型很早就致力于形状。
  • 有些模型直到最后才将形状隐藏在纹理之中。
  • 但在做出最终决定时,它们全都依赖于形状(相位/符号),而非纹理(幅度)。

总结

这篇论文证明了,在现代图像分类器的“黑盒”内部,图像的结构才是身份的真正载体,而纹理在很大程度上是模型可以忽略的噪声。不同的架构虽然有不同的“秘密语言”来编码这种结构,但它们都遵循同一个基本规则:形状比风格更重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →