← 最新论文
💬 NLP

Why Geometric Continuity Emerges in Deep Neural Networks: Residual Connections and Rotational Symmetry Breaking

本文阐释了深度神经网络中的几何连续性源于残差连接与对称性破缺非线性激活函数的协同作用:前者使各层的权重更新保持一致,后者将各层约束于共享的坐标框架中,从而防止旋转漂移。

原作者: Kyungwon Jeong, Won-Gi Paeng, Honggyo Suh

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Kyungwon Jeong, Won-Gi Paeng, Honggyo Suh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个深度神经网络是一座庞大、多层的工厂。每一层(或“楼层”)接收原材料,对其进行加工,然后将其传递到上一层。为了让这座工厂高效运转,每一层的“工具”需要以特定的方式对齐。

本文探讨了一个奇特的发现:在训练良好的工厂(神经网络)中,相邻楼层的“工具”(权重矩阵)竟然惊人地相似。如果你观察每个工具指向的最重要方向,它们似乎都指向大致相同的方向,从而在建筑底部到顶部之间形成一条平滑、连续的路径。作者将这种现象称为“几何连续性”。

本文回答的核心问题是:为什么会发生这种情况? 这是魔法,还是有特定的配方?

通过对简单模型(玩具工厂)和复杂模型(Transformer)的实验,作者发现要形成这种平滑的对齐,需要两种特定的“原料”。如果缺少其中任何一种,工厂就会陷入混乱。

两种秘密原料

1. 电梯系统(残差连接)

想象工厂的楼层之间由一部特殊的电梯连接,它将一条“消息”从底层一直传送到顶层,且几乎不改变其内容。这就是残差连接

  • 它的作用: 它确保“误差信号”(告知工厂哪里出错的“消息”)能够顺畅地从顶层传回到底层。
  • 类比: 如果没有这部电梯,消息在每一层都会丢失或被打乱。有了它,每一层都能听到关于“需要修复什么”的相同故事。这就创造了一种共享的“连贯性”或行动共识。
  • 结果: 这种消息的对齐是第一步。它使得各楼层倾向于指向相同的方向。

2. 锁定机制(打破对称性的非线性)

这是最关键且最令人惊讶的部分。即使有了电梯,工厂仍可能失败。想象一下,如果每一层都能自由地将整个机器旋转 360 度。即使它们都同意做什么,它们也可能将工具随机地指向北、南、东或西。这样,“平滑路径”就会断裂。

为了阻止这种情况,工厂需要一个锁定机制。在神经网络中,这由激活函数(如 ReLU)和归一化(如 LayerNorm)提供。

  • 类比: 将这些函数想象成一种“磁性锁”,将机器锁定在固定的坐标系中。它们打破了“旋转对称性”。
    • 没有锁(线性/无激活): 机器可以自由旋转。即使各楼层就任务达成一致,它们在方向上也会逐渐偏离。平滑路径会崩塌。
    • 有锁(ReLU/SiLU): 机器被固定在特定的网格上,不再能自由旋转。因为它们都被固定在同一个网格上,并且都听到了来自电梯的相同消息,它们自然会将其工具对齐到同一方向。
  • 转折: 重要的不是“非线性”(数学的复杂性),而是旋转对称性的打破。作者通过使用一种特殊的“保持旋转”的数学函数证明了这一点,该函数虽然复杂(非线性),但并未锁定旋转。结果呢?工厂依然分崩离析。英雄是“锁”,而不是复杂性。

工厂楼层如何对齐(过程)

本文描述了一个两步走的“舞蹈”:

  1. 形成: 电梯(残差连接)使各楼层就梯度的方向(修复误差的路径)达成一致。
  2. 保持: 锁定机制(激活函数/归一化)将这种共识固定下来,防止工具随时间推移而偏离。

如果你移除了锁,楼层可能会在瞬间保持对齐,但随后它们会像雾中的船只一样缓慢漂移,最终破坏平滑路径。

Transformer 的转折:读取与写入

本文还研究了Transformer(现代 AI 如大语言模型背后的架构)。这些是更复杂的工厂,拥有不同类型的工人:

  • 读取者(Q、K、门控、Up): 这些工人观察主传送带(残差流)。它们在输入空间(它们如何观察世界)中发展出连续性。
  • 写入者(O、Down): 这些工人写回传送带。它们在输出空间(它们如何影响世界)中发展出连续性。
  • 异类(V): “值”投影是一个读取者,但它旁边没有“锁”(没有激活函数)。由于缺乏打破对称性的锁,它从未发展出平滑路径。它保持混乱且不对齐。

用通俗语言总结

本文得出结论:我们在 AI 权重中看到的平滑、连续的结构并非偶然。它是两个设计选择的直接结果:

  1. 残差连接充当通信高速公路,确保所有层听到相同的指令。
  2. 激活函数充当磁性夹具,阻止各层偏离对齐。

如果你只有高速公路而没有夹具,各层会相互漂移。如果你只有夹具而没有高速公路,它们就无法就做什么达成一致。你需要两者兼备,才能构建一个深层、稳定且几何连续的神经网络。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →