这篇文章探讨了一个深度学习领域非常核心的问题:“残差连接(Skip Connection)到底是不是多余的?”
为了让你轻松理解,我们可以把神经网络想象成一个**“超级加工厂”**。
1. 背景设定:加工厂的两种模式
想象你经营着一家加工零件的工厂,每个车间(即神经网络的一层)负责把原材料(输入数据)加工成半成品。
- 模式 A:纯加工模式(Residual-free MLP)
原材料进入车间 → 经过复杂的机器加工 → 变成半成品 → 送往下一个车间。
- 模式 B:加工 + 直通模式(Skip Connection)
原材料进入车间 → 一部分直接通过一条“传送带”跳过机器,原封不动地送到下一个车间;另一部分经过机器加工 → 两部分在下一个车间汇合。
过去人们认为: “直通模式”只是为了让原材料在复杂的加工过程中不至于“走丢”或“变质”(帮助梯度流动,让训练更容易)。
这篇文章在问: “能不能通过调整机器的参数,让‘纯加工模式’的效果,变得和‘加工 + 直通模式’一模一样?如果能,那‘直通模式’不就是浪费空间吗?”
2. 研究结论:这不仅仅是“换个零件”的问题
作者通过严密的数学证明发现,答案在绝大多数情况下是:“不行!直通模式是不可替代的神技。”
我们可以把结论分成三个层次来理解:
第一层:对于“现代主流机器”——绝对无法替代(Impossibility)
现在的 AI(比如 LLaMA, GPT 等)使用的加工机器(激活函数,如 SwiGLU, GeGLU)非常特殊。
- 比喻: 这些机器非常“敏感”,它们处理数据的方式是高度非线性的。作者证明了,如果你试图用一个纯加工车间去模拟“直通模式”,你会发现:直通模式在处理极小的数据时,表现得像个“复印机”(保留了原样),而纯加工车间无论怎么调参数,表现得都像个“粉碎机”(把数据都变成了某种复杂的变形)。
- 结论: 对于目前最先进的 AI 模型,残差连接(直通模式)在数学逻辑上是绝对无法被吸收进普通加工层里的。
第二层:对于“老式机器”——极其罕见的巧合(The ReLU Case)
对于一些较老的、简单的机器(比如 ReLU 激活函数),理论上确实存在一种可能,让“纯加工”模拟“直通”。
- 比喻: 这就像是在说,如果你能极其精准地调整机器的齿轮,让机器在加工某些零件时,恰好能“反向抵消”掉一部分变化,从而模拟出“原样传送”的效果。
- 结论: 虽然理论上可行,但这种配置要求机器的参数必须极其精准地凑在一起(满足一个非常苛刻的数学公式)。在现实中,如果你随机设置机器参数,这种“巧合”发生的概率几乎是 0。
第三层:结论——它们属于不同的“宇宙”
作者最后给出了一个很酷的结论:残差连接网络和纯加工网络,在数学上属于两个“几乎不相交”的函数空间。
- 比喻: 就像“圆”和“方”一样。虽然你可以在方块里画个圆,但你不能说“方块”本身就是“圆”。残差连接赋予了神经网络一种全新的能力,这种能力是单纯靠堆叠加工层(增加宽度或深度)很难完美模拟出来的。
3. 总结:为什么要关心这个?
如果你是一个 AI 架构师,这篇文章告诉你:
- 不要试图省掉残差连接: 别以为通过增加神经元的数量(加宽工厂)就能取代残差连接。它们提供的功能维度是不同的。
- 残差连接是“灵魂”: 它不仅仅是为了让训练变快(优化问题),它还从根本上改变了 AI 能“学会”什么样的逻辑(表达能力问题)。
一句话总结:
残差连接不是“备胎”,它是神经网络能够处理复杂逻辑的“高速公路”,单纯靠堆砌加工机器是造不出这条高速公路的。
这是一篇关于深度学习架构理论的学术论文,探讨了一个核心问题:带有残差连接(Skip Connection)的多层感知机(MLP)是否可以通过调整参数,被一个同等宽度的、不带残差连接的 MLP 所完全等价地替代(即“吸收”)?
以下是对该论文的详细技术总结:
1. 研究问题 (Problem Statement)
在现代深度学习架构(如 Transformer、LLaMA、Gemma)中,残差连接(x↦x+MLP(x))是标准配置。作者试图从**函数表示能力(Representational Power)**的角度回答:
- 吸收问题(Absorption Problem): 是否存在一个不带残差连接的 MLP MLP1(x),使得对于所有输入 x,都有 MLP1(x)=x+MLP2(x)?
- 如果可以,说明残差连接在当前宽度下是表示冗余的;
- 如果不可以,说明残差连接为模型开辟了全新的函数空间。
2. 研究方法 (Methodology)
作者通过数学分析,将激活函数分为三类进行讨论,并利用代数、几何和测度论的方法进行证明:
- 齐次激活函数(Homogeneous Activations): 如 ReLU2 或 ReGLU(次数 k=1)。
- 门控激活函数(Gated Activations): 如 SwiGLU 和 GeGLU(通过门控机制实现)。
- 非门控激活函数(Ungated Activations): 如 ReLU 和 GELU(具有线性分量)。
证明工具包括:奇偶分解(Parity Decomposition)、泰勒展开线性化分析、岭函数(Ridge Function)的线性无关性理论以及勒贝格测度(Lebesgue Measure)。
3. 核心贡献与结果 (Key Contributions & Results)
A. 现代主流激活函数的“绝对不可能”结论
对于当前大模型(LLM)中最常用的激活函数,作者证明了吸收在数学上是绝对不可能的:
- 齐次激活函数(如 ReLU2): 通过**次数论证(Degree Argument)**证明,线性项(次数为1)与高次项(次数 k=1)属于不同的齐次类,两者之和无法被单一的 k 次项表示。
- 门控激活函数(如 SwiGLU,GeGLU): 通过线性化分析证明,由于门控函数在原点附近是 O(∥x∥2) 的高阶项,其导数在原点为0,无法产生抵消线性项 x 所需的阶数。
- 深度扩展: 该结论从单层扩展到了任意深度的组合。这意味着,使用这些激活函数的深层残差网络,其表达能力在本质上优于同宽度的非残差网络。
B. ReLU 与 GELU 的“非泛型”结论
对于 ReLU 和 GELU,情况较为特殊,因为它们包含一个线性分量(奇部为 z/2)。
- 充要条件: 作者给出了吸收发生的精确代数条件。即:必须存在一个索引集 S(大小至少为维度 d),使得权重矩阵满足特定的子矩阵乘积关系:Wdown[:,S]Wup[S,:]=−Id。
- 泛型不相交(Generic Disjointness): 虽然在极特殊的权重配置下可以实现吸收,但从测度论角度看,满足该条件的权重集合在参数空间中的勒贝格测度为零。
- 结论: 对于几乎所有的权重初始化,残差 MLP 和非残差 MLP 代表的是两个完全不相交的函数类。
C. 推广到可学习的跳跃连接
作者证明,即使跳跃连接不是简单的恒等映射(Identity),而是可学习的线性映射(如 Hyper-Connections),只要该映射是可逆的,上述结论依然成立。
4. 研究意义 (Significance)
- 理论层面: 该研究从代数角度确立了残差连接的不可替代性。它证明了残差连接不仅仅是为了优化(平滑损失平面、缓解梯度消失),更重要的是它改变了模型的表达能力边界。
- 架构设计层面: 解释了为什么增加宽度或深度时,残差结构能带来质的变化。它告诉设计者:如果你想通过增加 MLP 的宽度来模拟残差结构,在数学上是行不通的。
- 对大模型研究的启示: 既然残差连接提供了独特的函数空间,那么研究如何更有效地利用残差流(Residual Stream)以及残差连接与注意力机制的协同作用,对于提升模型性能具有重要的理论指导意义。
总结表
| 激活函数类型 |
代表函数 |
是否可吸收? |
原因 |
| 高次齐次 |
ReLU2,ReGLU |
绝对不可能 |
齐次次数不匹配 |
| 门控激活 |
SwiGLU,GeGLU |
绝对不可能 |
原点附近阶数过高 |
| 非门控 |
ReLU,GELU |
几乎不可能 (Generically No) |
仅在测度为零的特殊权重下成立 |
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。