← 最新论文
🔢 mathematics

How Controlling the Variance can Improve Training Stability of Sparsely Activated DNNs and CNNs

本文通过证明在不同于线性设置的情况下,较大的固定点高斯过程方差能增强训练稳定性,将混沌边缘理论扩展到了稀疏激活的深度网络中,从而提出了一种能够使深度神经网络(DNNs)和卷积神经网络(CNNs)在隐藏层稀疏度高达 90% 的情况下仍能进行训练的新初始化策略。

原作者: Emily Dent, Jared Tanner

发布于 2026-06-16
📖 1 分钟阅读🧠 深度阅读

原作者: Emily Dent, Jared Tanner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个拥有 10 万人的庞大团队(深度神经网络)去解开一个谜题。为了让他们入门,你给了一套随机的指令(初始化)。

在过去,研究人员发现这些指令存在一个被称为“混沌边缘”(Edge-of-Chaos, EoC)的“金发姑娘区”(即最理想的状态)。如果指令过于混乱,团队会陷入恐慌并尖叫(梯度爆炸);如果指令过于平静,他们会睡着并停止交流(梯度消失)。这个“金发姑娘区”让团队保持恰到好处的活跃度,从而能够进行学习。

然而,这篇论文探讨的是一种特定且棘手的指令类型:稀疏性(Sparsity)。在这种模式下,你要求团队中 85% 到 90% 的成员在处理特定任务时“闭嘴并保持沉默”。这对于节省能源和计算能力非常有效(就像一个只使用所需神经元的大脑),但它会让训练变得极其不稳定。这就像是在指挥一个管弦乐团,却要求 10 个人里有 9 个人保持沉默;如果指挥(数学逻辑)不够完美,那仅有的几个正在演奏的人可能会变得过于响亮或过于微弱,导致整场乐曲崩塌。

旧方法 vs. 新发现

旧有的信念:
多年来,针对这类“沉默大多数”网络的标准建议是:“要把活跃乐手的音量调得非常、非常低。”
从数学上讲,这意味着将方差(即数据的“响度”或分布范围)设置得极小,趋近于零。其理论是,如果你保持信号微弱,这种“沉默”就不会被破坏。

新发现:
Emily Dent 和 Jared Tanner 发现,对于这些特定的“闭嘴”指令,旧的建议反而会让情况变得更糟。他们发现,与其低声细语,不如提高音量,这会让网络变得更加稳定。

他们证明了,通过增加活跃神经元的“响度”(即它们所携带的方差,qq^*),网络会变得:

  1. 更具对称性: 描述信号流动的数学过程变得更加平衡,就像一个完美的跷跷板。
  2. 敏感度更低: 网络不再会对数据的微小变化做出过度反应。它变得更加稳健,像一艘能够应对风浪而不翻船的船只。
  3. 训练更快: 网络学习谜题的速度也更快。

创意类比:“寂静之室”

想象一个大房间,你正试图将一个秘密信息从房间的一端传递到另一端。

  • 问题所在: 你规定房间里 90% 的人必须保持完全静止且不说话。只有 10% 的人可以说话。
  • 旧策略(低方差): 你告诉那 10% 可以说话的人要轻声细语,声音小到几乎听不见。问题在于,在一个嘈杂的房间里,耳语很容易丢失。如果一个人磕绊了一下或者说话稍微大声了一点,信息就会中断。这 90% 的“沉默”放大了 10% 的不稳定性。
  • 新策略(高方差): 你告诉那 10% 的人要清晰、自信地大声说话。因为他们说话更有能量、更清晰,他们的信息能够穿透噪音。即使剩下的 90% 保持沉默,这少数活跃者的强信号也足够稳定,能够顺利传达到房间的另一端而不会失真。

他们实际做了什么

作者并非凭空猜测,而是通过严密的数学推导和实验验证:

  1. 理论部分: 他们利用高级数学(高斯过程)证明,当增加活跃神经元的“响度”(qq^*)时,描述网络行为的数学“曲线”会变得更加平滑且可预测。这能防止网络在训练期间崩溃。
  2. 实验部分: 他们构建了具有高达 90% 稀疏性(即 90% 的神经元处于沉默状态)的深度神经网络(DNN)和卷积网络(CNN)。
    • 当他们使用旧的“耳语”法(q=1q^*=1)时,这些网络经常无法学习,或者结果很差,尤其是在高稀疏度的情况下。
    • 当他们使用新的“大声说话”法(q=2q^*=2 或 $3$)时,网络能够成功训练,达到更高的准确率,并且对参数调优的敏感度更低。

核心结论

这篇论文颠覆了我们训练高度稀疏神经网络的传统思路。我们不应该试图让信号变得微小且脆弱,而应该在开始时就赋予活跃部分更多的“劲头”(方差)。这一简单的改变使我们能够构建出既能保持 90% 沉默(节省大量计算能力),又能可靠且快速地进行训练的网络。

注: 本文严格聚焦于关于初始化和在标准数据集(如 MNIST 和 CIFAR-10)上训练稳定性的数学理论。它并不声称这些结果适用于临床用途、特定的现实世界部署,或未来的架构(如 Transformer,作者已明确将其排除在本次研究之外)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →