← 最新论文
📊 statistics

SGD at the Edge of Stability: Stochastic Stabilization with Large Learning Rates

本文为在大学习率下针对多分类交叉熵损失的随机梯度下降(SGD)建立了紧确的收敛保证,证明了其内在的随机性使算法能够实现自我稳定,并在稳定性边缘的振荡与受控下降之间交替,从而确保收敛。

原作者: Konstantinos Emmanouilidis, Lachlan MacDonald, Salma Tarmoun, Rene Vidal

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Konstantinos Emmanouilidis, Lachlan MacDonald, Salma Tarmoun, Rene Vidal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图让一个沉重的巨石沿着一个非常崎岖、蜿蜒的山坡滚下,以到达底部(即“完美”的解)。在机器学习的世界里,这个巨石就是你的 AI 模型,这座山坡是“损失景观”(loss landscape,即模型出错程度的地图),而底部则是模型犯错最少的点。

长期以来,科学家们认为你必须温柔且小心地推动巨石。如果你推得太用力(使用了“大学习率”),巨石就会撞到墙壁、飞过边缘,或者陷入循环,永远无法到达底部。这就是“经典理论”。

然而,在现代 AI 中,工程师们注意到了一些奇怪的现象:如果他们用力非常大地推动巨石,巨石实际上能更快地到达底部,有时甚至能找到比温柔推动更好的位置。这种现象被称为**“稳定性边缘”(Edge of Stability)**。这就像是在车辆抓地力的极限边缘驾驶;虽然会摇晃和打滑,但仍然能向前移动。

问题在于,大多数解释这种“摇晃驾驶”的数学理论都是为确定性(deterministic)世界编写的(即你知道道路的具体形状)。但在现实中,AI 使用的是随机梯度下降(Stochastic Gradient Descent, SGD)。这意味着 AI 无法一次看到整条路,它只能在决定如何推动之前,先看到一小块随机的路径(一个“小批量/mini-batch”)。这为过程增加了噪声(noise)

这篇论文探讨的是:这种随机噪声如何影响稳定性边缘处的“摇晃驾驶”?AI 会崩溃,还是它能找到自我稳定的方法?

以下是作者的研究发现,通过简单的类比进行解释:

1. 两种驾驶模式

作者发现,当你使用大学习率配合随机噪声时,AI 的旅程并非仅仅是一片混乱。它实际上会在两种截然不同的模式之间切换:

  • “侧滑”阶段(稳定性边缘): 想象巨石被推得太猛,撞到了一个凸起并开始剧烈弹跳。误差(距离底部的距离)忽高忽低。看起来很不稳定。在这个阶段,AI 受制于山坡的“曲率”(即那些凸起)。
  • “滑行”阶段(稳定状态): 最终,AI 进入了一种节奏。尽管仍在被用力推动,但它进入了一个平均而言正在向底部靠近的区域。误差稳步下降。

2. “自我稳定”的魔力

最令人惊讶的发现是 AI 如何处理随机性。

在一个完美的、无噪声的世界里,如果你推得太猛,可能会冲过头且无法返回。但在现实世界中,由于存在随机噪声,作者证明了 SGD 具有一种内置的自我修正机制。

  • 类比: 想象你在狂风暴雨中走钢丝(噪声)。有时风会将你吹离绳索(AI 离开了稳定区域)。
  • 发现: 作者展示了即使风把你吹离了绳索,钢丝本身的形状(交叉熵损失的数学特性)就像磁铁一样。它会将你拉回。你可能会跌落几次,但你总是会在特定的、可预测的步数内被拉回到绳索上。
  • 结果: AI 不会崩溃。它会摇晃,由于随机噪声的原因短暂地跌出“稳定区域”,但随后会立即自我修正并回到一条安全的稳定路径上。这种现象会反复发生,但随着 AI 变得越来越优秀(损失值降低),它在稳定路径上的时间会越来越多,跌落的时间会越来越少。

3. 它适用于简单和复杂的模型

作者不仅研究了简单的直线(线性分类器),还研究了两层神经网络(一种基础的深度学习模型)。

  • 他们证明了即使增加了这些网络的复杂性和随机噪声,同样的规则依然适用。
  • 他们识别出了特定的“激活函数”(AI 内部的数学开关),这些函数允许这种自我稳定现象发生。他们表明,现代 AI 中常用的工具(如 GELU 或 Softplus)完全符合这些规则。

4. 实践证明(实验)

为了确保他们的数学理论不仅仅是理论,他们利用真实数据(如 MNIST 手写数字和 CIFAR-10 图像)进行了实验。

  • 他们使用极大的学习率(比旧教科书建议的安全值大得多)来训练 AI 模型。
  • 结果: 模型并没有爆炸。相反,损失值(误差)迅速下降。模型训练得更快,并达到了很高的准确率,证实了在稳定性边缘进行的“摇晃驾驶”不仅是安全的,而且通常是更优的选择。

总结

这篇论文解释了为什么当我们使用“鲁莽”的学习率时,现代 AI 仍然能表现得如此出色。事实证明,训练过程中的随机性(噪声)并不只是一个麻烦;它与问题的形状相互作用,创造了一个自我稳定的循环

AI 在稳定性边缘可能会踉跄和摇晃,但它拥有一张隐形的防护网,能接住它并将它拉回稳定的路径,使其能够比小心翼翼、缓慢驾驶时更快地收敛到一个优秀的解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →