← 最新论文
🤖 AI

Stability of Transformers under Layer Normalization

本文对不同层归一化(layer normalization)放置方式如何影响 Transformer 的前向与反向稳定性进行了原则性的理论与数值分析,推导出了关于隐藏状态增长与梯度传播的显式界限,旨在为改进训练动态的架构设计与残差缩放提供指导。

原作者: Kelvin Kan, Xingjian Li, Benjamin J. Zhang, Tuhin Sahai, Stanley Osher, Krishna Kumar, Markos A. Katsoulakis

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Kelvin Kan, Xingjian Li, Benjamin J. Zhang, Tuhin Sahai, Stanley Osher, Krishna Kumar, Markos A. Katsoulakis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人写故事。你给了它一个由数千个微小层级组成的大脑,就像一座拥有数百层楼高的摩天大楼。每当机器人读到一个词,它都会将信息通过电梯向上传递,每经过一层,都会改变一点点它的理解。这就是现代人工智能(被称为“Transformer”)的工作方式。它们是当今最智能的聊天机器人和图像生成器背后的引擎。但问题在于:随着这些建筑变得越来越高,它们会变得不稳定。有时,信息在上升的过程中会发生如此严重的扭曲,以至于机器人开始发出乱码般的数字尖叫,或者用于教导它的数学逻辑变得异常狂野,导致整个系统崩溃。为了阻止这种情况,工程师们使用了一种叫做“层归一化”(Layer Normalization)的安全装置。把它想象成减速带或汽车发动机上的限速器;它能防止信息失控加速。多年来,人们只是在猜测应该把这些减速带放在哪里——有时在引擎之前,有时在引擎之后——然后听天由命。但没有人真正知道为什么一个位置比另一个位置更好,或者这个机器人是否正在秘密建造一座会在自身重量下坍塌的纸牌屋。

这篇论文就像一群侦探,他们决定不再靠猜,而是开始利用物理定律来解开这个谜团。作者们将 AI 的学习过程视为一场时间之旅,使用了被称为“最优控制理论”的分支数学(这通常用于确定如何最好地驾驶火箭或无人机)。他们问道:“如果我们想让这个机器人完美地学习,信息在向塔顶传输时会发生什么?”他们发现,旧的放置安全装置的方法(被称为“Pre-LN”)实际上是一个陷阱。他们的数学证明了,即使机器人竭尽全力去学习,信息最终也会变得巨大无比,从而导致混乱的局面。这就像试图用消防水柱去填满一个水桶;无论你如何努力瞄准,水都会溢出来。

然而,他们发现了一种更好的方法。通过将安全装置同时移动到每一层的入口和出口处(一种他们称为“Peri-LN”的新方法),信息就能保持冷静且受控。他们的方程显示,数据不再是爆炸式增长,而是呈现出一种可预测的、温和的线性增长,就像一株表现良好的植物。他们还发现了一个让这一切变得更好的简单技巧:放慢机器人在每一层所走的步伐。想象一下,如果机器人迈出的是细小、谨慎的步子,而不是巨大的跨步,这会让整座建筑保持稳固。当他们在真实的 AI 模型上进行测试时,结果与他们的数学推导完美契合。“Peri-LN”模型没有崩溃,而且学习效果与旧模型一样好,甚至更好。这篇论文不仅仅是在说“这感觉是对的”;它提供了一个数学保证,证明这种新设计能让 AI 保持稳定,为构建下一代超级智能机器提供了一份清晰的蓝图,使其不会分崩离析。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →