← 最新论文
🤖 AI

Gradient Heterogeneity Complements Hessian Heterogeneity in Transformer Optimization

本文揭示了由 Post-LN 架构加剧的梯度异质性会降低 Transformer 中 SGD 的收敛性,但这种现象能被 Adam 和 SignSGD 等对梯度尺度变化不敏感的逐坐标自适应方法有效缓解。

原作者: Akiyoshi Tomihari, Issei Sato

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Akiyoshi Tomihari, Issei Sato

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能这一广阔且快速演进的领域中,一种被称为“Transformer”的特定计算机模型已成为支撑现存一些最强大的语言和图像系统的引擎。这些模型的训练过程被称为“优化”,即计算机通过反复调整其内部设置来减少误差,就像一名徒步旅行者试图在雾气弥漫的山谷中寻找最低点一样。几十年来,这项任务的标准工具是一种被称为“随机梯度下降”的方法,它根据地形的即时坡度采取细小且经过计算的步伐。然而,随着模型变得越来越庞大和复杂,研究人员发现这种传统工具经常显得力不从心,要么踉跄蹒跚,要么移动得过于缓慢,以至于无法投入实际应用。因此,该领域已转向使用一种不同的工具——Adam,它能动态地调整步长,并已被证明在训练这些大规模系统方面更为有效。然而,一个悬而未解的谜团依然存在:为什么 Adam 比旧方法效果好得多?在模型内部究竟发生了什么,才造就了这种差异?

东京大学的一个研究小组现在揭开了这一谜团的层层迷雾,从模型内部景观是如何塑造的角度提供了一个清晰的解释。他们发现,训练这些模型的困难源于模型处理数据时的一种特定的不均匀性或异质性。想象一下这样一个景观:有些山丘极其陡峭狭窄,而另一些则平缓宽阔;传统的处理方式对每个方向一视同同,会被这种混合情况所迷惑,往往在陡峭部分采取过大的步幅,而在平缓部分采取过小的步幅。研究人员发现,这种不均匀性并非随机的奇特现象,而是这些模型构建方式中的一种结构性特征,特别受到架构中某些稳定组件放置位置的影响。

研究表明,自适应优化器的卓越性能并非由于其具备某种处理噪声的“魔力”(正如之前的某些理论所暗示的那样),而是因为它能有效地忽略步长的规模,而传统方法则不然。通过分析这些优化器的数学行为,作者展示了传统方法对模型不同部分梯度强度变化的高度敏感性。当模型的某一部分需要微调,而另一部分需要大幅调整时,传统方法试图应用统一的步长,这导致了效率低下。相比之下,自适应方法及其一个更简单的版本——SignSGD,通过观察变化的“方向”而非“幅度”来调整其方法,从而能够更加轻松地在模型的崎岖地形中航行。

为了证明这一点,研究人员进行了严密的理论分析,推导出了描述每种方法达到解所需的步数的数学边界。他们的工作表明,当模型表现出高度的梯度不均匀性时,传统方法的进度会显著放缓,而自适应方法则保持稳健。他们进一步将这种不均匀性的根源追溯到 Transformer 本身的设计,特别是“层归一化”(layer normalization)组件的放置位置。他们发现,当该组件被放置在主要处理步骤之后时,它会放大梯度强度的差异,使景观变得更加险恶,从而对传统优化器造成更大的挑战。当它被放置在步骤之前时,景观变得更加平滑,传统方法的表现也会有所提升,尽管自适应方法仍然保持优势。

该团队通过在语言和视觉任务上对模型进行微调,利用现实世界的实验验证了这些理论见解。他们观察到,在梯度不均匀性较高的场景中,传统优化器难以收敛,学习速度极慢,而自适应方法及其基于符号(sign-based)的对应方法则能高效训练。这证实了性能差距的关键在于这些优化器如何处理模型的结构性异质性。研究结果表明,现代人工智能的成功不仅在于拥有更多的数据或计算能力,还在于使用正确的数学工具来应对由模型架构本身所创造的特定、不均匀的地形。通过理解这一动态过程,研究人员可以更好地设计训练策略,并有可能为下一代人工智能开发出更有效的优化器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →