← 最新论文
🤖 machine learning

Closing the Curvature Gap: Full Transformer Hessians

本文通过推导出完整 Transformer 块的精确闭式 Hessian 矩阵,明确考虑了层归一化(Layer Normalization)、前馈网络(Feed-Forward Networks)与残差连接之间的相互作用,并利用经验加速和谱范数界限验证了这些公式,从而填补了理解 Transformer 优化方面的理论空白。

原作者: Egor Petrov, Nikita Kiselev, Vladislav Meshkov, Andrey Grabovoy

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Egor Petrov, Nikita Kiselev, Vladislav Meshkov, Andrey Grabovoy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的广袤版图中,一种被称为“Transformer”的特定架构已成为主导力量,驱动着从语言翻译到图像识别的一切技术。这些系统由处理并行信息的数学运算层构建而成,但其内部运作机制对于设计它们的科学家来说仍带有某种神秘色彩。虽然我们知道这些模型有效,但它们保持稳定性的精确数学原因以及它们学习的具体方式尚未被完全绘制出来。理解这种行为的一个核心工具是海森矩阵(Hessian),这是一个描述学习过程曲率的复杂数学对象。将模型的训练想象成一场穿越丘陵地带的旅程;海森矩阵能准确告诉我们坡度有多陡,以及脚下的地面是如何弯曲的。这一信息至关重要,因为它决定了一个算法是会平滑地滑动到解,还是会陷入一个困难的境地。直到现在,研究人员只能计算出该系统中孤立部分的曲率,导致关于整个机器如何运作的完整图景是不完整的。

现在,一个研究小组通过推导出一个完整 Transformer 块的精确数学曲率描述,填补了这一空白。这个“块”是该架构的基本单元,由几个相互作用的部分组成:一个权衡不同信息重要性的机制、一个使数值保持在控制范围内的归一化步骤、一个增加非线性处理的前馈网络,以及允许信息绕过这些层的残差连接。该团队并未依赖近似值或模拟,而是使用严谨的数学技术,写出了整个块如何随其权重变化而产生曲率的精确公式。他们将系统视为一个整体,考虑了归一化层和前馈网络如何与注意力机制相互作用,而不是孤立地研究它们。

分析表明,学习景观的曲率并非均匀分布,而是由每个架构组件的不同贡献所塑造。注意力机制(它允许模型专注于输入的特定部分)引入了一种对输入数据规模高度敏感的曲率。归一化层(它稳定了训练过程)则根据数据的方差增加了自身的曲率,使得景观对数值的离散程度非常敏感。前馈网络(它使用一个简单的规则来决定传递哪些信号)主要通过其不同权重矩阵之间的相互作用来贡献曲率,而残差连接则充当了一个控制这些曲率如何在系统中传播的桥梁。研究人员发现,这些不同的曲率来源以特定的方式结合在一起,创造出一个复杂的景观,其中某些方向非常陡峭,而另一些方向则相对平坦。

为了确保他们的公式正确,团队将理论结果与计算机软件用于计算导数的标准方法进行了对比。匹配结果是精确的,达到了计算机精度的极限,证实了他们的闭式方程能够准确描述该系统。除了验证数学逻辑外,研究还表明,在某些计算中,使用这些显式公式比标准计算方法显著更快。在测试中,新公式在某些组件上实现了超过八十倍的加速,而在其他组件上则实现了数百倍的加速。这种效率表明,理解这些模型的精确曲率不仅是一项理论练习,更是一个实用的工具,可以帮助工程师更有效地分析并改进大型人工智能系统的训练。这项工作提供了一个清晰、统一的视角,展示了 Transformer 的不同部分如何协同工作来塑造学习过程,使该领域从局部理解迈向了完整的数学表征。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →