On the Principles Behind Neural Network Optimizers
本文通过解决其收敛性争论、通过演化的 Hessian 结构解释其在 Transformer 上优于 SGD 的原因,并利用这些见解引入了 Adam-mini——一种在保持性能的同时将内存使用量减半的新型优化器,从而为 Adam 优化器提供了原则性的理论基础。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能依赖于一种微妙的平衡。为了教会计算机识别照片中的猫或写出一个连贯的故事,研究人员必须引导一个庞大的数学系统穿越一片误差景观,不断调整其内部设置以寻找最低点。这个过程被称为训练,而用于在这片地形中导航的工具被称为优化器。多年来,行业标准一直是一种名为 Adam 的算法。它是最强大的语言模型的默认引擎,这些模型能够编写代码、翻译语言并进行对话。然而,尽管它无处不在,Adam 的数学基础却一直摇摇欲坠。近十年来,一个著名的理论结果表明,Adam 可能会发生灾难性的失败,甚至在处理简单问题时也会失控。这造成了一个悖论:驱动最先进人工智能的工具在理论上是破碎的,但在实践中却运行得非常完美。研究人员一直在思考,为什么理论与现实不符,以及他们所依赖的工具是否真的安全。
由深圳中国科技大学的张宇顺(Yushun Zhang)完成的一篇新博士论文,通过从一个全新的角度观察问题,解决了这一悖论。这项工作不仅是在修补理论,它还重新审视了这些模型所解决问题的本质。研究人员发现,对 Adam 失败的担忧是基于一种特定的、人工设定的环境,这种环境并不反映现实世界的实际训练过程。通过将视角转向关注训练过程中使用的训练数据块的大小,该研究证明了只要针对特定任务正确调整设置,Adam 确实是安全的。更重要的是,该论文揭示了现代神经网络数据中隐藏的几何结构。这种结构解释了为什么 Adam 在训练大型语言模型等复杂任务上表现优于其竞争对手,而在处理较简单任务时却表现较差。事实证明,这些模型的内部景观并非混乱的废墟,而是一个由截然不同的、有组织的模块组成的集合。识别出这种模式让研究人员设计出了一种新的、更高效的优化器——Adam-mini,它在不牺牲性能的前提下,将训练这些大规模模型所需的内存减半。
故事始于关于 Adam 是否可靠的长期争论。多年来,一篇被广泛引用的论文声称 Adam 可能会发散,这意味着训练过程会趋向无穷大,而不是稳定下来。这一说法是基于一个特定的数学案例,在该案例中,算法被测试在一个根据算法设置而改变规则的问题上。然而在现实世界中,研究人员不会为了适应工具而改变问题;他们是固定问题,然后调整工具以适应它。张的研究表明,当问题是固定的(如在实际训练中所进行的)时,Adam 不会发散。相反,它表现出一种清晰的相变:如果设置选择不当,它可能会失败;但如果选择正确,它就会安全收敛。这种安全性的关键在于一个特定的设置,即控制算法给予过去信息多少权重的设置。研究证明,对于更大的数据集,这个设置必须更高才能确保稳定性。这一发现与工程师在实践中的观察一致:在用小批量数据训练大型语言模型时,增加这个设置可以防止训练崩溃。该论文提供了第一个严密的数学证明,证明了标准版本的 Adam 在经过正确调优后是安全可用的。
在确立了 Adam 是安全之后,研究转向了一个更令人困惑的问题:为什么它在 Transformer 等复杂模型上的表现比其主要竞争对手 SGD 好得多,而在较简单的模型上表现却较差?为了回答这个问题,研究人员观察了误差景观的形状,特别是名为 Hessian 的数学对象,它描述了误差在每个方向上是如何变化的。在简单问题中,这种景观是密集且纠缠在一起的,就像一片茂密的森林,每条路径都与其他路径相连。在这种环境下,Adam 逐个调整每个设置的策略是低效的。然而,当研究人员检查深度神经网络和 Transformer 的 Hessian 时,一个令人惊讶的模式出现了。随着训练的进行,复杂的、纠缠的景观简化成了一种由截然不同的、独立的块组成的结构。想象一下一张巨大的电子表格,与其让每个单元格都影响其他所有单元格,不如让影响仅限于特定的行和列。在这些网络中,控制特定输出神经元或特定注意力头的参数形成了它们自己的孤立组。
这种块状结构是 Adam 成功的秘密。因为景观被分解成了独立的块,所以 Adam 为每个参数分配唯一学习率的方法变得非常有效。它可以调整一个块的设置,而不会意外地弄乱另一个块的设置。相比之下,像 SGD 这样更简单的优化器会对整个系统应用单一的学习率,这难以处理这些不同块的变化速度和规模。研究进一步揭明,这种块状结构并非巧合;它自然产生于这些网络构建的方式,特别是由于计算过程中大型矩阵的连续乘法。随着网络的训练,系统远处部分之间的连接逐渐消失,留下了这些干净、分离的块。这一洞察解释了为什么 Adam 是现代人工智能的首选引擎:它所解决的问题拥有一种与其优化器设计完美匹配的隐藏几何结构。
凭借对这种隐藏块结构的理解,研究人员开发了一种名为 Adam-mini 的新优化器。标准的 Adam 算法非常耗费内存,因为它需要为模型中的每一个参数都记录一个独特学习率。对于一个大规模语言模型,这需要存储比模型本身多两倍的数据,从而产生了瓶颈,这既减慢了训练速度,也限制了在现有硬件上能运行的模型规模。新的洞察是,由于参数是按块组织的,我们不需要为每一个参数都分配一个独特的学习率。相反,我们可以为每个完整的块分配一个学习率。这一简单的改变将内存占用减少了 50%。新的优化器 Adam-mini 通过其自然的块结构对参数进行分组——对于大多数层按行分组,对于特定部分的网络按注意力头分组——并为每个组应用单一的学习率。
这种重新设计的成果是立竿见影且具有实际意义的。在训练参数量从 3900 万到 10 亿不等的模型测试中,Adam-mini 在使用一半内存的同时,达到了标准 Adam 优化器的性能水平。这种效率使得研究人员能够在相同的硬件上训练更大的模型,或者更快地训练现有模型。该方法已被包括 DeepSeek 和 Kimi K3 模型团队在内的主要 AI 实验室采用,他们使用这种方法的变体来训练他们的下一代系统。该论文还表明,这种基于块的学习率原则可以应用于其他先进的优化器,在不改变其核心逻辑的情况下提高其效率。通过揭示神经网络训练的隐藏几何结构,这项工作将该领域从一个充满不确定性和试错的地方,带到了一个基于原则的设计阶段。它证明了最有效的人工智能工具不仅仅是幸运的猜测,而是与它们所解决问题的特定数学结构完美契合的算法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。