← 最新论文
🤖 machine learning

M+Adam: Low-Precision Training via Additive-Multiplicative Optimization

该论文提出了 M+Adam,一种结合了加法和乘法更新的新型优化器,旨在克服低精度训练中互补的失效模式,从而实现仅使用 BF16、FP8 和 FP4 主权重即可对 LLaMA 式模型进行稳定且准确的训练。

原作者: Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup, Anima Anandkumar

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup, Anima Anandkumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨大的、超智能的机器人(一个大语言模型)如何像人类一样写作。为了做到这一点,你必须调整这个机器人大脑中数以百万计的微小旋钮。通常,这些旋钮的调整需要极高的精度,就像用显微镜来转动一颗螺丝。但是,显微镜又重、又慢、还很贵。

这篇论文提出了一个问题:如果我们改用一把廉价、轻便的扳手呢?

这就是**低精度训练(low-precision training)**的世界。研究人员不再使用高精度的“主权重”(即机器人对旋钮的记忆),而是尝试将它们存储在更小、更粗糙的格式中,例如 BF16、FP8,甚至 FP4。这就像是用一把刻度仅为 10 英尺一个的尺子去测量一座山的高度。

问题所在:“舍入”陷阱

作者发现,当你使用这些粗糙的尺子时,标准的训练方法(称为 Adam)会撞上一堵墙。原因如下:

  1. 大山问题: 当一个旋钮被设定为一个巨大的数值时,“尺子”上的刻度间隔会变得非常大。如果机器人需要移动旋钮一个极其微小的量,尺子就无法感知它。这个微小的移动会被舍入为零,导致机器人认为:“我什么都没动!”于是机器人就卡住了,无法攀登这座大山。
  2. 零值谷底问题: 其他方法尝试通过使用乘法更新(如 Madam)来解决这个问题。它们不再是加上一个微小的数字,而是将旋钮乘以一个系数。对于大山来说,这种方法效果极佳,因为步长会随着旋钮的大小而增长。然而,如果一个旋钮正好卡在上,你就无法通过乘法让它动起来。这就像试图推动一辆没有轮子的车;无论你把零乘以多少,结果依然是零。此外,如果旋钮需要从正值变为负值(跨越零点),这些方法会产生混乱,无法完成切换。

解决方案:M+Adam(双工具组合)

论文引入了 M+Adam,这是一种新的优化器,它像一个聪明的机械师,同时携带两种不同的工具。它结合了两者的优点,以修复那些“互补的失效模式”。

  • 工具 1:加法扳手(Adam 式)。 这个工具擅长进行微小、精确的调整。它可以推动处于零位的旋钮,可以改变正负号,并能处理谷底附近的微小移动。
  • 工具 2:乘法杠杆(Madam 式)。 这个工具擅长进行重体力活。当旋钮数值巨大,以至于加法扳手会被“舍入”成零时,乘法杠杆就会介入。它会缩放旋钮的大小,确保机器人在面对最高大的山峰时仍能持续取得进展。

M+Adam 同时使用这两种工具。如果加法工具因为舍入问题而卡住,乘法工具会保持机器人的移动;如果乘法工具无法脱离零值,加法工具则会将其推离。

证明:它奏效了吗?

作者并没有仅仅停留在猜测阶段;他们在巨大的规模上进行了测试。

  • 测试对象: 他们训练了参数量从 6,000 万10 亿不等的“类 LLaMA”语言模型。
  • 预算: 他们使用了从 1 倍到 8 倍标准“Chinchilla”预算(衡量模型接触数据量的标准指标)的训练预算。
  • 精度: 他们使用 BF16、FP8 和 NVFP4 作为主权重进行了测试。

结果:
在每一次测试中,M+Adam 都始终优于标准的 Adam 优化器。

  • 在最极端的低精度设置(NVFP4)下,与 Adam 相比,M+Adam 使 350M 参数模型的“困惑度”(衡量模型有多困惑的指标)降低了 16.6%
  • 即使在 10 亿参数的情况下,M+Adam 在所有精度区间内都表现出了比 Adam 更明显的改进。

论文从数学上证明,这种结合的方法保证了训练损失会下降(即“单调下降”),这意味着机器人一直在学习,永远不会陷入死循环。

它“不是”什么

了解这篇论文并未声称的内容非常重要:

  • 并不表示 M+Adam 是一个消除了所有内存成本的“万灵药”。事实上,论文指出 M+Adam 增加了一点额外的内存(为乘法工具准备的一个额外“状态”),尽管他们展示了这些状态稍后可以被压缩。
  • 并不声称像随机舍入(Stochastic Rounding)(一种修复舍入误差的技术)这样的标准方法是没用的。他们测试了带有随机舍入的 Adam,结果发现 M+Adam 的表现依然更好。
  • 并不建议我们停止使用高精度硬件。相反,它表明如果我们必须使用低精度存储,那么 M+Adam 才是正确的方法。

核心结论

论文表明,当你被迫使用“粗糙”的尺子(低精度权重)来训练巨型 AI 模型时,你不能只依赖一种类型的移动。你需要一种混合方法。M+Adam 正是这种混合方案,它利用加法和乘法步长,确保机器人既不会在面对大山时停滞不前,也不会在逃离零值谷底时被困。这是迈向高效训练大规模 AI 模型的一项原则性进展,无需依赖我们通常依赖的沉重且昂贵的高精度内存。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →