← 最新论文
🤖 machine learning

Pretraining large language models with MXFP4

本文指出,量化权重梯度(Wgrad)是大语言模型全流水线 FP4 训练不稳定的主要原因,并证明确定性哈达玛旋转而非随机舍入对于恢复收敛稳定性至关重要。

原作者: Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教导一位庞大而聪慧的学生(大型语言模型)撰写故事。通常,为了让这位学生高效学习,你会给他们提供用高质量、详尽墨水书写的笔记(称为FP8精度)。这很有效,但这些笔记很沉重,占据了学生背包的大量空间,并减慢了他们的阅读速度。

研究人员想知道,他们是否可以切换到仅用 4 位信息书写的超轻量级笔记MXFP4)。这些笔记微小且快速,有望让学生学习得更快。然而,有一个陷阱:当他们尝试在整个学习过程中使用这些微小笔记时,学生常常感到困惑,开始胡乱猜测,并无法学到任何东西(训练“发散”)。

本文提出了一个问题:为什么会发生这种情况,我们该如何解决?

实验:三步测试

研究人员设计了一个受控实验,以确切找出问题所在。他们将学习过程分解为三个阶段,并逐步将厚重的笔记替换为轻薄的笔记,一次一个阶段:

  1. 前向传播(Fprop): 学生阅读问题。
  2. 激活梯度(Dgrad): 学生弄清楚自己对问题的误解程度。
  3. 权重梯度(Wgrad): 学生更新他们的大脑(“权重”),以便下次记住这个教训。

发现:

  • 阶段 1 和 2: 当他们仅将轻薄笔记用于阅读和理清误解时,学生表现良好。他们几乎像使用厚重笔记一样学习,只是需要多做一些练习题。
  • 阶段 3(问题所在): 一旦他们切换到使用轻薄笔记来更新大脑(Wgrad),学生就开始失控。研究人员发现,这个特定步骤是“薄弱环节”。这就像试图在一张微小且皱巴巴的纸上写复杂的数学修正;细节会丢失,学生就会学到错误的教训。

失败的修复:添加随机性

当学生开始失败时,研究人员尝试了一种常见的技巧:随机性(添加随机性)。

  • 类比: 想象学生感到困惑,于是你告诉他们:“随便猜一个!”或者“转轮盘来决定你的答案。”
  • 结果: 这行不通。事实上,向微小笔记中添加随机性反而加剧了错误。随机猜测产生的“噪声”放大了轻薄笔记中原本就存在的微小误差,导致训练完全崩溃。

成功的修复:确定性洗牌

随后,研究人员尝试了一种不同的方法:确定性哈达玛旋转

  • 类比: 不是随机猜测,想象学生拥有一把特殊的、刚性的尺子,在写下微小笔记之前完美地重新排列它们。这把尺子不添加随机性;它只是以特定、可预测的方式组织信息,这样微小笔记就不会被弄皱或丢失。
  • 结果: 这非常有效。通过使用这种特定、可预测的“重新排列”方法,学生可以在整个过程中(阅读、分析和更新)使用微小、快速的笔记而不会感到困惑。

核心结论

本文得出了两个主要结论:

  1. 瓶颈: 4 位训练失败的主要原因并不是因为笔记总体上太小;而是具体因为**大脑更新步骤(Wgrad)**对这些笔记中的微小误差过于敏感。
  2. 解决方案: 要让 4 位训练生效,你不需要添加更多随机性。你需要结构。通过使用特定、可预测的数学洗牌(哈达玛旋转),你可以稳定整个过程。

回报:
当他们用这种“重新排列尺子”解决了问题后,系统在每个学习步骤上的速度提高了20%。由于学生能够稳定学习而无需额外的练习题,与旧的厚重墨水方法相比,整个过程从头到尾大约快了10%

简而言之:你可以使用超快速、微小的笔记,但前提是在写下它们之前必须完美地组织它们。如果你只是随意添加一些随机性,一切都会崩溃。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →