← 最新论文
🤖 AI

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

本文识别了非均匀 E2M1 FP4 格式中导致训练不稳定的根本性“收缩偏差”(Shrinkage Bias),并提出了 UFP4,一种利用随机哈达玛变换(Random Hadamard Transform)来实现优于现有基于 E2M1 方法的各种模型规模预训练性能的均匀 4 位(E1M2/INT4)训练方案。

原作者: Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图建造一座巨大且极其复杂的乐高城堡(大型语言模型)。为了让建造过程更快、更便宜,你决定不再使用标准的、沉重且精确的积木,而是改用一种全新的、超轻量级的微型 4-bit 积木。

问题在于,目前的“标准”轻量级积木(被称为 E2M1)具有一种奇怪且不对称的形状。本文的作者发现,这些积木有一个隐藏的缺陷:它们每次使用时都会自然地使事物稍微缩小。

以下是他们发现和解决方案的简单解析:

1. 问题所在:“缩水”的积木

把标准的 E2M1 积木想象成具有不均匀间距。有些积木之间的缝隙非常小,而另一些则非常大。

  • 缺陷: 由于这种间距不均,当你尝试将一段数据嵌入到这些积木中时,数学运算会迫使它更多地向下取整而非向上取整。
  • 结果: 这产生了一种“收缩偏差”(Shrinkage Bias)。这就像一个漏水的桶;每当你让一条信息通过模型的每一层时,这条信息就会变得稍微小一点、弱一点。
  • 复合效应: 在一个拥有数百层的深度模型中,这种微小的收缩会反复发生。当信息到达末端时,由于它已经收缩得太多,导致模型开始失去控制(训练变得不稳定)。

2. 让问题恶化的“神奇旋转”

为了解决数据过大或过于奇特(离群值)的问题,工程师们使用了一种名为**随机哈达玛变换(Random Hadamard Transform, RHT)**的技巧。

  • 类比: 想象你有一堆沙子,其中大部分集中在一个巨大的沙堆里(离群值)。RHT 就像一个搅拌器,它将沙子旋转并均匀地铺开在整个托盘上。
  • 冲突: 当你搅拌沙子(RHT)然后试图将其放入不对称的 E2M1 积木中时,沙子恰好落在了最糟糕的缝隙里。这些间距不均的积木抓住了混合后的沙子,使其比之前收缩得更加严重。论文发现,这种标准配方实际上通过使用这个搅拌器,让“漏水桶”的问题变得更糟了。

3. 解决方案:“均匀”的积木 (UFP4)

作者提出了一种名为 UFP4 的新配方。他们不再使用不对称的 E2M1 积木,而是使用一种名为 E1M2/INT4 的新积木。

  • 区别: 这些新积木是完全均匀的。它们之间的间隙大小完全一致。
  • 为什么有效: 因为间隙是均匀的,所以不存在“收缩偏差”。当“混合后的沙子”(RHT 数据)落在这些均匀的积木中时,它能完美契合,不会损失任何尺寸。
  • 策略: 有了这些新的均匀积木,作者意识到他们可以在构建过程的每一个环节(前向传播、反向传播和权重更新)中安全地使用“搅拌器”(RMT)。此前,他们必须非常小心,只能在某一个地方使用搅拌器以避免破坏模型。现在,他们可以在所有地方使用它。

4. 证明

团队在三种不同规模的 AI 模型(小型、中型和巨型)上测试了这种新配方。

  • 结果: 使用这种新型 UFP4(均匀积木)构建的模型,比使用旧的 E2M1(不对称积木)构建的模型,更接近于沉重的标准积木(BF16)的表现。
  • 核心结论: 均匀的网格让模型能够训练得更久、更稳定,而不会丢失信号。

总结

该论文认为,业界一直试图通过修补漏洞来修复漏水的桶,但问题在于桶本身的形状不对。通过切换到一个具有完美均匀间距的桶(均匀网格),我们终于可以安全地使用那些此前过于危险的强大混合工具(RHT),从而实现更快、更便宜且更稳定的 AI 训练。

底线: 不要仅仅修补旧的、不对称的 4-bit 格式;要切换到一种新的、均匀的 4-bit 格式,以防止信号萎缩消失。

核心要点: 不要只修补旧的、不对称的 4-bit 格式;要切换到一种新的、均匀的 4-bit 格式,以停止信号的收缩。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →