← 最新论文
🤖 machine learning

Finer is Better (with the Right Scaling)

本文通过证明该问题源于重尾分布与 FP4 格式之间的不良相互作用,解决了缩小量化块尺寸会损害大语言模型性能的悖论,并表明诸如 4-over-6 缩放和防止下溢等针对性算法干预措施,可使符合标准硬件的格式以更细粒度实现最优质量。

原作者: Clemens Schaefer, Gil Tabak

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Clemens Schaefer, Gil Tabak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对论文《更细粒度更好(前提是缩放得当)》的解释。

核心问题:“过细”悖论

想象一下,你正在为旅行打包行李箱。你有一大堆衣服(数据),但行李箱的空间(内存)有限。为了把所有东西都装进去,你决定把衣服切成越来越小的包裹(称为),以便更高效地整理。

直觉上你会想:“包裹切得越小,我就能装得越好,对吧?”

在人工智能领域,这被称为量化。科学家们曾试图缩小这些包裹,以使 AI 模型更小、更快。但他们遇到了一个奇怪的悖论:当他们把包裹切得太小时,AI 的表现反而变差了。 这就像是为了把衣服塞进箱子而过于小心,结果把衣服都压坏了,导致它们无法使用。

为什么会发生这种情况?

这篇论文的作者调查了为什么会出现这种“过细”悖论。他们发现了两个主要罪魁祸首:

1. “零”故障(空盒子)
想象你有一个只能装数字的盒子。如果一个数字非常小,盒子的尺子可能会把它四舍五入为零。如果你有一整包微小的数字,尺子可能会说:“好吧,这一整包都是零”,然后把整个包扔掉。

  • 解决方法: 论文建议一个简单的规则:绝不让尺子显示零。 如果一个数字太小,就强制尺子使用最小的可能正数。这样可以保留信息。

2. “粗糙尺子”问题(粗网格)
这是更大的问题。AI 使用一种特定类型的“尺子”(称为E4M3)来测量这些包裹。这把尺子的刻度间隔非常大,尤其是在高端部分。

  • 类比: 想象你试图用一把只有 1 英尺、2 英尺、4 英尺和 6 英尺刻度的尺子来测量山脉。
    • 如果你有一座小山(一小块数据),尺子可能会强迫你将一座 5.9 英尺的小山向上舍入到 6 英尺。这是一个巨大的误差!
    • 当你把包裹切得更小时,你会得到更多这种“高”数值,它们被迫落入那个笨拙的 6 英尺桶中。包裹越小,这种糟糕的舍入发生得越频繁,AI 的表现也就越差。

解决方案:他们是如何修复的?

作者测试了三种主要的修复方法,证明了更细的块确实更好,但前提是你必须使用正确的工具。

1. “不要归零”规则
他们简单地编程让系统绝不让缩放因子变为零。

  • 结果: 这解决了极小数值的问题,但并没有解决那些被向上舍入到 6 的“高”数值的问题。

2. "4 或 6"的选择(4 优于 6 方法)
这是论文的“秘密武器”。系统不再使用一把固定的尺子,而是可以为每个包裹在两个特定设置之间进行选择:46

  • 类比: 想象你在打包一个箱子。有时你的物品最适合用“中号”箱子(4),有时最适合用“大号”箱子(6)。与其强迫所有东西都塞进“大号”箱子(这会压坏小东西),系统会检查:“这两个箱子中,哪一个最适合这个特定的包裹?”
  • 结果: 这使得 AI 能够避免笨拙的舍入误差。当他们使用这种方法时,“悖论”消失了。更小的包裹突然变得好多了,就像它们本该表现的那样。

3. “蛮力”检查
为了证明他们的观点,他们运行了一次计算机搜索,尝试了每一种可能的测量包裹的方法,以找到完美的那一种。

  • 结果: 这证明了从理论上讲,如果你选择了完美的测量方法,更小的包裹总是效果更好。之前 AI 表现不佳并不是因为小包裹不好;仅仅是因为他们使用了错误的测量方法。

现实世界测试:它在真实 AI 上有效吗?

他们在四个著名的 AI 模型(Granite、Llama、DeepSeek 和 Qwen)上测试了这一点。

  • 问题: 正如悖论预测的那样,其中两个模型(Granite 和 Llama)在包裹变小时表现变差。
  • 修复: 当他们应用"4 或 6"的选择和“不要归零”规则时,这些模型不再变差。事实上,随着包裹变小,它们的表现更好了。
  • 比较: 他们还尝试使用一种更高级、更昂贵的尺子(称为UE5M3),它有更多的刻度。这也效果很好,但它需要更多的硬件算力。他们的"4 或 6"技巧使他们能够使用更便宜的标准尺子,并获得同样出色的结果。

结论

这篇论文得出结论:让 AI 模型更小、更高效(使用微小块)是一个极好的想法。 之前之所以失败,并不是这个想法本身有缺陷,而是使用的“卷尺”有缺陷。

通过使用一种更聪明的方法来选择如何测量数据(特别是"4 优于 6"方法),我们可以使 AI 模型更小、更快、更准确,而无需昂贵的新型硬件。悖论已解决:只要缩放得当,更细确实更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →