← 最新论文
💬 NLP

Is Finer Better? The Limits of Microscaling Formats in Large Language Models

本文揭示了在微缩放量化(microscaling quantization)中,减小分块大小反而可能因窄张量分布与有限尺度动态范围之间的相互作用而导致模型性能下降,并据此提出了一种用于尺度的全新 FP8 无符号 E5M3 格式,该格式在保持准确性的同时消除了对全局缩放操作的需求。

原作者: Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

发布于 2026-01-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:缩小模型规模

想象一下,大型语言模型(LLM)就像一座巨大的知识图书馆。为了让这座图书馆能装进一个小背包里(以便在手机上快速运行或节省能源),科学家们一直试图缩小书本的大小。他们通过“量化”(Quantization)数据来实现这一点,也就是将数字进行舍入处理,使用更少的比特(例如将“3.14”简写为“3”)。

最近,一种被称为**微缩放(Microscaling)**的新技术变得流行起来。与其用一把大尺子去测量整个图书馆,不如为每一小组书专门准备一把精细的小尺子。其逻辑是:“小组规模越小,我们测量其中书籍的精度就越高。”

意外发现:并非越小越好

这项研究中的研究人员发现了一个奇怪的故障。他们原以为缩小分组(或称“块/blocks”)的规模总会让模型变得更聪明,但他们发现对于某些模型,情况却恰恰相反。

类比:刻度缺失的尺子
想象你正在测量一颗非常小的鹅卵石。

  • 旧方法: 你使用一把每英寸有一个刻度的巨大尺子。你无法很好地测量这颗鹅砾石,所以只能靠猜。
  • 新方法(微缩放): 你换了一把完美契合这颗鹅卵石的小尺子。这应该会更好,对吧?
  • 问题所在: 这把小尺子有一个缺陷。它的“零点”和最小刻度之间的距离太大了。如果鹅卵石太小,尺子根本看不见它。它只会说:“那是零。”

研究发现,当数据的“块”变得过小时,用于测量它们的“尺子”(称为缩放因子/scale)就会失去精度。它无法再表示极小的数字。因此,尽管你测量的是更小的组,但由于尺子对于如此微小的物体显得过于笨拙,你实际上丢失了更多的信息。

这导致了一个作者称之为**“困惑度反转”(Perplexity Inversion)**的现象。通常情况下,随着分组规模的缩小,模型会变得更好;但由于这个故障,一旦块的大小变得过小,模型的表现就会突然变差。

为什么会发生这种情况?

研究人员深入研究了数学原理,找到了罪魁祸首:缩放因子(The Scale)

在这个系统中,每一组数字都有一个“缩放因子”数字,它告诉计算机该组数字的大小。

  1. 宽泛的分组: 如果一组数字中既有大数也有小数,缩放因子就很大。尺子工作正常。
  2. 狭窄的分组: 如果一组数字全是极小的数字(例如 0.0001),缩放因子也必须极小才能精确测量它们。
  3. 故障点: 当前的硬件使用一种特定类型的尺子(称为 FP8 E4M3),它具有有限的范围。它无法处理过小的缩放因子。当块的大小缩小到一定程度时,其中的数字变得如此之小,以至于尺子的“最小设置”仍然太大。计算机会将所有内容向下取整为零,导致模型遗忘了这些信息。

解决方案:一把更好的尺子

作者们不仅指出了问题,还构建了一个更好的工具来修复它。

他们提出了一种新的格式,称为 FP8 无符号 E5M3 (UE5M3)

  • 修复方案: 想象旧尺子有 4 个用于“大小”(指数/exponent)的刻度,以及 3 个用于“细节”(尾数/mantissa)的刻度。
  • 升级版: 他们利用了一个未使用的位(一个微小的开关),并将其变成了一个额外的“大小”刻度。现在,这把尺子拥有 5 个大小刻度和 3 个细节刻度。

为什么这有效:
这把新尺子可以测量更小的数字,而不会将其舍入为零。它延伸了尺子的“底部”,使其能够清晰地看到那些微小的鹅卵石。

实验结果

研究人员在多个 AI 模型(如 Llama 和 Granite)上测试了这种新尺子。

  • 没有修复前: 当他们减小块的大小到极小时,模型会变得混乱并犯更多错误。
  • 使用新尺子 (UE5M3): 模型即使在极小的块下也能保持准确。事实上,它的表现与一种复杂的权宜之计(即需要手动拉伸数字后再进行测量)不相上下,而且不需要那个额外且昂贵的步骤。

总结

这篇论文告诉我们,在 AI 压缩领域,并非越小越好。如果你把数据分组缩得太小,你可能会损坏用来读取它们的测量工具。通过简单地调整测量工具的设计(增加一个额外的比特范围),他们修复了这个故障,使得 AI 模型可以在不损失智能的前提下,实现更高效的压缩。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →