Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
本文介绍了“四六法”(4/6),这是一种针对 NVFP4 量化的自适应块缩放技术,它通过动态调整块缩放比例以更好地处理大数值,从而在最小化计算开销的同时,将训练和推理性能提升至接近 BF16 的水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图将一座庞大的图书馆塞进一个微小的便携手提箱中。这些书籍代表大型语言模型(AI)的“大脑”,而手提箱则代表计算机的内存。为了将所有东西都塞进去,你需要把书籍缩小。
长期以来,我们一直使用一种称为BF16(一种标准的高精度格式)的方法,这就像把书籍装进坚固但沉重的箱子里。它很准确,但手提箱很快就会装满。最近,工程师们尝试切换到NVFP4,这是一种小得多的格式。可以把 NVFP4 想象成一套微小、轻便的折纸盒子。它们能让手提箱里塞进多得多的书籍,并使 AI 运行得更快,但有一个陷阱:因为这些盒子太小,一些“大”书会被挤压、揉皱,甚至丢失书页。这种“揉皱”被称为量化误差,它会导致 AI 犯错。
问题:小盒子的“粗糙边缘”
该论文指出,NVFP4 有一个奇怪的怪癖。它只能容纳特定的尺寸:0.5、1、1.5、2、3、4 和 6。
- 如果一本书正好是 4 号尺寸,它能完美 fit。
- 如果一本书是 5 号尺寸,它就 fit 不进去。你不得不强行把它塞进 4 号盒子或 6 号盒子。
- 如果你强行把 5 号书塞进 4 号盒子,你会损失大量信息(它被压碎了)。如果你强行把它塞进 6 号盒子,你会浪费大量空间(它在里面晃来晃去)。
作者发现,“压碎”现象最常发生在那些几乎和最大盒子一样大的书籍上(即“近最大值”)。在标准方法中,手提箱的尺寸被设定为能容纳绝对最大的书(6 号尺寸)。但这留下了一个巨大的空隙,导致 5 号尺寸的书被严重挤压。
解决方案:“四比六”(4/6)
作者 Jack Cook 及其团队想出了一个巧妙的技巧,称为四比六(Four Over Six)。
想象你在收拾手提箱。与其强行让每一件物品都塞进一个"6 号”盒子,不如查看每一组物品。
- 旧方法:你假设每一组都需要一个"6 号”盒子。如果一组里有一本 5 号尺寸的书,你就把它压碎。
- 4/6 方法:你检查该组。如果该特定组中最大的书只有 5 号尺寸,你就说:“好吧,这一组不需要 6 号盒子。让我们改用4 号盒子吧。”
通过为该特定组切换到更小的"4 号”盒子,那本"5 号”书(相对于盒子限制而言,现在显得相对较小了)就能更舒适地 fit 进去。它不再被挤压在边缘。
类比:
把它想象成视频游戏中的角色跳跃。
- 标准 NVFP4:游戏假设角色可以跳高达 10 英尺。如果他们试图跳 9 英尺,游戏会将其向下舍入到 8 英尺(巨大的落差)。
- 4/6 方法:游戏检查特定关卡。如果最高平台只有 6 英尺高,它会将“跳跃限制”切换到 6 英尺。现在,一个 5 英尺的跳跃会被更准确地舍入到 6 英尺(或 4 英尺)。角色不会跌落那么远。
实际运作方式
该论文描述了一种智能算法,在打包每个小块数据(称为“块”)之前会进行查看:
- 它尝试将数据块打包进"6 号”盒子,并计算信息损失了多少。
- 它尝试将相同的数据块打包进"4 号”盒子,并计算损失。
- 它选择造成更少损害(更少误差)的那个盒子。
通常,对于包含非常大数字的数据块,"4 号”盒子是赢家,因为它能让“近最大值”的数字更好地 fit 进去。
结果
该团队在一个名为Nemotron 3 Nano(300 亿参数)的巨型 AI 模型上测试了这种方法。
- 训练:当他们使用 4/6 方法训练 AI 时,与标准 NVFP4 方法相比,AI 学得更好,犯错更少。它更接近于沉重缓慢的"BF16"方法的性能,但保留了 NVFP4 的速度和尺寸优势。
- 速度:他们表明,这种“智能打包”不会拖慢计算机。它增加了不到 15% 的额外工作量,这是为了获得更高精度所付出的微小代价。
- 现有模型:他们还将此方法应用于已训练的模型(如 Llama 和 Qwen)。即使没有重新训练,使用 4/6 也让这些模型在阅读理解逻辑谜题等测试中变得更聪明、更准确。
结论
该论文声称,通过更聪明地决定为不同组数据使用哪种盒子尺寸——有时使用"4"而不是"6"——你可以阻止重要信息的“压碎”。这使得低精度 AI(NVFP4)更加准确,允许我们在当前硬件上运行更大、更快的 AI 模型,而不会让它们失去“脑力”。
他们甚至发布了代码(kernels),以便其他人可以在 NVIDIA 最新的 Blackwell GPU 上使用这种“智能打包”方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。