RaZeR: Pushing the Limits of NVFP4 Quantization with Redundant Zero Remapping
该论文提出了 RaZeR,一种通过重新利用 FP4 零表示和 FP8 块缩放因子中的冗余位来支持更多量化值的增强型数值格式,从而提高了 4 位大语言模型(LLM)量化的准确性,并实现了相对于原生 NVFP4 显著的困惑度降低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:打包行李箱
想象一下,你正试图将一个巨大的衣柜(大型语言模型,或 LLM)塞进一个很小的登机箱(计算机芯片有限的内存)里。为了让它装得下,你必须压缩衣服。这被称为量化(quantization)。
最近,一种名为 NVFP4 的新打包方式被引入了。它像是一种非常高效的折叠技术,既节省空间,又能让你快速抓取衣服。然而,这项研究背后的研究人员注意到,即使是这种高效的方法,在行李箱内部也存在一些没有被利用的“空口袋”。
RaZeR 是一种新技术,它能找到这些空口袋,并用有用的东西填满它们,从而在不增加行李箱体积的情况下,让它装载更多信息。
问题所在:两个“空口袋”
研究人员发现了当前 NVFP4 系统中存在的两种特定类型的空间浪费:
“双零”错误:
在当前系统中,数字“零”被写了两次:一次是“正零”,一次是“负零”。- 类比: 想象你在打包行李箱时,有两个完全相同的标签,上面都写着“此处为空”。你只需要一个标签来表示“这里什么都没有”即可。拥有两个是浪费空间的。在数学中,拥有正零和负零是多余的,因为它们的意思完全一样。
刻度尺上“未使用的符号”:
NVFP4 使用一个“缩放因子”(一把尺子)来测量一组数字。这把尺子存储的格式允许负数,但由于在这种特定语境下,这把尺子始终是正数,因此存储中的“负数部分”只是在那里闲置,毫无作用。
* *类比:* 这就像使用一个既能测量热也能测量冷的温度计,但你实际上只在测量热汤。温度计的“冷”那一侧只是无用的负担。
解决方案:RaZeR(冗余零重映射)
由 Yuzong Chen 及其同事领导的团队创建了 RaZeR 来解决这些问题。他们是这样做的:
- 第一步:回收空间。 他们从“双零”和尺子上未使用的符号位中回收了“多余”的空间。
- 第二步:创造一个“特殊值”。 他们没有浪费这些空间,而是利用它们创造了一个新的、特殊的数字,使系统现在可以表示该数字。
- 类比: 想象你的行李箱里有一个你之前不知道的隐藏隔层。RaZeR 打开了这个隔层,并在里面放入了一个“神奇工具”。这个工具可以帮助你打包那些以前难以塞进去的物品。
- 第三步:智能选择。 他们弄清楚了哪种特殊数字效果最好。他们发现,在可用数字列表中加入数字 5(和 -5)填补了系统中的一个缺口,从而能够更精确地打包“衣服”(AI 模型的数据)。
结果:更聪明的打包,同样的大小
论文声称,通过使用 RaZeR:
- 准确度提升: AI 模型犯错更少了。用技术术语来说,其“困惑度”(perplexity,衡量混乱程度的指标)显著下降。与标准的 NVFP4 方法相比,RaZeR 将误差降低了约 30-35%。
- 无需额外空间: 行李箱的大小完全没变。他们没有增加内存,只是重新排列了现有的内容,使其更加高效。
- 速度: 他们编写了专门的计算机程序(称为“内核/kernels”),甚至为未来的计算机芯片(张量核心/tensor cores)设计了一个蓝图,使其能像使用旧方法一样快地使用这种新方法。
为什么这很重要
把目前的 AI 模型想象成巨大的图书馆。为了快速阅读它们,你需要缩小书籍的体积。
- 旧方法 (NVFP4): 你缩小了书籍,但由于折叠方法不够完美,你意外地丢掉了一些页面。
- RaZeR 方法: 你使用了同样的折叠方法,但你意识到自己之前把一页纸拿倒了。你把它翻了过来,突然间,你找回了所有的页面,而且书的大小依然没变。
论文结论指出,RaZeR 让 AI 模型能够在当前的及未来的计算机芯片上运行得更快、更准确,而无需需要更大或更昂贵的硬件。它本质上是从现有的技术中实现了“更高的性价比”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。