LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs
本文介绍了 LATMiX,一种采用可学习可逆仿射变换来优化激活分布以进行微缩放(MX)量化的方法,从而相较于现有的旋转或哈达玛变换方法显著提高了低比特大语言模型的精度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一座庞大且细节惊人的图书馆(即大型语言模型,或 LLM),它能回答任何问题、编写代码或讲述故事。问题在于,这座图书馆如此巨大且沉重,导致存储成本高昂且读取速度缓慢。为了使其更快、更经济,工程师们尝试通过将书籍压缩成更小、更简单的格式来缩小它们。这一过程被称为量化。
然而,这里有个陷阱。在这些庞大的图书馆中,少数页面包含“异常值”——即极长且复杂的句子,它们难以很好地适应小型简化格式。当你试图将这些长句强行塞入一个小盒子时,它们会被挤压变形,从而破坏故事的完整性。
问题:“块”瓶颈
最近,一种名为微缩放(MX)的新式图书组织方式被引入。MX 并非用一本巨大的摘要来压缩整座图书馆,而是将书籍拆分成小的块,并为每个块配备一把专属的微型标尺(缩放因子)来测量其中的词汇。这非常有益,因为它能更灵活地处理文本的不同部分。
但这里有个棘手之处:以往的方法试图通过像旋转陀螺一样旋转整座图书馆来解决“异常值”问题。当他们尝试将这种旋转与新的“块”标尺结合时,引发了混乱。旋转破坏了块测量,导致图书馆内容变得杂乱无章。
为了解决这一问题,早期研究人员尝试了一种权宜之计:他们仅旋转每个小块内部的页面,而忽略图书馆的其他部分。虽然这阻止了混乱,但这就像试图通过只移动单个停车位内的车辆来缓解交通拥堵,却无视了卡在相邻车道上的车辆。它并未解决整体层面的问题。
解决方案:LATMiX(智能重组器)
本文的作者LATMiX提出了一种更聪明的方法,在压缩之前重新排列书籍。
将模型中的数据想象成房间里的一群人。有些人挤在一个巨大而密集的群体中(即异常值),而其他人则分散各处。
- 旧方法试图旋转整个房间,或者仅仅在小群体内部进行人员 shuffle。
- LATMiX则像一位总编舞师。它学习一种定制的、灵活的舞蹈动作(一种仿射变换),将密集的人群均匀地分散到整个房间。
这种编舞具有两个特殊功能:
- 可学习性:LATMiX 不使用预设的舞蹈(如简单的旋转),而是利用标准 AI 工具来学习针对其所观察数据的完美舞步。它能精确计算出如何分散能量,以确保没有任何一个位置过于拥挤。
- 尊重块结构:它了解“块”标尺(MX 格式)。它并非随机 shuffle 人员,而是以一种与块系统完美配合的方式进行 shuffle,确保微型标尺能准确测量每个人。
工作原理(魔法技巧)
论文指出,LATMiX 实际上并不会在图书馆后续被读取时降低其速度。这就像一位魔术师在魔术开始前重新排列了牌,然后将这种重排折叠进牌组本身。一旦魔术 setup 完成,魔术师(计算机)就不需要再做任何额外的洗牌工作;牌已经处于完美的顺序中。这意味着速度和内存占用保持与之前一样快,但“压缩”后的书籍质量却高得多。
结果
作者在多种模型(如 Llama 和 Qwen)上测试了该方法,发现 LATMiX 的表现始终优于其他方法。
- 更高的准确性:与使用旧压缩技术的模型相比,“压缩”后的模型犯错更少,理解问题的能力更强。
- 鲁棒性:它在不同规模的模型上表现良好,从小型模型到超大型模型均适用。
- 高效性:它在提升性能的同时,并未增加运行模型的任何额外时间或成本。
简而言之,LATMiX 是一种智能且可学习的工具,它在压缩数据之前进行恰到好处的重组,确保即使是极端的“异常值”信息也能在压缩过程中幸存而不丢失,同时与现代硬件格式完美兼容。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。