High-Rate Quantized Matrix Multiplication II
本文通过展示协方差感知注水法如何优于等率分配、分析无基且近优的 WaterSIC 方案的性能,以及证明结合随机旋转的 GPTQ 能达到可比的近优结果,研究了用于仅权重大语言模型后训练量化的速率量化矩阵乘法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和日常类比对论文《High-Rate Quantized Matrix Multiplication II》(高速量化矩阵乘法 II)的解释。
全局概览:压缩 AI 的“大脑”
想象一个庞大的人工智能(AI)模型,就像一座巨大的知识库,试图解决一个问题。为此,它要执行数十亿次称为矩阵乘法(MatMul)的数学运算。你可以把这看作是 AI 的“思考”过程。
然而,这些“权重”(AI 内部的数字)占据了巨大的内存空间。为了让 AI 运行得更快,并能在更小的设备上运行,工程师们会对这些数字进行压缩,这个过程称为量化。这就像把一张高分辨率的照片压缩成更小的文件,以便加载得更快。
这篇论文是关于如何最高效地进行这种压缩的研究的第二部分。第一部分探讨了在没有先验知识的情况下如何进行压缩,而本文则聚焦于一种我们确实拥有某些先验知识的场景:我们知道 AI 正在处理的数据的统计“形状”。
核心问题:“仅权重”的谜题
在许多现代 AI 系统(如大语言模型 LLM)中,流经系统的数据(激活值)保持全精度,但“权重”(静态知识)则被压缩。
- 目标:我们要尽可能压缩权重(),同时不让 AI 的答案()出现太大的错误。
- 难点:“错误”(失真)取决于权重如何与输入数据相互作用。如果输入数据具有特定的模式(例如一个细长的椭圆形),那么以标准的、方格网的方式压缩权重就是低效的。这就像试图把一个细长的手提箱塞进一个方形的盒子里;你会浪费很多空间。
旧方法:“一刀切”(GPTQ)
目前,像GPTQ这样的流行方法对待权重矩阵的每个部分都是一样的。它们使用标准的网格(就像方格纸)来对数字进行舍入。
- 类比:想象你在用不同大小的物品打包手提箱。旧方法使用相同大小的盒子网格来装所有东西。你把一颗小石子放进一个大盒子里,把一块大石头也放进一个大盒子里。你在小石子上浪费了空间,而大石头可能也放不完美。
- 缺陷:这种方法没有考虑数据的具体形状。它假设数据是完美的圆形(各向同性)。如果数据实际上是一个椭圆形,这种方法就不是最优的。
新理论:“注水”(理想解决方案)
作者研究了加权均方误差(WMSE)的数学原理。他们使用了一个称为注水(Waterfilling)的概念。
- 类比:想象你有一片有山丘和山谷的地形(代表数据不同部分的重要性)。你想将固定量的“水”(你有限的比特/带宽)倒在这片地形上。
- 注水策略说:先把水倒进最深的山谷。这些是数据中最重要的部分,或者是最敏感的部分。你给它们更多的“分辨率”(更多的比特)。
- 浅的山丘得到的水较少(更少的比特)。
- 这确保了在你拥有的水量下,你能获得尽可能好的图像。
从数学上讲,这就是“信息论极限”——你能做到的绝对最好的程度。
实用方案:WaterSIC
注水的问题在于它很难实时计算。作者提出了一种名为WaterSIC的实用算法。
- 工作原理:它使用了一种称为连续干扰消除(SIC)的技术。想象你正试图在嘈杂的房间里听清对话。你先听清最大的声音,理解它,然后将其“抵消”掉,这样你就能更好地听到更小的声音。
- 创新点:WaterSIC 将这一思想应用到了权重上。它利用一种称为Cholesky 分解的数学工具来观察数据的形状,并调整权重每个部分的“网格大小”。
- 对于数据中“刚性”或重要的部分,它使用更细的网格(更多的比特)。
- 对于“松散”或不那么重要的部分,它使用更粗的网格(更少的比特)。
主要发现
- 近乎完美的效率:作者证明,WaterSIC 极其接近理论的“注水”极限。它与绝对最佳性能仅相差约0.25 比特。这是一个微小的差距,意味着该方法几乎是完美的。
- 旋转不变性:最酷的发现之一是 WaterSIC 是“与基无关”的。
- 类比:想象你有一张地图。如果你旋转地图,北极点就会移动。一些压缩方法如果数据被旋转(就像旋转地图),就会失效或变差。然而,WaterSIC 无论数据如何旋转,其效果都一样好。它适应的是数据的形状,而不是它所面对的方向。
- GPTQ 出奇地好(但有个转折):论文还发现,标准的 GPTQ 方法(不使用复杂的注水调整)如果先随机旋转数据,其表现会出奇地好。
- 事实证明,当前 AI 数据的组织方式实际上是“幸运”的(它接近最优形状)。但如果你搞乱它(旋转它),GPTQ 的表现就会变差,而 WaterSIC 则保持强劲。
总结
这篇论文介绍了WaterSIC,一种更智能的压缩 AI 权重的方法。
- 旧方法:对所有东西使用标准网格(GPTQ)。
- 新方法:观察数据的形状,并为每个部分调整网格大小(WaterSIC)。
- 结果:新方法近乎完美,理论上不可超越,并且即使数据被洗牌或旋转,也具有鲁棒性。它弥合了复杂的数学理论与实际、快速的 AI 压缩之间的差距。
作者总结道,虽然目前的方法已经很好,但仍有改进空间,特别是在极低比特压缩(即你只有很少的比特可用)方面,以及在计算机芯片上加快数据“塑形”速度方面。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。