MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference
MXSens 是一种无需训练、具备敏感性感知能力的混合精度量化方法,它根据列级和层级的敏感性,为大语言模型(LLM)权重分配可变的尾数位宽(4/6/8),从而在有效缓解由离群值导致的精度下降的同时,利用硬件高效的微缩放格式(microscaling formats)来超越现有的最先进基准方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图将一座宏大且复杂的知识图书馆装进一个极小的、便携式的背包里。这就是被称为“大语言模型”(LLM)的超级聪明计算机大脑每天面临的挑战。这些模型擅长写故事、解谜题以及与我们聊天,但它们极其沉重,需要消耗大量的内存和能量才能运行。为了让它们足够轻便以便随身携带,科学家们使用了一种叫做“量化”(quantization)的技巧。这就像是将一部高清电影压缩成较小的文件体积:不再存储每一种完美的色彩细节,而是将其舍入到有限调色板中最接近的颜色上。这使得文件变得微小且播放迅速,但如果舍入过度,画面就会变得模糊,细节也会丢失。
问题在于,这些计算机大脑中存在着一些比其他人声音大得多的“大嗓门”。在数字世界中,这些被称为“离群值”(outliers)。它们是罕见的、极端的数值,会扰乱整个系统,导致压缩变得混乱并导致模型犯下愚蠢的错误。一段时间以来,研究人员尝试通过重新排列数据(就像旋转拼图一样)或使用大小混合的文件尺寸来修复这个问题。但这些方法往往很笨拙,需要计算机不断地停下来将数字进行来回转换,这降低了速度。现在,一个研究团队提出了一种更聪明的打包背包的方法,它能在不减慢旅程速度的情况下,倾听每一条信息的特定需求。
这篇论文介绍了一种名为 MXSens 的新方法,它扮演着一位非常专注的图书管理员的角色。MXSens 不会对图书馆里的每一本书都一视同仁,它首先会快速观察哪些书是最脆弱或最重要的。它发现,并非所有的“大嗓门”都是一样的。有些是罕见的、尖叫着的极端值,需要大量的空间才能被清晰理解;而另一些只是比人群稍微大声一点,可以用较少的空间应付过去。
MXSens 使用了一个巧妙的三层系统来处理这个问题。它为模型中最敏感、最极端的部分分配了一个慷慨的 8位(8-bit) 空间(像一个坚固的大箱子),为中等敏感的部分分配了一个中等的 6位(6-bit) 空间(一个中号箱子),并为平静、安静的部分分配了一个紧凑的 4位(4-bit) 空间(一个小巧高效的口袋)。这一切都是在不需要重新训练模型或改变其大脑结构的情况下完成的;它只是根据每一部分对“挤压”的敏感程度来重新排列数据的存储方式。研究人员发现,这种方法能完美地适配一种名为 MXINT 的新型硬件友好格式,该格式已被现代计算机芯片所支持。
结果非常令人印象深刻。在对 LLaMA-2-70B 和 LLaMA-3-8B 等大型模型进行测试时,MXSens 在使用极少空间的同时,成功保持了模型的“声音”清晰且准确。具体而言,在严格的 W4A4KV4 设置下(意味着权重、激活值和键值缓存全部经过量化),该方法在 WikiText-2 数据集上使 LLaMA-2-70B 的困惑度(perplexity)得分达到了 3.77,使 LLaMA-3-8B 的得分达到了 7.63。困惑度是衡量模型有多困惑的指标;数值越低越好。这些得分显著优于其他顶尖方法,证明了通过关注模型不同部分的敏感性,你可以兼得两者之长:一个既微小、快速,又能保持清晰思考的模型。
作者指出,这种方法是一个重大的进步,因为它避免了其他类似技术中那种不断进行数字转换的沉重开销。通过利用新硬件格式的自然块结构(block structure),MXSens 可以无缝地混合这些不同的精度水平(4位、6位和8位)。这项研究表明,这种基于敏感度引导的方法可以实现节省空间与保持模型智能之间更好的平衡,有望让强大的人工智能在那些没有巨大内存库的设备上也能触手可及。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。