FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference
该论文提出了 FAMPWQ,一种基于费舍尔信息(Fisher information)的新型自适应混合精度权重量化方法,该方法利用强化学习分配器来优化各层之间的位宽分布,与现有基准方法相比,显著提升了大语言模型在资源受限设备上的推理性能和准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是新一代人工智能背后的引擎,它们能够撰写故事、解决问题,并以曾经看似不可能的流利程度进行对话。这些系统构建在被称为“参数”的庞大数学连接网络之上,这些参数以数字的形式存储在计算机的内存中。模型越复杂,运行所需的内存就越多。虽然这些模型在强大的数据中心表现卓越,但其巨大的规模使其难以在笔记本电脑或智能手机等日常设备上使用,因为这些设备的存储和处理能力要小得多。为了弥补这一差距,工程师们使用了一种称为“量化”的技术。这个过程简化了模型内部的数字,通过降低它们的精度来节省空间。然而,这种简化是一个微妙的权衡:如果数字被过度舍入,模型的智能就会衰退,并开始出现错误或失去理解上下文的能力。
多年来,解决这一问题的标准方法是将模型的每个部分同等对待。工程师会对整个系统应用统一水平的简化,就像用同样粗细的砂纸对整个木雕进行打磨一样。这种方法虽然简单,但忽略了一个关键事实:语言模型的并非所有部分都同样重要。网络中的某些部分对变化高度敏感,即使是极小的误差也会毁掉输出结果;而其他部分则非常稳健,可以承受显著的简化而不会出现明显的质量损失。最近的研究表明,对敏感区域和稳健区域应用相同的压缩水平,会导致一种两难的选择:要么在不需要的部分浪费内存,要么通过过度压缩重要的部分来破坏模型的智能。
现在,一组研究人员开发出了一种名为 FAMPWQ 的新方法,通过对模型的每一层进行单独处理来解决这个问题。他们不再对整个系统应用单一规则,而是通过测量每一特定层对压缩的敏感程度,来决定对其进行多少程度的简化。为此,他们使用了一个被称为“费舍尔信息”(Fisher information)的数学概念,它就像是对模型内部结构进行的一次压力测试。他们向特定层中的数字引入一个微小的模拟扰动,并观察模型的性能如何随之变化。如果性能大幅下降,该层就被视为敏感层,并保持较高的精度。如果性能保持稳定,该层则被识别为稳健层,并进行更激进的压缩。这使得系统能够保留模型中关键且脆弱的部分,同时积极缩小冗余部分,为每一个模型量身定制平衡方案。
一旦研究人员绘制出每一层的敏感度图谱,他们就会使用一种学习算法来决定具体为每一层分配多少位的精度。该算法充当战略规划师,在严格的内存限制内,寻找高精度与低精度之间的完美组合,同时保持模型的智能。其目标是找到一种配置,使总内存占用最小化,同时将准确性的损失控制在最低水平。通过使用这种自适应策略,研究人员得以突破压缩模型的可能边界。在对几种不同的大语言模型进行的测试中,他们的方法始终优于现有技术。当模型被压缩到平均每个数字仅有三个比特时,这种新方法产生的结果明显比其他方法更准确,在某些测试中显示误差减少了近 7%。
这项工作的研究结果表明,未来在小型设备上运行强大的人工智能,关键在于灵活性而非统一性。研究人员发现,通过尊重网络各部分的独特需求,即使在极低的内存占用下,也能保持高性能。在直接对比实验中,当要求模型对自身答案的质量进行评判时,这种新方法在高达 76% 的案例中胜过其他领先的方法。这表明,在如此严苛的约束下,模型依然保留了比此前认为的更深层的语言理解和逻辑能力。虽然该方法需要一个初始的分析阶段来确定最佳设置,但这一成本是一次性的支出,通过让这些复杂的模型能够在原本无法支持它们的硬件上运行,便实现了回报。这项工作证明,通过仔细测量系统组件的脆弱性,我们可以比应用“一刀切”的解决方案更有效地进行压缩。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。