← 最新论文
🤖 machine learning

Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models

本文提出了一种雅可比引导噪声注入(Jacobian-Guided Noise Injection)方法,该训练策略通过注入方差源自 Softmax 算子雅可比 Frobenius 范数的噪声,以抑制对量化误差的敏感性,从而显著提升大语言模型在低比特量化设置下的鲁棒性与性能。

原作者: Deepanshu Pandey, Arnav Chavan, Nahush Lele, Sankalp Dayal, Deepak Gupta

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Deepanshu Pandey, Arnav Chavan, Nahush Lele, Sankalp Dayal, Deepak Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能已经达到了一个高度,其最强大的创造物——即被称为大型语言模型的系统——已经能够创作诗歌、解决复杂问题,并进行感觉非常接近人类的对话。然而,这些数字大脑也伴随着沉重的代价:它们需要大量的计算机内存和能量来运行。为了让这些模型能够在智能手机或笔记本电脑等日常设备上发挥作用,工程师们长期以来一直在寻求一种既能缩小体积又不会使其损坏的方法。标准的解决方案是一种被称为“量化”的过程,它会简化模型内部的数字。想象一下将一张高分辨率照片压缩成一个较小的文件;你会丢失一些细节,但图像仍然可以辨认。在人工智能领域,这意味着将模型的内部数字从一种精确、沉重的格式转换为一种更轻、更粗糙的格式。这种缩减可以将模型的体积缩小四倍,并使其运行速度提高三倍,从而有可能让一个超级计算机规模的大脑装进移动芯片中。

然而,这种压缩并非没有风险。当数字变得过于粗糙时,模型可能会开始踉跄,尤其是在其负责理解上下文和关系的“大脑”部分。这项研究背后的研究人员关注了这些模型中的一个特定瓶颈:一种被称为“自注意力”(self-attention)的机制,它帮助模型决定句子中的哪些词对彼此最为重要。在这个机制内部,一个名为“softmax”的数学步骤充当了守门员的角色,将原始分数转化为概率。团队发现,这个守门员是非常脆弱的。当输入到它的数字因压缩而产生轻微扭曲时,守门员可能会过度反应,将微小的误差放大为巨大的错误,从而毁掉模型的输出。这种敏感性在模型遇到异常或极端值时尤其危险,会导致整个系统偏离其预定行为。

为了解决这个问题,研究人员开发了一种新的训练策略,它就像是对模型进行的一次温和且有针对性的压力测试。他们并没有试图强迫模型达到完美,而是特意在数字到达脆弱的 softmax 门前引入了微小的、随机的波动。这项创新的关键在于他们如何决定这些波动的大小。他们并没有对模型的每个部分使用固定量的噪声,而是计算了每个特定位置的敏感度。如果某个部分对误差高度敏感,研究人员就会注入更大剂量的噪声,以训练它变得更加稳健;如果某个部分已经很稳定,他们则注入极少的噪声。这种方法被称为“雅可比引导的噪声注入”(Jacobian-guided noise injection),它教会模型即使在其内部数字略微失衡时也能保持稳定。这类似于水手通过在波涛汹涌的海面上练习航行来学习如何保持船只稳固,而不是只在平静的水面上练习。

该方法的实验结果令人瞩目。当研究人员在几种最先进的语言模型上测试这种方法时,经过这种特定训练的模型即使在被大幅压缩后,仍保留了大部分智能。在某些情况下,对于低比特设置下的语言模型,该方法在 WikiText 上的相对困惑度(perplexity)提升了高达 40%。对于视觉模型,特别是在使用 SigLIP 架构的 RepQViT 方法时,该方法在相同位宽下的 Top-1 准确率实现了高达 37% 的相对增益。至关重要的是,这种训练并不会让模型在原始、未压缩的形式下表现变差。模型学会了在不牺牲基准性能的前提下变得更具鲁棒性,而且该技术在模型实际运行时不需要额外的计算能力。

通过专注于模型注意力机制的具体数学行为,该团队找到了一种让这些强大工具在现实世界中使用更加实用的方法。他们的工作表明,通过了解模型的具体脆弱点,工程师可以应用精确且自适应的训练,使其能够抵御在有限硬件上运行时不可避免的不完美。这不仅仅是让模型变得更小,更是让它们变得足够可靠,以便部署在内存和能量匮乏的环境中,将先进人工智能的能力带到日常设备中,而无需依赖庞大的数据中心。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →