← 最新论文
🤖 AI

Widening the Gap: Exploiting LLM Quantization via Outlier Injection

本文介绍了首个量化条件攻击,该攻击利用异常值注入来诱发可预测的权重塌陷,成功在包括 AWQ、GPTQ 和 GGUF 在内的广泛先进量化技术中触发了大语言模型的恶意行为。

原作者: Xiaohua Zhan, Kazuki Egashira, Robin Staab, Mark Vero, Martin Vechev

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaohua Zhan, Kazuki Egashira, Robin Staab, Mark Vero, Martin Vechev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:为了装进兜里而缩小模型

想象你拥有一部极其庞大、细节极其丰富的百科全书(这就是大语言模型LLM)。它实在太大了,以至于无法装进你的笔记本电脑或手机里。为了让它变得便携,你会使用一种叫做**量化(Quantization)**的过程。

把量化想象成将一张高分辨率的照片压缩成一个微小的 JPEG 文件。你会丢失一点细节,但图像仍然可以辨认,而且占用的空间要小得多。在 AI 世界中,这让人们可以在普通的计算机上运行智能 AI 模型,而不是昂贵的超级计算机。

安全风险:“特洛伊木马”模型

此前,研究人员发现了一个可怕的诡计。攻击者可以创建一个在全尺寸状态下(高分辨率照片)看起来完全正常且安全,但在一旦被缩小(量化)后,它就会突然变得具有恶意。它可能会开始提供危险的建议,或者拒绝回答无害的问题。

然而,直到目前为止,这种诡计只对“懒惰型”的缩小方法有效——即那些不怎么努力去保持质量的简单、快速的数据压缩方式。那些更先进、更高质量的缩小方法(如 GPTQAWQ)被认为是安全的。这些先进的方法会仔细调整数据,以确保 AI 在缩小后仍能正常工作。

新型攻击:“重石”诡计

这篇论文介绍了一种更聪明、更强大的攻击方式,它甚至能破解那些高质量、安全的缩小方法。

类比:搬家卡车
想象你正在往一辆搬家卡车(AI 模型)里装箱子(数据权重)。

  1. 正常装载: 你装入许多又小又轻的箱子。卡车是满的,但很平衡。
  2. 攻击过程: 攻击者在每一个板条箱里都偷偷藏进了一块巨大的、沉重的巨石
  3. 缩小过程: 当用户试图“压缩”这辆卡车以使其能放入较小的车库(量化)时,系统会检查每一个箱子。它看到了那块巨大的巨石。为了让箱子能塞进更小的空间,系统必须缩小内部所有东西的比例。
  4. 结果: 因为巨石实在太大了,系统不得不极度压缩比例,导致该箱子里的其他小箱子都变得“不可见”了——它们实际上变成了(也就是消失了)。

通过在特定的位置放置这些“巨石”(称为离群值/Outliers),攻击者迫使 AI 在缩小过程中删除了大脑中重要的部分。

攻击步骤详解

  1. 播种: 攻击者获取一个正常的 AI 模型,并对其特定部分进行微调。他们训练这个部分作为一个“开关”。
  2. 注入离群值: 他们将这些巨大的“巨石”数值注入到模型的权重中。
  3. 双重人格:
    • 缩小前(全精度): 模型看起来很正常。“巨石”虽然在那里,但其他数据仍然活跃,所以 AI 的行为是安全的。
    • 缩小后(量化后): 缩小过程看到了巨石,并将剩余的数据挤压成了零。这使得 AI “切换”到了其恶意模式。它现在可能会回答有害问题或拒绝回答良性问题。
  4. 隐匿行踪: 攻击者将此模型上传到公共库(如 Hugging Face)。它看起来很安全。用户下载它,为了适配自己的电脑进行缩小,然后——砰——攻击激活了。

为什么这很危险

  • 它能攻破最好的工具: 这种攻击对目前最流行且最稳健的缩小方法(GPTQ、AWQ 等)依然有效。
  • 难以检测: 在你缩小它之前,模型看起来完全正常。
  • 旧的防御手段失效: 此前人们认为在模型中加入一点随机的“噪声”(静电/干扰)就能阻止这类攻击。这篇论文表明这种方法无效,因为“巨石”实在太大了,即使加入噪声也无法改变最终的结果。

总结

这篇论文证明了量化不仅仅是一个技术优化问题,它也是一个安全漏洞。

仅仅因为一个 AI 模型在原始形式下看起来是安全的,并不意味着它在为了日常使用而进行压缩后依然安全。攻击者已经找到了一种方法,将恶意行为隐藏在压缩过程本身之中,从而将“让 AI 变得高效”这一行为,变成了触发攻击的开关。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →