← 最新论文
💬 NLP

Compress and Forget: bitsandbytes Quantization Amplifies Proactive Interference in LLMs

本文表明,通过 bitsandbytes 进行的 4 位量化显著放大了大型语言模型中的主动干扰,由于 Transformer 骨干网络内同键侵入错误(same-key intrusion errors)的增加,导致语义相似且被重复覆盖的值在检索准确度上出现显著下降。

原作者: Shayan Shahrabi-Farahani (Shahid Beheshti University, Tehran, Iran), Dara Rahmati (Shahid Beheshti University, Tehran, Iran)

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Shayan Shahrabi-Farahani (Shahid Beheshti University, Tehran, Iran), Dara Rahmati (Shahid Beheshti University, Tehran, Iran)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将大型语言模型想象成一位非常专注的助手,他能够进行对话、记住细节,并随着新信息的到来更新知识。在现实世界中,这些助手经常被要求追踪不断变化的事实:例如一个会议时间从两点变为三点,再变为四点;或者用户在长对话中不断演变的偏好。为了使这些系统变得有用,它们不仅要记住最新的更新,还必须忽略那些旧的、已不再正确的版本。然而,研究人员发现,这些模型在处理此类更新时存在一个特定的弱点。当一段信息被多次覆盖时,模型检索最新版本的能力会开始衰退。它会开始将当前的答案与一个较旧的、已被丢弃的版本混淆。这种现象被称为“前摄干扰”(proactive interference),是一种已记录在案的失效模式,即过去更新的累积使得回忆当前的真相变得更加困难,这反映了人类工作记忆中存在的类似困境。

随着这些模型从研究实验室走向日常应用,开发者面临着一个实际挑战:如何在标准硬件上高效地运行它们。为了节省内存并提高处理速度,业界广泛采用了名为“训练后量化”(post-training quantization)的技术。这个过程压缩了模型的内部数值,将其精度从高保真格式降低到更小、更粗糙的版本。一种普遍的观点认为这种压缩是安全的,只会导致微不足道的整体性能损失。该假设认为,虽然数值的精确度略有下降,但模型的核心智能依然完好无损。然而,这种假设从未针对这种处理频繁变化信息的脆弱且特定任务进行过测试。

一组研究人员决定直接测试这一假设。他们选取了三种不同的流行开源语言模型,并让它们通过一项旨在衡量前摄干扰的严格记忆测试。在这项测试中,模型被呈现了一个具有不断变化的属性(如最喜欢的颜色或职业)的角色。更新的次数从仅一次到多达九十六次不等。在最后一次更新后,模型被要求仅回忆最近的一个值。研究人员在每种模型上使用三种不同的精度水平运行了相同的测试:原始的高保真版本、压缩后的八位(8-bit)版本,以及高度压缩的四位(4-bit)版本。他们保持任务完全相同,仅改变了模型内部数值的精度。

结果揭示了一个清晰且令人担忧的模式。当使用原始高保真设置时,模型的表现近乎完美;但在面对大量更新时,高度压缩的四位版本表现得非常吃力。在其中一个受测模型中,当面临高频更新时,其准确率从高保真版本的百分之八十一降至四位版本的百分之六十八。这并非微小的波动;统计分析证实,这种下降在所有三种不同的模型中都是真实且一致的。研究人员发现,压缩后的模型并非仅仅是在犯随机错误。相反,它们专门将当前答案与一个较旧的、已被覆盖的值混淆了。当模型失败时,它几乎总是选择一个在对话早期为真、但现在已不再正确的值。

至关重要的是,这项研究表明,该问题并非由普遍的噪声或简单的智能丧失引起的。这种失效对于所追踪的信息类型具有高度特异性。当研究人员使用数值类信息(如股票价格或温度,这些数字并不共享相似的含义)测试模型时,四位压缩几乎没有产生负面影响。模型处理数值更新的表现与高保真版本一样出色。这种区别至关重要,因为它证明了压缩并不仅仅是让模型在整体上变得“更笨”。相反,它专门模糊了语义相似事物之间的界限,使得模型在频繁更新时,难以将不同的概念区分开来。

研究人员还调查了这种崩溃发生在模型的哪个部分。他们发现,问题源于模型的主体部分——即负责处理和持有信息的部分,而非产生答案的最终层。这表明,压缩过程本身正在改变模型表示相似想法的方式,导致它们发生重叠并引发混乱。此外,研究还挑战了“中间梯度压缩水平(即八位压缩)是完全安全”的观点。虽然八位压缩的表现优于四位版本,但研究人员发现,在两个受测模型中,它仍然带有微小但可衡量的性能损失。这表明,即使是那些看似“更安全”的压缩水平,对于涉及频繁更新的任务而言,也并非完全没有风险。

这些发现表明,为了节省资源而对语言模型进行广泛压缩的做法,可能会为那些依赖追踪演变中的、语义密集型信息的应用带来隐藏成本。对于管理长对话的聊天机器人或追踪用户不断变化的偏好的系统而言,那些显示出极高整体准确率的标准基准测试可能掩盖了某种特定的脆弱性。这些模型在通用测试中可能表现完美,但当面对需要通过遗忘过去来记住现在的更新流时,压缩版本更容易出错。研究结论指出,虽然压缩是部署模型的一种强大工具,但它并非中性的:它选择性地侵蚀了使这些模型能够抵抗相似概念间产生混淆的机制,而这种缺陷只有通过针对性的测试才能被揭示。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →