← 最新论文
🤖 machine learning

NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache

NSNQuant 是一种用于大语言模型(LLM)KV 缓存的无校准向量量化方法,它采用了一种独特的“归一化-平移-归一化”变换,并结合哈达玛变换(Hadamard transform)将标记分布与标准正态分布对齐,从而在不依赖校准数据集的情况下实现鲁棒的低比特压缩和高达 3 倍的吞吐量提升。

原作者: Donghyun Son, Euntae Choi, Sungjoo Yoo

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Donghyun Son, Euntae Choi, Sungjoo Yoo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图背着一个装满海量记忆的背包,走在一条漫长的路上。这就是大型语言模型(LLM)——一种能写故事、解数学题并与你聊天的超聪明计算机大脑——在处理长对话时发生的情况。每当它读到一个词,它都必须记住之前出现过的所有内容,才能理解上下文。这种“记忆”被称为 KV 缓存(KV Cache)。问题在于,随着对话变得越来越长,这个背包会变得越来越重,最终因为空间不足导致计算机运行缓慢甚至停滞。

为了解决这个问题,科学家们尝试通过压缩记忆来缩小背包,就像把衣服抽真空压缩进真空袋一样。一种流行的方法是 向量量化(Vector Quantization, VQ)。你可以把它想象成将相似的物品归为一类,并用一个来自“字典”或“码本”的单一标签来代替。与其记住每一只袜子具体的蓝色色调,你只需要记住“蓝色组 4”。然而,这里有一个陷阱:大多数现有方法需要先研究一组特定的衣服(校准数据集)来构建那个字典。如果你随后尝试打包一套完全不同的衣服(一种新型的对话),这个字典就不适用了,压缩也会失败。本文正是针对这一问题:如何在不需要预先研究这些“衣服”的情况下缩小记忆。


问题所在:只适用于一种衣橱的字典

来自首尔大学的论文作者们注意到,在当前最先进的 LLM 记忆压缩方法——耦合量化(Coupled Quantization, CQ) 中存在一个令人沮闹的缺陷。你可以把 CQ 想象成一个裁缝,根据一个人的尺寸量身定制了一套西装。如果这个人走进一个身材各异的人群中,这套西装在第一个人身上完美契合,但在其他人身上看起来却极其滑稽。

在 AI 世界中,这个“人”就是模型进行校准时使用的数据(例如名为 WikiText-2 的特定文本数据集)。当模型尝试处理不同类型的文本(如 C4 数据集,这是一个庞大的网页集合)时,“西装”就不合身了。作者发现,这种不匹配会导致模型犯一些愚蠢的错误,尤其是在标点符号方面。例如,模型可能会对逗号感到困惑,因为它从训练数据中学到的“字典”并没有为新文本中出现的逗号形式提供正确的标签。这非常严重,因为这意味着模型在走出其舒适区时会变得不可靠。

解决方案:NSNQuant —— 通用收纳盒

为了解决这个问题,团队推出了 NSNQuant,这是一种聪明的全新记忆压缩方式,它不需要预先研究任何特定数据。NSNQuant 不再试图为每一套新衣橱学习定制化的字典,而是强制让所有的衣服都适配到一个标准的、预制好的收纳盒中。

他们通过一个被称为 归一化-偏移-归一化(Normalize-Shift-Normalize, NSN) 的三步“魔术技巧”来实现这一点:

  1. 归一化(第一步): 想象你有一堆袜子,其中有些很小,有些很大。第一步是将每只袜子拉伸或收缩到同样的大小。这可以防止大袜子占用过多空间并破坏整体打包效果。
  2. 偏移(中间步骤): 现在,假设所有的袜子大小一致,但它们都向左倾斜。通过“偏移”步骤,将它们全部推回中心,使它们达到完美的平衡。
  3. 归一化(最后一步): 为了保险起见,他们最后一次检查尺寸,以确保一切依然统一。

完成这三步舞步后,作者还加入了一个最后的转折:哈达玛变换(Hadamard Transform)。你可以将其理解为以一种特定的数学方式旋转整堆袜子。神奇之处在于,经过这次旋转,原本杂乱无章、形状难以预测的袜子(数据)突然看起来像一个完美的、平滑的钟形曲线(标准正态分布)。

因为无论原始文本是什么,数据现在看起来都像这种可预测的钟形曲线,所以作者可以使用一个专门为这种曲线设计的单一预制“字典”(码本)。他们不需要先观察数据;他们只需知道数据一定会适配这个字典,因为他们已经强制让数据呈现出这种形态。

他们的发现:一把万能钥匙

团队在包括 LLaMA 和 Mistral 系列在内的多个著名 AI 模型上测试了这个想法。他们将 NSNQuant 与旧方法(如 CQ 和 KIVI)进行了对比,测试涵盖了从简单故事到复杂代码和数学问题的各种文本类型。

结果令人印象深刻:

  • 更好的泛化能力: 当在不同数据集之间切换时,旧方法(CQ)会陷入困境,而 NSNQuant 始终保持强劲的表现。这就像拥有一把能打开所有门的万能钥匙,而旧钥匙只能打开它们制造时对应的门。
  • 低比特成功率: 团队测试了将记忆压缩至仅 1 位(1-bit)2 位(2-bit) 的情况。在 1 位设置下(即记忆被压缩到极致微小时),NSNQuant 碾压了竞争对手。例如,在一项名为 GSM8K 的数学推理任务中,旧的 1 位方法得分约为 24,而 NSNQuant-1b 得分为 53.45。这比之前的表现提升了一倍多!
  • 速度与空间: 由于记忆变得如此之小,计算机可以同时处理更多的对话。作者展示了由于使用了更少的内存,该方法可以处理比标准未压缩版本高出 3 倍 的数据吞吐量。

细节说明

作者谨慎地指出,虽然这种方法是一个巨大的进步,但它并非完美的魔法。他们发现,在 AI 模型的最初几层中,有时仍会有一些不完全符合钟形曲线的“离群值(outliers)”。然而,即便存在这些微小的瑕疵,整体性能依然保持得非常高。

他们还强调,这种方法是“无需校准”的。与那些需要花费数小时研究特定数据来构建字典的旧方法不同,NSNQuant 的字典可以在单张显卡上不到 5 分钟 内构建完成,并可重复用于任何模型。这使得它在实际应用中极具实用价值。

简而言之,NSNQuant 就像一个通用的收纳系统,它能将任何杂乱的记忆堆强行转化为一种整齐、可预测的形状,从而让 AI 模型能够在不丧失思考能力的前提下,在更小的背包里携带更长期的记忆。这表明,通过在压缩之前对数据进行标准化处理,我们可以让 AI 变得更快、更便宜、更可靠,即使是在处理完全陌生且不熟悉的领域时也是如此。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →