← 最新论文
💬 NLP

LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation

LogQuant 提出了一种新颖的对数分布 2 比特量化技术,用于键值缓存,在保持极小内存占用的同时,显著提升了大语言模型的推理吞吐量、批处理大小和任务准确率。

原作者: Han Chen, Zicong Jiang, Zining Zhang, Bingsheng He, Pingyi Luo, Mian Lu, Yuqiang Chen

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Han Chen, Zicong Jiang, Zining Zhang, Bingsheng He, Pingyi Luo, Mian Lu, Yuqiang Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图记住一个非常长的故事,以便在结尾讲出一个笑话。为此,你的大脑(即 AI 模型)会保留一个“草稿纸”(即 KV 缓存),在上面写下它迄今为止听到的每一个词和每一句话。

问题在于,随着故事变长,这个草稿纸会变得巨大无比。它占用的空间如此之大,以至于你无法同时讲很多笑话,或者处理这个故事需要耗费漫长时间。

旧方法:丢弃或猜测
以往的方法试图通过两种方式解决这个问题:

  1. “垃圾桶”方法:它们会审视故事,猜测哪些部分不重要,然后将其完全丢弃。问题在于?它们经常丢弃了错误的东西,或者遗漏了隐藏在遥远过去的关键细节。
  2. “模糊照片”方法:它们试图保留所有内容,但以模糊、不精确的方式记录下来(量化)。但如果把一切都变得太模糊,故事就失去了意义。

新方法:LogQuant(“对数图书馆”)
这篇论文的作者 LogQuant 意识到,关于我们的头脑(以及 AI 模型)实际上如何分配注意力,有一个巧妙的发现。

洞察:“对数”模式
他们发现,当 AI 回顾故事时,它并不会同等地审视每一个词。

  • 它对最近的词(最后几句话)看得非常仔细
  • 它对一段时间前的词看得不那么仔细
  • 它对最开头的词看得极其稀疏

关键在于,这种模式并非随机;它遵循一种特定的数学曲线,称为对数。这就像一座图书馆,前排书架上的书(近期事件)排列紧密,但随着你深入图书馆内部,书架变得越来越宽,书籍之间的间距也越来越大。

LogQuant 如何工作
LogQuant 不再猜测该保留什么或丢弃什么,而是利用这种“稀疏分布”的模式来压缩记忆:

  1. “近期”区域:它将故事的最后部分以高清(全精度)保留,因为那里是情节发生的关键。
  2. “中间”区域:随着回溯更远,它开始跳过单词。它保留一个词,跳过一个,再保留一个,再跳过一个。
  3. “深层”区域:在更远的地方,它跳过的更多。它保留一个词,跳过三个,再保留一个,再跳过三个。

通过这样做,它可以将记忆压缩至仅2 位(极小的空间,就像将高清电影转换为微小的文本文件),而不会丢失重要的情节要点。因为它遵循 AI 分配注意力的自然“对数”方式,所以无需猜测哪些部分重要;数学精确地告诉它该看哪里。

结果:更多笑话,更好记忆
该论文声称,通过使用这种方法:

  • 速度:AI 处理信息的速度快 25%
  • 容量:由于内存占用大幅减少,你可以在同一台计算机上同时运行**多 60%**的对话。
  • 准确性:对于解决数学问题或编写代码等困难任务,LogQuant 比其他压缩方法的准确率高出40% 到 200%。这就像即使在记忆极小的情况下,也能保持故事清晰到足以解开谜题。

为何优于“丢弃东西”
作者还证明,“丢弃东西”(驱逐)对 AI 的注意力是有害的。如果你删除了一个词,AI 就必须重新计算剩余词之间的相互关系,这会扭曲故事。LogQuant 保留所有单词,但以更小、压缩的格式记录它们。这就像保留书的每一页,但用更小的字体印刷,而不是撕掉一半的页面。

总结
LogQuant 是一种聪明的方法,它通过认识到 AI 自然地对近期事件高度关注、对远期事件松散关注,从而缩小 AI 的内存。通过将内存压缩以匹配这种自然模式,它在无需让 AI“忘记”故事重要部分的情况下,节省了巨大的空间和提升了速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →