← 最新论文
💬 NLP

DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity

本文提出了 DeltaKV 框架,通过利用长程相似性进行基于残差的 KV Cache 压缩,并配合高性能推理引擎 Sparse-vLLM,在大幅降低显存占用的同时保持了极高的模型精度,并实现了长文本场景下推理吞吐量的显著提升。

原作者: Jitai Hao, Qiang Huang, Yaowei Wang, Min Zhang, Jun Yu

发布于 2026-02-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Jitai Hao, Qiang Huang, Yaowei Wang, Min Zhang, Jun Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一个名为 DeltaKV 的技术,它的目标是解决大语言模型(LLM)在处理“超长文本”(比如一整本书或长达数万行的代码)时,由于“记性太好”导致“大脑内存(显存)爆掉”的问题。

为了让你听懂,我们把大语言模型想象成一个正在读超级长篇小说的“超级学霸”

1. 遇到的难题:学霸的“记性负担”

当这个学霸读小说时,为了理解后面的剧情,他必须把前面读过的每一个字、每一个细节都记在脑子里(这就是所谓的 KV Cache)。

  • 问题来了: 小说越长,他要记的东西就呈几何倍数增长。读到第10万字时,他脑子里的“笔记本”已经塞满了,不仅占用了巨大的空间,翻阅这些笔记的速度也越来越慢,最后甚至会因为“记不住”而导致大脑宕机(显存溢出)。
  • 目前的办法: 以前的办法要么是“选择性遗忘”(只记重点,但可能会漏掉后面变重要的细节),要么是“压缩笔记”(把笔记写得密密麻麻,但翻起来很费劲)。

2. DeltaKV 的天才想法:从“全文背诵”到“找规律记差值”

研究人员发现,这个学霸的笔记里其实有很多废话和重复。通过观察,他们发现了两个秘密:

  1. “老调重弹”现象(长程相似性): 学霸发现,小说里很多段落其实是在说类似的事情。比如第10页讲了“天气很热”,第500页可能又在描述“阳光刺眼”。这两处的描述在语义上是非常接近的。
  2. “套路化”表达(共享潜变量): 很多句子都有共同的结构和模式,这些模式占据了笔记的大部分空间,但它们并不包含“新信息”。

DeltaKV 的做法就像是:
学霸不再试图背诵每一句完整的话,而是建立了一个**“标准模板库”**(参考令牌)。

当他读到一句新话时,他先在脑子里找一个最像的“老句子”作为模板,然后不再记录整句话,只记录这句话和模板之间的“差别”(这就是论文里的 Residual/残差)。

类比:
以前记笔记:
第一句:“今天天气晴朗,阳光明媚,微风徐徐。”
第二句:“今天天气晴朗,阳光灿烂,微风习习。”
(你要记两整句,很累!)

用 DeltaKV 记笔记:
第一句:记全文。
第二句:只记“阳光灿烂”和“微风习习”这两个词跟第一句的区别。
(你只需要记几个字,笔记瞬间变薄了!)


3. 它的厉害之处:既瘦身,又不降智

DeltaKV 不仅仅是一个压缩算法,它还配了一个专门的“高速翻阅器”——Sparse-vLLM

  • 极速瘦身: 它能把笔记的大小压缩到原来的 29%。这意味着原本需要 4 张显卡才能装下的长文本,现在 1 张显卡就能搞定。
  • 精准复原: 虽然笔记变薄了,但学霸在需要的时候,可以通过“模板 + 差别”瞬间还原出原本的信息。实验证明,他在做阅读理解、写代码、做数学题时,智商几乎没有下降。
  • 翻阅飞快: 配合专门优化的硬件引擎,他在处理超长文本时的速度比以前快了 2 倍

总结一下

DeltaKV 就像是给大语言模型换了一套“聪明且精简”的笔记系统。 它不再死记硬背,而是通过“找模板、记差别”的方式,把冗余的信息剔除掉,让模型在面对超长文档时,既能保持“过目不忘”的智商,又能拥有“轻装上阵”的速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →