← 最新论文
💻 computer science

Tamarin (HSQ): Reversible Hierarchical KV-Cache Compression for LLM Inference

Tamarin (HSQ) 引入了一种可逆的三层分级 KV 缓存压缩方案,通过将 Token 路由至焦点层、学习到的摘要向量以及基于 CPU 的存档层,在保持接近基准水平的困惑度(perplexity)和检索准确度的同时,实现了长上下文大语言模型推理中 12–28 倍的 GPU 显存缩减。

原作者: Alikhan Bazakov, Kirill Kiselev

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Alikhan Bazakov, Kirill Kiselev

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一台微型平板电脑上阅读一本长达 32,000 页的巨著。问题不在于书中的文字,而在于你的平板电脑内存极小,只要你读完几页,内存就会瞬间被占满。在 AI 世界中,这种“记忆”被称为 KV 缓存(KV cache)。对于大型模型而言,它会耗尽计算机的所有性能,迫使你为了腾出空间给新页面而丢弃旧页面。

目前大多数解决方案就像一位图书管理员,当书架满了时,他会决定扔掉那些他认为你可能不需要的书。他们可能会保留前几页和最后几页,但如果你突然问到一个关于书中细节的问题,那一页就永远消失了。论文称之为“驱逐(eviction)”,并指出这是一个致命缺陷,因为你无法预测用户下一步会问什么。

核心理念:神奇的索引,而非垃圾桶

来自 Siamang Labs 的作者们提出了一种不同的方法,称为 Tamarin(技术名称为 HSQ)。他们不扔掉页面,而是将记忆视为一个巨大的、可搜索的索引

以下是他们的三层系统是如何工作的,我们使用图书馆类比:

  1. “VIP”书架 (L1): 在你的平板电脑(GPU)上有一个小型、高速的部分,存放着最重要的页面和最新的页面。这些页面以完整的细节保存,只是稍微压缩了一下(4-bit 精度)。
  2. “线索卡” (L2): 对于书中的其余部分,系统会为每 8 到 16 页创建一个微小的 3-bit “线索卡”。这些卡片并不包含故事内容,它们只包含关于这些页面内容概要的信息。它们也存在于你的平板电脑中。
  3. “深度档案库” (L3): 每一页的完整原始文本都存储在街对面的一个巨大仓库(CPU RAM)中,同样被压缩到了 4-bit 精度。

实时运作机制

当 AI 正在阅读并突然需要回答一个问题时,它不会靠猜测。它首先查看线索卡 (L2)。一个聪明且微小的“阅读器” AI 会为这些卡片评分,以查看哪些页面组与当前问题相关。

如果一张卡片看起来很有潜力,系统会立即奔向深度档案库 (L3),抓取原始页面,并在 AI 做出决策之前将其带回平板电脑。

论文证明了这种“索引”方法是关键。在一次测试中,通过禁用“从档案库获取”这一步骤,系统寻找隐藏信息(称为“大海捞针”检索)的能力降至 0%。这证实了线索卡仅用于路由;真正的实质内容存在于档案库中。

结果:几乎没有代价的大幅节省

论文在多个模型(具体为 Qwen3 系列,参数量从 6 亿到 140 亿不等)上测量了这一效果。结果如下:

  • 内存节省: 在上下文长度为 32,000 个 token 时,Tamarin 将 GPU 内存占用率降低了 12 到 28 倍。例如,一个在 32K token 时通常需要 4.5 GiB 内存的模型,现在在 GPU 上仅需约 172 MiB。其余部分则存在于 CPU RAM 中。
  • 质量: 对于较大的模型(4B 和 8B 参数),其质量与未压缩版本几乎完全一致。其“困惑度”(衡量 AI 变得多么困惑的指标)仅上升了 0.1% 到 0.4%。AI 在选择单词时与原始版本的一致性达到 96% 到 97%
  • 检索: 在通过 500 次尝试寻找不同深度文本中隐藏代码的测试中,8B 模型成功找到了 500 次中的 500 次,在统计学上与未压缩的基准模型持平。

论文排除了什么以及在哪里失败了

作者非常明确地说明了这不是什么,以及它在何处表现不佳:

  • 它不是速度提升: 论文明确指出,Tamarin 并不会让 AI 变快。事实上,由于它必须从 CPU 档案库中获取数据,在 32K token 时,速度会降至正常速度的 17–18%。这是一种用速度换取容量(容纳更多文本)的权衡。
  • 它在极小模型上并不完美: 对于测试的最小模型(0.6B 参数),质量成本更高。论文指出,在使用 4-bit 权重时,困惑度增加了 6–10%,这对于该特定规模的模型来说被视为一种失败。
  • 它并非适用于所有 AI 家族的万能药: 该方法在 Qwen3 模型上表现出色,但当他们在另一个家族(Mistral-7B)上进行测试时,结果很混乱,在某些深度下准确率下降了 20 个百分点。作者怀疑这是因为 Mistral 缺乏 Qwen 所具备的特定“归一化(normalization)”步骤,导致“线索卡”难以读取。
  • 一个特定的“脆弱”检查点: 即使在 14B 模型上,也有两个特定的文本位置,系统在寻找隐藏的“针”时遇到了困难,准确率降至 80.4%。论文将其归因于该模型本身训练中的特定缺陷,而非该方法本身的问题。

总结

论文表明,对于大型模型(4B 及以上),Tamarin 是一个经过验证的方法,可以将海量文本放入有限的内存中,而不会永久删除信息。它将“空间不足”的问题转化为了“管理索引”的问题。虽然它会减慢速度并且需要针对不同的 AI 进行仔细调优,但它成功解决了长上下文任务中保持每一项信息都至关重要的内存瓶颈问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →