← 最新论文
🤖 machine learning

MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference

MomentKV 通过维护紧凑的矩统计量以确保被剔除 Token 的几何正则性,并为其注意力贡献提供闭式修正,从而解决了长上下文 KV 缓存剔除中的方向失配瓶颈,使其在各种基准测试和压缩水平下均显著优于现有方法。

原作者: Yu Li, Binxu Li, Tian Lan

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Li, Binxu Li, Tian Lan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图记住一个非常长的故事,以便继续进行创作。为了实现这一点,你的大脑保留了一个关于目前所读内容的“草稿纸”(即 KV Cache)。问题在于,随着故事变得越来越长,这张草稿纸会变得巨大,最终占满你的整个桌面,让你无法开展工作。

为了解决这个问题,现有的方法使用了一种“垃圾桶”策略:它们观察故事,挑选出最重要的句子留在桌面上,然后把剩下的扔掉。它们假设如果保留了“最好”的句子,就可以忽略那些垃圾。

论文的大发现:“方向”问题
这篇论文的作者提出了 MOMENTKV,他们意识到这种“垃圾桶”方法中隐藏着一个缺陷。

想象一下,你正试图根据几片留在桌上的叶子来推测风向。

  • 旧方法: 你保留那些吹得最猛的叶子(即最“重要”的叶子),并将其他的扔进垃圾桶。然后,你尝试仅利用桌上的叶子来推测风向。
  • 问题所在: 你扔掉的叶子可能正朝着一个完全不同的方向(与你保留的叶子垂直)。即使你扔掉了 90% 的叶子,如果剩下的 10% 指向北方,而垃圾桶里的叶子指向东方,你的推测将会大错特错。你不能仅仅通过“重新归一化”(重新计算)北方的叶子来修复缺失的东风。错误不在于你扔掉了“多少”,而在于你丢失了方向

解决方案:MOMENTKV
MOMENTKV 不仅仅是把垃圾扔掉并寄希望于结果,它会在垃圾进入回收站之前,为这些内容保留一份极小的、超紧凑的“摘要笔记”。

可以这样理解:

  1. 摘要笔记(矩统计量/Moment Statistics): 在扔掉一个句子之前,系统会快速计算关于它的几个简单数值:“平均含义是什么?”以及“这个含义通常如何随下一个词发生变化?”它并不存储整个句子,只存储这些少量的“矩”(就像是一个统计学上的指纹)。
  2. 更聪明的丢弃策略: 在决定扔掉什么时,系统会询问:“这个句子是否已经被我的摘要笔记很好地代表了?”如果是,那么扔掉它是安全的。如果不是(即它拥有摘要无法捕捉的独特方向),它就会将其保留。这使得“垃圾”在几何上是规则且可预测的。
  3. 神奇的修正: 当模型需要写下一个词时,它不仅仅看桌上的句子。它利用来自垃圾桶的那些微小的“摘要笔记”,通过数学手段重建那些缺失的句子本会贡献什么。它本质上是在说:“我知道我把这些扔掉了,但根据我的笔记,我可以推测它们曾将故事推向这个特定的方向,所以我会把那部分补回来。”

为什么有效
论文在两个著名的 AI 模型(LLaMA 和 Qwen)以及两个基准测试(LongBench 和 RULER)上对该方法进行了测试。

  • 结果: MOMENTKV 的表现始终优于所有其他方法,尤其是在“桌面空间”非常小(高强度压缩)的情况下。
  • 类比: 这就像有一位图书管理员,他不仅在书架上保留最受欢迎的书籍,还为地下室里的每本书都保留了一张微小的索引卡。当你提问时,管理员可以使用这些索引卡瞬间召回地下室书籍的精髓,从而给你一个比完全忽略地下室要好得多的答案。

简而言之
目前的 AI 方法丢弃旧的上下文,并寄希望于剩余的部分足够应对。MOMENTKV 意识到,被丢弃部分的方向与这些部分本身一样重要。通过保留一份关于“垃圾”的微小且智能的摘要,并利用它在数学上修复 AI 的记忆,它让模型能够处理更长的故事,而不会迷失方向或出错。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →