← 最新论文
🤖 AI

Recency/Frequency Adaptive KV Caching for Large Language Model Serving

本文提出了一种时效性/频率自适应的 KV 缓存策略,通过动态分配缓存空间来缓解传统 LRU 策略中固有的工作负载干扰,从而在多种大语言模型推理工作负载中显著提升了命中率和首字延迟(time-to-first-token)。

原作者: Yang Shen, Meghana Madhyastha, Robert Underwood, Bogdan Nicolae, Randal Burns

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Shen, Meghana Madhyastha, Robert Underwood, Bogdan Nicolae, Randal Burns

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在经营一家非常繁忙、高速运转的图书馆,一位超级聪明的机器人图书管理员(即大语言模型)在这里帮助人们编写故事、回答问题和聊天。

为了提高工作效率,这个机器人会在桌子上放一份“小抄”,记录下最近最重要的一些信息。在技术领域,这被称为 KV Cache(键值缓存)。它让机器人不必在每次编写下一个词时,都重新阅读整个对话历史或长篇文档。

然而,机器人的桌面很小。它一次只能在桌上放这么多页的小抄。当桌面写满时,机器人必须扔掉一些页面,以便为新页面腾出空间。

问题所在:“后进先出”的错误

目前,大多数机器人图书管理员使用一种简单的规则,叫做 LRU(最近最少使用)。这就像是在说:“我最久没碰过的页面,就是我要扔掉的那一个。”

如果每个人都是按顺序阅读同一本书,这套规则运行得还算可以。但在现实世界中,情况是混乱的:

  1. “热门”文档: 想象一下,有 50 个不同的人针对同一篇特定的长文章提问。机器人不断地阅读这篇文章,但因为这不是它最后一次看的东西,LRU 规则可能会为了给一个新的、一次性的问题腾出空间,而把这篇文章从桌子上扔掉。然后,当第 51 个人再问关于这篇文章的问题时,机器人必须从头开始重新阅读整篇文章。太慢了!
  2. “新鲜”对话: 在聊天中,你可能会有一个很长的历史记录。机器人需要记住你刚刚说的最后一句话,即使你之前也说过类似的话。

旧规则(LRU)过于僵化。它无法区分什么是频繁被问及的内容(“热点”),以及什么是仅仅在最近被查看的内容。

解决方案:“自适应桌面”

该论文的作者构建了一个更聪明的系统,称为 ARC(自适应替换缓存)。你可以把它想象成给机器人图书管理员换了一个带有两个特殊区域且大小可随时变化的桌面:

  1. “刚刚看过”区域(近期性): 这里存放着机器人刚才触碰过的页面。
  2. “超级热门”区域(频率性): 这里存放着机器人多次看到的页面。

它是如何学习的:
该系统有一个秘密的“幽灵架子”(Ghost Cache)。它不存放实际的页面,只记录那些曾经在桌上但被扔掉的信息。

  • 如果机器人扔掉了一个页面,随后有人立刻再次询问该页面,系统会在“幽灵架子”上看到这一点。
  • 系统会意识到:“哎呀!我扔掉了一个其实很受欢迎的东西。我本该把它留在‘超级热门’区域里的。”
  • 于是,它会自动缩小“刚刚看过”区域,并扩大“超级热门”区域,以便下次能为热门项目腾出更多空间。

这就像一个智能恒温器,它会学习:“早晨很冷,所以我把热量集中在客厅;但到了下午,大家都聚集在厨房,所以我会把热量转移到那里。”系统会根据用户的实际行为,在“近期性”和“频率性”之间不断调整其内存空间。

研究发现

研究人员使用两类工作任务对这种新的“自适应桌面”与旧的“LRU 桌面”进行了对比测试:

  1. 文档问答: 人们针对长篇文章进行提问(类似于问答秀)。
  2. 真实聊天: 模拟真实的聊天对话。

结果:

  • 更高的内存命中率: 新系统能更频繁地将正确的页面留在桌上。在文档测试中,它将“命中率”(无需重新阅读即可找到信息的能力)提高了高达 10.8%
  • 更快的回答速度: 因为机器人不需要重新阅读那么多内容,它的响应速度变快了。在文档测试中,获取第一个字的时间降低了高达 12.6%,在真实聊天测试中降低了约 2%
  • 具备自适应能力: 当工作负载发生变化时(例如,从许多人询问同一个文档转变为许多人进行不同的聊天),系统会自动调整其区域大小以适应新情况。

核心结论

这篇论文表明,通过让机器人的内存管理变得灵活——在“新颖性”和“流行度”之间取得平衡——我们可以显著提高 AI 系统的速度和效率,而无需更大的计算机。这是一种软件层面的升级,让现有的硬件能够更聪明地工作,而不是更辛苦地工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →