← 最新论文
🤖 AI

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

本综述根据四个关键维度将三十多种用于大语言模型(LLM)推理服务的 KV 缓存管理系统划分为五种架构原型,指出所有权是设计差异的主要驱动因素,并强调了阻碍容错、隔离及先进推理技术进展的七个关键测量差距。

原作者: Jie Li, Tongyang Wang, Yong Chen

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Jie Li, Tongyang Wang, Yong Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在经营一家规模宏大、高速运转的图书馆,一位唯一的图书管理员(AI 模型)正试图一次一个词地编写故事。为了写出下一个词,管理员需要记住之前写下的所有内容。在大型语言模型(LLM)的世界里,这种“记忆”被称为 KV 缓存(KV Cache)

长期以来,这种记忆被视为一张临时的便利贴:管理员拿过它,写下几个词,然后在故事结束时将其扔掉。但现在,故事变得越来越长(上下文窗口),而且图书馆正变得拥挤不堪,数百人同时在请求编写故事(高并发)。这些便利贴已经变得太大,无法放在管理员的桌面上,而每次都将其扔掉又浪费了大量的时间。

这篇论文是一篇综述(一份大型回顾),探讨了不同的计算机系统是如何解决这一“记忆危机”的。作者认为,我们正在经历从将 KV 缓存视为简单的、局部的笔记,向将其视为需要精心管理的复杂、分布式记忆系统的转变。

以下是他们研究结果的拆解,使用了简单的类比:

1. 每个系统必须回答的四个问题

作者说,每一个试图管理这种记忆的系统都在回答四个特定的问题。他们称之为“四个维度”:

  • 局部性(Locality,记忆存在于哪里?): 记忆是直接放在管理员的桌子上(本地 GPU),还是管理员必须走到另一个房间,甚至给另一个城市的的朋友打电话去获取它?
  • 生命周期(Lifetime,它能停留多久?): 故事一结束,记忆就会消失吗?它会在与一个人的整个对话过程中一直保留吗?还是它会永久保存,以便任何人以后都可以重复使用它?
  • 所有权(Ownership,谁在负责?): 是只有管理员可以决定保留什么或丢弃什么?是有一个中央管理者(比如总管理员)来制定规则?还是图书馆里的每个人都在制定自己的规则?
  • 基质(Substrate,什么承载了记忆?): 记忆是通过建筑内部的超高速电缆移动(GPU 内存),通过建筑之间的超高速光纤线路(RDMA),还是通过公路上的慢速卡车(硬盘/SSD)进行传输?

2. 五种“原型”(五种图书馆风格)

当作者研究了 30 多个不同的系统时,他们发现根据上述四个问题对答案的不同,这些系统都属于五种主要的“风格”或原型:

  1. 本地分页式(Local-Paged,高效的桌面): 记忆留在管理员的桌面上,但他们使用一种聪明的归档系统(分页技术),通过快速地换入换出笔记而不将其丢弃。这是目前最常见的风格(例如 vLLM)。
  2. 解耦流水线式(Disaggregated-Pipeline,装配线): 图书馆将工作进行了拆分。一组管理员编写故事的开头(预填充/Prefill),另一组完成剩下的部分(解码/Decode)。他们将笔记来回传递。这防止了桌面变得过于杂乱。
  3. 共享存储式(Shared-Store,全球档案馆): 图书馆有一个巨大的共享档案室。如果两个人请求同一个故事的开头,他们不会重新编写,而是直接从档案馆中提取现有的笔记。这节省了大量时间。
  4. 内存池式(Memory-Pool,共享仓库): 图书馆不再是在房间之间移动笔记,而是建立了一个巨大的共享仓库(使用像 CXL 这样的新技术),每个人都可以直接触达。这就像拥有一个所有人共享的巨大办公桌。
  5. 混合分层式(Hybrid-Tier,超级系统): 这是“瑞士军刀”。它同时结合了装配线、共享档案馆和仓库。它很复杂,但非常强大(例如 Mooncake)。

3. 重大发现:“所有权”是关键

作者发现,一旦你解决了硬件和工作类型的问题,系统之间最大的区别在于所有权

  • 一些系统有一个中央管理者(总管理员),他决定每一份笔记的去向。
  • 其他系统则使用分布式团队,每个管理员自行决定。
  • 论文指出,这一选择决定了系统的扩展能力以及计算机崩溃时会发生什么。

4. 缺失的部分(盲点)

论文指出一个主要问题:我们缺乏衡量这些系统的好的尺子。
目前,研究人员只是简单地说,“我们的系统更快了!”,但他们并没有解释为什么。作者发现我们需要看到七个缺失的测量指标,才能真正理解这些系统:

  • 我们不知道在查找笔记位置上浪费了多少时间(元数据成本/Metadata cost)。
  • 我们不知道笔记在被丢弃之前究竟停留了多久(生命周期/Lifetime)。
  • 我们缺乏关于人们如何真实使用这些图书馆的良好公开记录(公共追踪/Public traces)。

5. 未来展望

作者提出了一个研究议程。他们说,我们应该停止仅仅靠猜测,而是开始测量这些具体的事物。如果我们这样做,我们就能弄清楚:

  • 如何处理如果一台计算机在故事中间崩溃的情况(容错性/Fault Tolerance)。
  • 如何保持秘密安全,以免一个用户意外看到另一个用户的笔记(隔离性/Isolation)。
  • 当图书馆变得巨大时,如何管理内存。

简而言之: KV 缓存已从一张小小的便利贴演变成了一个庞大的、分布式的记忆问题。这篇论文将目前所有的解决方案归纳为五个清晰的类别,指出“谁在负责”是最重要的设计选择,并呼吁使用更好的工具来精确测量这些解决方案的效果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →