← 最新论文
🤖 machine learning

Sparse Prefix Caching for Hybrid and Recurrent LLM Serving

本文介绍了面向混合与循环大语言模型服务的稀疏前缀缓存方法,该方法通过在稀疏检查点位置策略性地存储精确的循环状态以从最深匹配处恢复计算,从而在保持输出精确且无需修改内核的前提下,超越现有的密集缓存启发式方法并优化延迟。

原作者: Mikhail Shirokikh, Sergey Nikolenko

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Mikhail Shirokikh, Sergey Nikolenko

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位厨师,正在为一系列客人准备一顿复杂的多道菜大餐。在大语言模型(LLM)的世界里,“大餐”是生成回复的过程,而“食材”则是模型已经处理过的单词(token)。

旧方法:“全有或全无”的厨房

传统上,当一位新客人(一个新请求)到来时,厨师会检查他们点的菜是否与上一位客人相似。

  • 如果点了完全相同的前菜:厨师会重用整盘菜。
  • 如果点了略有不同的菜:厨师会扔掉整盘前菜,从头开始烹饪,即使前 90% 的食材完全相同。

用技术术语来说,这被称为密集缓存(dense caching)。系统保存每一步(每个 token)的副本以供日后重用。这对标准模型效果很好,但对于一种名为**混合模型或循环模型(Hybrid or Recurrent Model)**的新型模型,这种方法就像为了读一句话而携带整个图书馆的书籍。它太沉重,占用内存过多。

新想法:“检查点”策略

这篇论文提出了一种更聪明的方法来处理这些特定模型。将模型的内存想象成一种思维状态,而不是存储每个单词的图书馆。

想象你正在阅读一部长篇小说。

  1. 旧方法:你在每一页上都贴一张便利贴,以便能瞬间跳回。(便利贴太多了!)
  2. 新方法(稀疏前缀缓存):你只在第 1 页、第 100 页、第 200 页等位置贴便利贴。

如果一位新读者想从第 150 页继续读故事:

  • 你不会扔掉整本书。
  • 你找到最后一张便利贴(第 100 页)。
  • 你快速重读第 101 页到 149 页的故事,以回到当前状态。
  • 然后,从第 150 页继续。

因为模型是“循环”的(它逐步演变其状态),所以它不需要整个历史,只需要特定时间点的状态。这篇论文将这些便利贴称为检查点(checkpoints)

问题:把便利贴贴在哪里?

现在到了棘手的部分。你的便利贴预算(内存)有限。你应该把它们放在哪里才能最节省时间?

  • “平衡”策略:均匀地放置便利贴(每 100 页一张)。这很稳妥,但可能不是最快的。
  • “智能”策略(本文所做的):观察读者的习惯。
    • 如果大多数人在第 50 页左右停止阅读,你就在那里贴一张。
    • 如果人们通常一直读到结尾,你就在结尾附近贴。
    • 如果人们经常在第 200 页停止,你就在那里贴一张。

作者创建了一个数学公式(一种“动态规划”),它就像一位超级智能的图书管理员。它分析过去的请求,预测未来的读者最可能在哪里停止。然后,它将便利贴精确地放置在最有用之处,而不是均匀分布。

结果:节省时间和内存

这篇论文在现实场景中测试了这种方法,例如:

  • QuALITY:一篇长文档,人们针对同一文本提出不同的问题。
  • 系统提示词(System Prompts):一套长指令,后跟许多不同的用户问题。

他们的发现:

  1. 更少内存,同等速度:通过根据人们实际停止的位置“智能”地放置检查点,他们可以使用比标准“均匀间隔”方法更少的便利贴(检查点),同时仍能节省相同的烹饪时间。
  2. 短预算下的巨大优势:最大的改进发生在他们只有极少量便利贴可用的时候。在这些紧张的情况下,“智能”放置比随意猜测或均匀间隔要好得多。
  3. 精确结果:与某些猜测答案的捷径不同,这种方法保证输出与从头开始工作100% 完全相同。它只是通过跳过已知部分来加快速度。

总结

这篇论文提出了一种方法,使使用“循环”内存的 AI 模型更加高效。它不是保存每一步,也不是什么都不保存,而是保存模型大脑的几个战略性“快照”。通过利用数学,根据人们实际使用 AI 的方式,精确计算出应该在哪里保存这些快照,系统可以运行得更快并使用更少的内存,特别是在许多用户针对同一份长文档提出相似问题时。

这就像拥有一个 GPS,它不仅显示整张地图,还知道你最可能走哪些转弯,因此它只保存这些特定转弯的路线。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →