← 最新论文
💬 NLP

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

KARA 是一种滑动窗口 KV 缓存压缩方法,它利用双向注意力机制和灵活的 Token2Chunk 模块在解码过程中选择性地保留信息丰富的上下文,从而在没有现有方法所具有的严格限制的情况下,降低推理语言模型的内存开销并提高吞吐量。

原作者: Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位才华横溢的侦探(AI),正试图破解一个极其复杂的谜案。为了完成这项任务,你需要将你在思考过程中发现的每一个线索都写在一块巨大的白板上(即 KV Cache)。这种“思维链”(Chain of Thought)非常强大,但随着谜题变得越来越长,你的白板填满的速度也极快,导致你最终会用尽墙面空间。

当墙面被填满时,你会面临两个糟糕的选择:

  1. 停止破案,因为你无法再写下任何东西。
  2. 雇佣更多侦探(同时运行更多请求),但他们都会为了争夺同一块狭小的墙面而发生冲突,导致每个人的进度都变慢并需要排队等待。

这篇论文介绍了一个名为 Kara 的新系统来解决这个问题。以下是它的工作原理,使用了简单的类比:

旧方法的缺陷

以往尝试节省空间的方法就像是一个笨拙的清洁工在擦拭白板。

  • “阈值”陷剂: 旧的清洁工会等到白板达到 90% 满时,突然擦掉一大块内容来腾出空间。这会导致一种“走走停停”的节奏。有时,白板会填满得非常快,以至于清洁工必须立即再次擦拭,从而浪费时间并拖慢所有人的进度。
  • “僵化”错误: 旧的清洁工要么擦除单个、随机的词汇,要么擦除固定大小的区块(例如,先擦掉前 10 个词,再擦掉接下来的 10 个)。这经常会删除那些不符合整齐方框要求的关键上下文,导致侦探忘记重要的线索。

Kara 的解决方案:智能滑动窗口

Kara 扮演的是一位聪明的、高效的编辑,它只关注故事中最近的部分(即“滑动窗口”)来决定保留什么。

1. “双向对话”评分
Kara 不仅仅看侦探对某个线索有多在意,它还会观察线索之间的对话

  • 类比: 想象你正在读一本书。如果角色 A 提到一个秘密,随后角色 B 对该秘密做出了反应,那么他们就在进行“对话”。Kara 会测量这种双向注意力(two-way attention)。如果过去的某个线索被当前的思考频繁引用,它就会获得高分并被保留;如果它被忽略了,则会被擦除。这确保了最具“信息量”的线索得以留存。

2. “Token2Chunk”模块(灵活的簇)
Kara 意识到,有时候线索是以组的形式出现的,而不只是单个词汇。

  • 类比: 假设你有一份需要保留的重要词汇清单。旧的方法会将这些词视为孤立的点。Kara 则会观察两个重要的点,并心想:“嘿,这两个点之间的所有内容可能也很重要!”它创建了一个灵活的记忆簇(flexible chunk)。它不会强迫这个簇保持固定大小,而是根据故事的自然流向进行拉伸或收缩,从而完整地保留特定场景的上下文。

3. “周期性”调度(KvLLM)
为了让这一套系统在繁忙的办公室里支持多名侦探工作,作者构建了一个名为 KvLLM 的框架。

  • 类比: 与其等到白板变得危险地满时才去清理,KvLLM 有一个严格的计划。每隔 100 个步骤,它会悄悄地为选定的几名侦探清理白板的后部(即当前思考过程中最旧的部分)。这防止了“走走停停”的恐慌感,并保持了流程的顺畅,使得更多的侦探可以在不耗尽空间的情况下同时开展工作。

结果

论文声称,通过使用 Kara:

  • 准确度: 侦探破解谜题的效果与拥有完整的、未裁剪白板时几乎一样(接近 100% 的准确度),尽管他们只保留了原始笔记的 20%
  • 速度: 由于清理过程更加平滑且高效,办公室可以同时处理多出 12.75% 的侦探工作,而不会减速。

简而言之,Kara 是一种聪明且灵活的方式,它能在不切断 AI “大脑”的前提下,修剪掉记忆中的冗余部分,从而让 AI 更快地解决复杂长篇问题,并允许更多的人同时开展工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →