← 最新论文
🤖 machine learning

CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM

CONF-KV 是一种新颖的 KV 缓存淘汰策略,它根据模型每一步的预测置信度动态调整缓存预算,并采用混合精度存储,在保持长程大语言模型推理的高检索精度与任务性能的同时,显著降低内存占用。

原作者: Yubo Li, Yidi Miao

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yubo Li, Yidi Miao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试阅读一本非常长的书,但你的大脑(即计算机的内存)一次只能容纳几页。在阅读过程中,你需要记住之前发生的内容才能理解当前的句子。如果你忘记得太多,就会感到困惑;如果你试图记住“所有”内容,你的大脑就会变得过于拥挤,导致思维慢如蜗牛。

这正是 CONF-KV 为人工智能模型(大语言模型)在撰写长故事或进行长对话时所解决的确切问题。

以下是该论文如何用简单的类比来解释这一问题的:

问题:“过满的背包”

当人工智能生成文本时,它会保留一个名为 KV 缓存(KV Cache) 的信息“背包”。这个背包存储了人工智能迄今为止所说的一切内容的上下文。

  • 问题所在: 随着对话变长,背包变得越来越重。最终,它会重到让人工智能耗尽内存(背包破裂),或者变得如此缓慢,以至于思考需要耗费永恒的时间。
  • 旧方法: 大多数人工智能系统使用“滑动窗口”。想象火车上的一扇窗户。随着火车移动,窗外的景色不断变化。人工智能只记住最后 512 个单词(即窗外眼前的景色),而忘记之前的所有内容。
    • 缺陷: 如果某个问题的答案是在 1000 个单词之前提到的,滑动窗口会将其完全遗忘,导致人工智能失败。
  • 另一种旧方法: 有些系统试图根据过去被关注的频率来记住“重要”的单词。但这就像查看你昨天去过哪里的地图,却不知道你此刻的感受。

解决方案:“置信度计”

这篇论文的作者 CONF-KV 提出了一种管理背包的新方法。他们不再使用固定规则,而是赋予人工智能一个 置信度计

将人工智能想象成一名正在参加考试的学生:

  1. 当学生自信时: 他们能轻松知道答案,不需要翻看笔记。因此,系统会说:“太好了!你很有把握。让我们扔掉一些旧笔记以节省空间。”
  2. 当学生困惑时: 学生正在犹豫。他们需要查阅历史记录来理清思路。系统会说:“等等,你似乎不确定。保留所有笔记!先别扔掉任何东西。”

实际运作方式:

  • 信号: 在人工智能选择下一个单词之前,它会审视自己的确信程度。如果下一个单词显而易见(高置信度),它就会缩小内存;如果下一个单词很棘手(低置信度),它就会扩展内存。
  • 排序: 即使需要缩小内存,它也不会随机删除内容。它会保留最近的单词(因为它们通常很重要)以及人工智能过去查看次数最多的单词。它会删除那些“无聊”的旧内容,因为没人关心它们。

“混合精度”技巧

论文还提到了一种巧妙的存储技巧。

  • 想象你的笔记是写在纸上的。
  • 最近的笔记 写在 高质量、厚实的纸张(FP16)上,因此它们清晰无比。
  • 较旧的笔记 写在 薄而回收的纸张(INT8)上。它们占用的空间要小得多,但你仍然可以足够清晰地阅读它们以获取大意。
  • 这使得人工智能能够在相同的背包空间内容纳 更多 的历史记录,而不会损失太多质量。

结果展示

作者在四个不同的人工智能模型上测试了这种方法,发现:

  1. 内存节省: 它使用的内存量与简单的“滑动窗口”(遗忘所有旧内容)大致相同,但它能记住 多得多 的重要细节。
  2. 更高的准确性: 在“大海捞针”测试(在巨大文本中寻找一个隐藏的具体事实)中,CONF-KV 找到了那根针 91.4% 的时间。而旧的滑动窗口仅找到了 53.8% 的时间。
  3. 现实世界任务: 当用作网络浏览代理(尝试在线购物或填写表格)时,其成功率是完整内存版本的 95.3%,但使用的内存却少了 2.8 倍
  4. 速度: 由于背包更轻,人工智能思考得更快(延迟更低),并且可以同时处理更多用户(吞吐量更高)。

核心结论

CONF-KV 就像一位聪明的图书管理员,不会仅仅因为书“旧”就将其扔掉。相反,这位图书管理员会观察读者。如果读者感到吃力,图书管理员会让整个图书馆保持开放;如果读者进展顺利,图书管理员就会清理杂物,使房间运行更快。

这使得人工智能能够进行更长、更智能的对话,而无需耗尽内存或减速,仅仅通过倾听人工智能在每一步的“确信”程度即可实现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →