← 最新论文
🤖 machine learning

Trust the Mass: Forced Weights in KV-Cache Eviction

本文认为,现有 KV 缓存驱逐方法的性能提升往往源于隐性的内存预算优势而非更优的选择策略,并介绍了 ContourKV,一种基于“丢弃质量”(dropped-mass)统计数据的免训练分配器,该分配器在严格执行内存约束的同时实现了最先进的性能结果。

原作者: Jack Shi, Jerry Gu

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Jack Shi, Jerry Gu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是现代人工智能背后的引擎,它们依赖庞大的内部记忆来保持对话的上下文,从而生成文本。当模型阅读长文档或进行多轮对话时,它会存储至今为止所见过的每一个词的表示。这种存储被称为键值缓存(key-value cache),它就像一个工作笔记本,允许模型在构建新句子时回想起先前的细节。然而,随着对话变得越来越长,这个笔记本可能会变得非常庞大,以至于压垮计算机的内存,导致系统变慢或崩溃。为了让这些模型平稳运行,工程师们开发了一些规则,用于从这个笔记本中删除较旧或不太重要的条目,仅保留数据的一个子集以节省空间。核心挑战始终在于:如何在不丧失理解文本能力的前提下,决定丢弃哪些信息。

斯坦福大学的一个研究小组对这个问题进行了全新的审视,挑战了“必须使用复杂的、定制化规则才能实现有效删除”这一假设。他们调查了最直接的方法——即仅仅保留模型当前认为最重要的条目并丢弃其余部分——是否已经几乎与任何复杂的精妙方法一样出色。通过在五种不同的语言大模型上测试这一想法,并分析了数十万个模型处理信息的特定实例,他们发现,这种保留最强信号的简单策略已经非常接近理论上的最佳结果。他们的测量结果显示,即使是采用最完美、在数学上最理想的方式来选择保留哪些项目,也只能微弱地提升结果,通常只能缩小压缩版本与完整、未压缩记忆之间仅有的 2% 到 5% 的差距。

研究人员发现,现有领域中许多方法的所谓优势,实际上并非源于对信息的更好选择。相反,这些方法往往保留了比它们声称的更多的实际数据。在社区使用的标准测试流程中,一些先进的技术是将它们的选择存储为针对完整、未缩减记忆块的一组指令,而不是物理上删除数据。这意味着它们实际上保留了整个笔记本,却在假装节省空间。当研究人员强制这些方法执行实际的数据删除并严格遵守内存限制时,它们的性能显著下降,在标准基准测试中跌幅有时高达 60 分。这表明,真正的差异不在于选择规则的巧妙程度,而在于系统被允许使用的物理内存量。

为了解决这一问题,该团队推出了一种名为 ContourKV 的全新免费方法。这种方法不需要任何额外的训练或复杂的计算。相反,它使用一种简单的物理规则来决定在系统的不同部分保留多少内存,从而确保内存预算得到真正的执行。在与该领域领先方法的对比测试中,ContourKV 在使用相同的严格内存限制下赢得了大多数对比。它的表现与那些同样执行了自身内存限制的最强现有方法不相上下,证实了不同方法之间的差距比此前认为的要小得多。这项研究表明,高效长上下文处理的未来不在于发明复杂的全新选择算法,而在于构建能够更灵活地管理物理内存存储的系统,允许模型的不同部分根据需要持有不同量的数据。

这项工作还强调了这些系统评估方式中的一个关键缺陷。在许多情况下,决定保留哪些信息的排名是在模型仍在读取问题或提示词(prompt)时计算的,这给了它一个不公平的优势。当研究人员重新运行测试,要求在问题完全可见之前就必须做出删除信息的决定时,表现最好的方法的性能大幅下降。这一发现强调了:衡量一个记忆节省规则优劣的真正标准,是它在不“偷窥未来”的情况下工作的能力,而许多当前的方法在内存受到严格限制时都无法满足这一条件。研究人员得出结论,最有效的路径是专注于物理内存管理,并确保方法之间的比较是公平的,即衡量实际存储的字节数,而非选择规则的理论潜力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →