← 最新论文
🤖 AI

SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation

SelKV 是一个无需训练的框架,它通过基于值向量相似度选择性地合并或丢弃 token,并利用 logit 偏差补偿注意力失衡,从而在仅保留 25% 原始缓存的情况下,实现近乎无损的生成质量和显著的速度提升。

原作者: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在写新章节时,回忆起一个长达 10 万页的宏大故事。每当你想到一个情节,你都必须翻遍整本笔记本来寻找细节。随着你写的页面越来越多,你的笔记本变得越来越重,直到你的手臂累得拿不动它。这正是大型语言模型(LLM)在处理长文本时,其“大脑”内部发生的情况。这些模型非常聪明,但它们有一个记忆问题:当它们阅读时,会存储一个“键值缓存”(Key-Value cache)——这是一个记录了它们目前所见之物的数字文件系统——以帮助它们理解接下来的内容。文本越长,这个文件柜就变得越大,最终填满计算机的所有内存,并让一切运行速度变得极其缓慢。

为了解决这个问题,科学家们尝试了两种主要技巧。第一种是“驱逐”(eviction),就像扔掉你认为不重要的旧页面。第二种是“合并”(merging),就像把相似的页面粘在一起以节省空间。但这两者都有缺陷。扔掉页面可能会丢失关键线索,而将页面粘在一起通常会产生一个“模糊”的版本,导致模型忘记该对这一组粘合后的内容投入多少注意力。这就像如果你把十张猫的照片粘在一起;模型可能仍然只对这一个粘合后的团块给予原本只给一张照片的注意力,尽管它现在代表了十张照片。这会导致模型感到困惑并出错。

于是有了 SelKV,一种聪明的新方法,它扮演着这些数字文件柜的智能图书管理员的角色。它不是盲目地将页面粘在一起或扔进垃圾桶,而是使用一个“软余弦门”(soft cosine gate)——可以把它想象成一个夜店门口的保镖,在决定如何处理两张页面之前,先检查它们的相似程度。如果两张页面非常相似,它们就会被紧密地粘在一起。如果它们完全不同,保镖就会把其中一个送走,以保持记忆的整洁。但真正的魔力在于“注意力补偿”(attention compensation)。由于合并页面通常会导致模型忽略它们,SelKV 为合并后的页面增加了一个小小的“音量增益”,确保模型能给予正确的注意力。

研究人员在三种不同的 AI 模型上,通过 16 个不同的任务测试了这个系统,从回答关于多个文档的问题到编写代码。他们发现,通过仅保留 25% 的原始内存空间,SelKV 的表现几乎与拥有完整内存时一样出色,并且在一些棘手的多文档测验中,它的表现甚至比完整版本还要好。看起来,通过进行选择性处理,AI 实际上专注于了故事中最重要的部分。此外,当文本变得巨大(10 万个 token)时,这种方法使 AI 解码文本的速度提高了 3.3 倍。论文指出,这种方法特别适用于使用特定类型注意力机制(称为 GQA)的现代 AI 模型,为在不丢失记忆的情况下保持这些强大大脑高效运行提供了一种方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →