Practical Online KV Cache Compaction for LLM Agents: An Empirical Study
这项实证研究表明,通过将压缩延迟至未来智能体查询可用时,并利用具有鲁棒代理源的标记驱逐机制,而非依赖即时或静态上下文假设,针对大语言模型智能体的实用在线 KV 缓存压缩可以实现显著的内存减少和吞吐量提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解决一个庞大的、多步骤的谜团。你拥有一个聪明的侦探(一个人工智能),他可以提问、检查线索并与证人交谈。但有一个限制:侦探的大脑有一个严格的记忆限制。每当他采取一步行动、写下一条笔记或听取一段证人的陈述时,这些信息就会不断堆积。如果案子持续得太久,侦探的大脑就会被旧笔记填满,导致他无法清晰思考,或者他干脆无法腾出空间记录新内容。这就是“LLM Agent”(大语言模型智能体)的世界——能够通过调用工具和互联网来完成复杂任务的智能计算机程序。而“KV cache”仅仅是那个在侦探大脑中不断增长的笔记堆的技术名称。如何将这一堆笔记控制在足够小的范围内以适应内存,同时又不丢失解开谜题所需的线索,正是这篇论文所要解决的核心挑战。
加州大学圣塔芭芭拉分校和 LinkedIn 的研究人员决定测试一个聪明的技巧,叫做“KV cache 压缩(KV cache compaction)”。你可以把它想象成侦探将一份冗长乏味的警察报告总结成一张便签纸。与其保留过去对话中的每一个单词,不如尝试将其压缩成一个更短的版本,但仍保留最核心的含义。但这里有一个转折:在正常的故事情节中,你在开始总结之前已经知道了结局。但在 AI 智能体的生命中,故事是随着它的进行而实时编写的。AI 不知道自己下一步会问什么问题,因此它必须在还不知道未来需要什么之前,先对过去进行总结。这篇论文探讨的是:当你还没读到下一章时,你该如何总结上一章的内容?
团队测试了两种主要的总结方法。第一种方法被称为令牌剔除(Token Eviction, TE),它就像一个严厉的编辑,阅读当前页面并决定:“这 80% 的词都很无聊;让我们把它们扔掉,只保留前 20%。”第二种方法是注意力匹配(Attention Matching, AM),它更像是一位华丽的艺术家,不仅挑选最好的词汇,还试图绘制一个全新的、更短的版本,使其在稍后被阅读时,给人的“感觉”与原始的长版本完全一致。
为了确定最佳的总结方式,研究人员必须决定“何时”进行总结以及“使用什么”作为引导。他们测试了三种不同的“引导”策略:
- “当下”引导: 仅使用刚刚说出的词汇,立即进行总结。
- “重复”引导: 要求 AI 假装重新阅读最后一部分,并利用该部分来决定什么才是重要的。
- “未来”引导: 稍微等待一下。让 AI 写下故事的接下来的几个步骤,然后利用这些新的问题来决定从旧的步骤中保留哪些内容。
结果令人惊讶且具有实践意义。首先,他们发现立即进行总结(使用“当下”引导)往往会让 AI 变得更笨。这就像是在还没知道谁是反派之前,就去总结悬疑小说第一章的内容;你可能会扔掉一个在稍后看来至关重要的线索。然而,如果他们等待一个回合——让 AI 先提出下一个问题——总结就会变得聪明得多。通过使用“未来”引导,AI 可以看到哪些信息实际上是被需要的,并只保留那些信息。
他们还发现,比起复杂的注意力匹配(AM),简单的**令牌剔除(TE)**通常更加可靠。即使“引导”并不完美,那种“保留最好的 20%”的简单方法也表现得更稳健。事实证明,当你还在猜测未来时,试图用过于复杂的数学逻辑(如 AM 所做的那样)并不总是会有帮助。
最令人兴奋的部分是这对速度和成本意味着什么。当他们在更大、更强大的 AI 模型上进行测试时,结果具有变革意义。通过将内存压缩到原始大小的 20%(即保留五分之一的令牌),他们不仅节省了空间,还让 AI 的运行速度提升了——在一个模型上快了 4.2 倍,在另一个模型上快了 1.7 倍。这是为什么呢?因为 AI 的“大脑”变得小得多,计算机可以在不崩溃的情况下同时运行四倍数量的侦探案件。
有趣的是,论文还注意到,当 AI 的内存被压缩时,侦探有时会变得有些“焦虑”。它倾向于询问更多的问题并采取更多步骤来解决同一个谜题,也许是试图反复核实它觉得已经丢失的事实。这表明虽然 AI 仍然能得到正确的答案,但它的行为发生了微小的变化,以补偿更紧凑的记忆。
简而言之,这篇论文表明,如果你想在不耗尽资金或计算机内存的情况下运行智能、长期的 AI 智能体,你不应该急于总结。相反,让 AI 多走几步,窥探一下它接下来要做什么,然后再对过去进行压缩。而且令人惊讶的是,你并不需要一个超级复杂的算法;一种简单、智能的重点词汇筛选方法同样有效,甚至效果更好。这种方法可以让运行这些先进 AI 智能体的成本更低、速度更快,从而造福所有人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。