← 最新论文
🤖 AI

Learning Agent Execution for KV-Cache Management in Agentic Serving

本文介绍了 CacheScout,一种感知智能体(agent-aware)的 KV 缓存运行时,它通过在线学习智能体执行状态转移来主动管理缓存驱逐与预取,在无需预定义工作流图的情况下,显著提高了多智能体大语言模型(LLM)服务的命中率并降低了延迟。

原作者: Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的世界里,一种构建智能助手的新方法已经占据了主导地位。开发者不再要求一个全知全能的单一计算机大脑去一次性解决复杂问题,而是将任务分解为一组专门的数字工作者。想象一下一位旅行规划师,他首先要求一个代理程序寻找航班,然后将工作交给另一个代理程序来预订酒店,最后将其传递给第三个代理程序来寻找餐厅。其中的每一个代理程序都是一个大语言模型,这是一种基于其学习到的模式来预测句子中下一个词的软件。为了实现这一点,该软件必须在其被称为“键值缓存”(key-value cache)的短期记忆中保存大量信息。这种记忆就像是一个工作空间,模型在此保留游戏规则、可用工具的定义以及行为示例。每当一个新的代理程序加入对话时,它都会带来自己的一套指令和示例,从而产生一大块数据,系统在开始回答用户的特定问题之前,必须先处理这些数据。

挑战在于这些数字团队是动态变化的。第一个代理程序可能会完成它的工作,然后系统可能会立即切换到完全不同的代理程序,或者稍后又跳回到第一个代理程序。目前运行这些 AI 团队的计算机系统是以响应式的方式管理其内存的。它们保留最近使用过的信息,并丢弃旧的信息以腾出空间处理新请求。这对于简单的对话运作良好,但在多代理团队中,这会造成令人沮挫的低效。系统经常仅仅因为某个代理程序在过去几秒钟内没有发言,就丢弃该代理程序的固定指令和示例,尽管该代理程序很可能在紧接着的下一步就会再次被调用。当代理程序返回时,系统必须从头开始重新读取并重新处理所有这些指令,从而浪费了时间和计算能力。这种丢弃与重新学习的循环减慢了整个操作,使 AI 显得反应迟钝且运行成本高昂。

加州大学圣克拉拉分校及其他机构的研究人员开发了一种解决此问题的新方法,称之为 CacheScout。该系统不再仅仅观察过去发生了什么,而是学会了预判接下来会发生什么。它不将对话流视为一系列随机事件,而是将其视为不同工作者之间的转换模式。通过观察旅行代理程序之后通常会跟随酒店代理程序,或者编码代理程序如何切换到评审代理程序,该系统在运行过程中会构建出一张工作流的心理地图。它不需要开发者提供预先写好的剧本或地图;它在处理每一次请求的过程中实时学习这些连接。

这个新系统的核心是一个位于 AI 代理与计算机硬件之间的轻量级层。当一个代理程序完成任务时,这一层会查看对话历史,并预测下一个最有可能发言的代理程序。如果系统对下一步具有信心,它会采取两个具体的行动来提高速度。首先,当系统需要清理旧数据以腾出空间时,即使某个代理程序已经有一段时间没有发言,它也会拒绝删除该代理程序的指令。它根据这些信息的未来重要性而非过去的使用频率来保护这些宝贵的内存块。其次,在等待下一个请求时,它会在后台静默且无形地为预测的代理程序准备内存。它会在用户提出需求之前,将必要的指令加载到快速内存中,以便当代理程序开始工作时,可以立即开始工作而不会出现延迟。

研究人员在现实世界的任务中测试了该系统,包括规划旅行、解决数学问题和编写软件代码。他们发现,通过记住代理程序的行为模式,该系统能够比以前更频繁地在内存中保留正确的信息。在测试中,系统成功复用现有内存的速率提高了十到十八个百分点。这种改进直接转化为了速度。生成答案第一个词所需的时间减少了多达 45%,完成单次对话轮次的总时间下降了近 40%。该系统还能同时处理更多的请求,将每秒能完成的任务总数提升了高达 57%。

至关重要的是,研究人员展示了这种方法即使在工作流不是固定的情况下也同样有效。在许多现代应用中,下一步是由 AI 实时决定的,这意味着路径可能会发生变化。新系统能够适应这种流动性,在发生过程中学习最常见的路径并据此调整其预测。它在处理更大、更复杂的 AI 模型时也表现出色,即使在内存需求显著提高的情况下也能保持速度优势。该系统实现这一切并不需要减慢计算机速度,也不需要复杂的硬件;它只是为内存管理过程增加了一点智能化,将一个被动的存储系统变成了一个了解未来的主动参与者。

研究结果表明,高效 AI 服务未来的关键在于理解工作的上下文,而不仅仅是数据本身。通过识别出旅行代理程序很可能被酒店代理程序所跟随,系统不再将每一刻都视为全新的开始,而是开始将对话视为一段连续的旅程。这种从“响应过去”到“准备未来”的转变,使得这些数字团队的工作速度更快、效率更高,消除了阻碍复杂 AI 应用部署的瓶颈。其结果是,系统感觉响应更加迅速且功能更强,能够处理定义下一代人工智能服务的复杂、多步骤任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →