← 最新论文
💻 computer science

Leyline: KV Cache Directives for Agentic Inference

本文介绍了 Leyline,这是一种新型的服务端原语,它使智能体 LLM 能够通过声明式指令和闭式 RoPE 修正来动态编辑或移除缓存内容,从而消除了昂贵的重新预填充(re-prefilling)需求,并显著提升了延迟表现与任务成功率。

原作者: Bole Ma, Jan Eitzinger, Harald Koestler

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Bole Ma, Jan Eitzinger, Harald Koestler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一个非常聪明、语速极快的助手(一个人工智能),正在帮助一位侦探破解谜案。为了完成工作,这个助手会在脑海中保留一个巨大的“草稿本”(称为 KV Cache)。这个草稿本记录了侦探所说的每一句话、发现的每一个线索以及使用的每一个工具。

旧的方法:“仅追加”笔记本

在过去,AI 助手的工作方式就像一个从不擦除笔记的人在写笔记本。

  • 规则: 你写下一个线索,然后在它下方写下下一个线索。笔记本只会不断增长。
  • 问题: 如果侦探意识到:“等等,刚才那个线索错了,让我们把它扔掉,尝试另一种角度,” 旧系统无法直接删除那一行。它必须撕掉整页纸并从头开始重写所有内容,以保证页码正确。
  • 代价: 这既慢又浪费。这就像为了修改书中的一个词而不得不重写整本书。

新的问题:“智能型”侦探

现代 AI 智能体(Agent)更加动态。它们不仅仅是在聊天;它们还在行动。它们尝试一个工具,失败,删除失败记录,再次尝试,并总结旧笔记以节省空间。

  • 问题: 当智能体删除对话中间的一块文本时,该部分之后的“页码”(位置)会发生偏移。
  • 后果: 旧的“草稿本”会变得混乱。它会认为线索的位置放错了,因此必须丢弃所有记忆并从头开始(重新预填充/re-prefill)每一次对话。这会严重拖慢速度。

解决方案:Leyline(“神奇剪刀”)

论文介绍了 Leyline,这是一个用于 AI 服务系统的全新工具。你可以把 Leyline 想象成一对神奇的剪刀和一把位置偏移尺

它是这样工作的,使用一个简单的类比:

  1. 指令 (The Directive):
    AI 智能体告诉 Leyline:“把关于失败工具调用的段落(Span)剪掉,并用一句短小的备注‘输出已省略’(Replacement)来替换它。”
    智能体不需要知道如何进行数学计算;它只需要给出指令。

  2. 拼接 (The Splice):
    Leyile 会从记忆中物理地剪掉旧段落,并在原位粘贴上短小的备注。

    • 关键步骤: 因为文本变短了,该点之后的所有内容在物理位置上都离起始点更近了。
  3. “神奇的尺子” (δ\delta-Rotation):
    这是论文的核心秘诀。在 AI 中,一个词的“位置”是以一种秘密代码(RoPE)的形式编码的。如果你把一个词从位置 100 移动到位置 90,这个代码就需要改变。

    • 旧方法: 为剪切点之后的每一个词重新计算代码。(慢!)
    • Leyline 的方法: Leyline 使用了一个数学捷径。它意识到,如果你将所有内容移动了 10 个位置,你只需要对跟随其后的词的代码进行一次简单的“旋转”(一个快速的数学微调)。这就像是告诉一排人:“大家都向左移动 10 步,”然后只需更新他们的头饰以反映新位置,而不是让他们重新走一遍队列。

为什么这很重要(结果)

研究人员通过两种方式测试了该技术:

  1. 速度测试 (机制):
    当 AI 编辑自己的记忆时,Leyline 节省了大量时间。

    • 类比: 与其为了改一个错别字而重写一份 50 页的文件,你只需更换那一页并立即更新页码。
    • 结果: 系统在每次请求时快了高达 241 毫秒,并且复用了约 11% 的现有内存,这意味着它不必重新阅读整个对话。
  2. 更聪明的智能体测试 (策略):
    研究人员给了 AI 一个简单的规则:“如果一个工具输出已经过时且无用,就删除它。”

    • 没有 Leyline: AI 会删除文本,但系统必须重新计算一切,这会让 AI 变得极其缓慢,甚至可能导致任务失败。
    • 有了 Leyline: AI 能瞬间删除垃圾信息。因为上下文更简洁、更短,AI 能更好地专注于重要的线索。
    • 结果: AI 在处理困难的调试任务时成功率提升了 14.3%,因为它不会被旧的、无用的信息干扰,同时也避免了因删除操作而产生的沉重速度惩罚。

大局观

Leyline 改变了 AI 智能体与计算机内存(Cache)之间的关系。

  • 之前: 计算机内存是一个被动的、僵化的笔记本,AI 必须小心翼翼地对待它。
  • 现在: 内存是一个可编程的工具。AI 可以说:“剪掉这个,粘贴那个,并修正数字,”系统会立即执行,且不会丢失位置。

论文证明了,通过让 AI 明确地告诉系统如何编辑,我们可以让 AI 保持快速、聪明且专注,即使它在不断改变主意。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →