← 最新论文
💬 NLP

LazyAttention: Efficient Retrieval-Augmented Generation with Deferred Positional Encoding

LazyAttention 引入了一种新颖的注意力机制,通过将延迟位置编码核函数化,实现了零拷贝、位置无关的 KV 缓存复用,在不损害输出质量的前提下,显著提升了 RAG 等长文本应用中的推理吞吐量和首字延迟(time-to-first-token)。

原作者: Haocheng Xia, Mihir Pamnani, Hanxi Fang, Supawit Chockchowwat, Yongjoo Park

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Haocheng Xia, Mihir Pamnani, Hanxi Fang, Supawit Chockchowwat, Yongjoo Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位经营着一家繁忙餐厅的厨师(AI 模型),顾客(用户)会根据你食材库(文档)中的菜单向你点菜。

问题所在:“粘性”食谱本

在标准的厨房里,当你使用某种特定食材准备一道菜时,你会把步骤写在笔记本上(KV Cache),这样下次就不必从头开始。

然而,目前的记笔记方法有一个奇怪的规则:笔记被粘在了特定的页码上。

  • 如果你在第 1 页使用了“西红柿”,你只能在下一个顾客也在第 1 页要求“西红柿”时,才能重复使用这些笔记。
  • 如果下一个顾客在第 50 页想要“西红柿”,旧的笔记就没用了。你必须扔掉它们,为第 50 页写一份新的笔记,然后从头开始烹饪。

这是一种巨大的浪费。在真实的餐厅(如 RAG 系统)中,同样的受欢迎食材(文档)会被反复使用,但它们出现在不同的位置。厨房会被重复的笔记本堵塞,厨师花在写笔记上的时间比烹饪的时间还要长。

解决方案:LazyAttention(“魔法叠加层”)

这篇论文的作者们提出了一个更聪明的新方法来管理厨房。LazyAttention 建议,不要把页码写进笔记里,而是让笔记保持与页面无关(它们不在乎自己在哪里)。

它是这样运作的:

  1. 笔记: 你写下“西红柿”纯粹的风味,而不提及页码。你将这份单一的、通用的笔记保存在你的储藏室里。
  2. 魔法叠加层: 当顾客在第 50 页点单“西红柿”时,你不需要重写笔记。相反,你会在笔记上滑动一个透明的、神奇的叠加层。这个叠加层会立即告诉厨师:“嘿,把这些西红柿当作是在第 50 页处理。”
  3. 结果: 你可以重复使用完全相同的物理笔记来应对第 1 页、第 50 页或第 100 页。你永远不需要重写笔记或搬动储藏架。

为什么这很重要

论文声称这个简单的技巧解决了两个主要的头疼问题:

  • 速度(首字生成时间/Time-to-First-Token): 因为厨师不再需要重写笔记或寻找新食材,第一口菜的出餐速度变得更快了。论文显示,这比目前最好的方法快了 1.37 倍
  • 空间(内存): 由于你不再为每一个可能的页面都存储一份“西红柿”笔记的 20 个副本,你节省了大量的货架空间。这让厨房可以存放更多独特的食材。论文显示,与旧方法相比,这让“命中率”(找到所需内容的频率)提高了 7.5 倍

“懒惰(Lazy)”的部分

你可能会想,“滑动那个叠加层会不会额外耗时?”
作者说不会,因为他们让这个叠加层变得极其高效

  • 旧方法: 重写整份笔记,然后移动它。(慢且昂贵)。
  • LazyAttention 方法: 仅仅在烹饪过程中应用一个微小的、瞬间完成的数学微调。这就像是在搅拌锅里的那一刻撒入一撮盐,而不是预先混合出一整批新的盐。

核心结论

LazyAttention 是一种让 AI 记忆事物的新方式。它通过停止 AI 因信息出现在不同位置而多次存储相同信息,从而避免浪费内存。相反,它只存储一次信息,并仅在实际使用时“懒惰地”调整上下文。

结果:

  • 回答更快: 顾客拿到食物的速度快了 1.37 倍。
  • 容量更大: 厨房可以同时处理 1.40 倍数量的顾客。
  • 味道不变: 食物的味道完全一样(回答的质量没有下降)。

论文在标准的问答任务(如阅读故事并回答问题)上测试了这种方法,发现它运行完美,使长对话和复杂的搜索变得更加流畅且成本更低。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →