← 最新论文
🤖 AI

SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance

SIFT 通过利用注意力不变性,仅存储高注意力标记位置的紧凑位向量而非完整的 KV 张量,从而通过消除昂贵的磁盘传输来加速 RAG 预填充过程,并在仅造成极小精度损失的情况下,实现了 1.71 倍的首字延迟(TTFT)加速。

原作者: Rya Sanovar, Srikant Bharadwaj, Hritvik Taneja, Moinuddin Qureshi

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Rya Sanovar, Srikant Bharadwaj, Hritvik Taneja, Moinuddin Qureshi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对“SIFT”论文进行的解释。

问题所在:“东西太多”导致的瓶颈

想象你是一位才华横溢的厨师(AI 模型),正试图烹饪一道菜(生成答案)。通常情况下,你只需要几种食材(用户的提问)。但在 RAG(检索增强生成) 中,在开始烹饪之前,有人把一整座巨大的参考书库堆在了你的料理台上。你必须先读完这些书,找到正确的知识点,然后才能开始烹饪。

问题在于,阅读所有这些书需要很长时间。在 AI 术语中,这被称为 首字延迟(Time to First Token, TTFT)。你加入的书籍越多,说出答案第一个词所需的时间就越长。

旧方法(“全文重读”):
每当新客户提出问题时,即使他们问的是你昨天读过的同一本书,厨师也会坚持从第一页开始重新阅读整本书。这既慢又浪费。

之前的“聪明”方法(KV 复用):
为了节省时间,一些研究人员尝试在读完一本书后对其进行“快照”,然后直接复用这个快照。

  • 缺陷: 这就像是复印了一页纸,并假设文本永远保持不变。但实际上,句子的含义会根据它之前之后的内容而改变。如果你只是复用旧的快照,厨师会被上下文搞混,导致答案出错(准确度降低)。
  • 速度陷阱: 此外,这些快照是非常大的文件。每次都将它们存储在硬盘上并拖回到厨房里,实际上比在现代快速计算机上从头重读一遍还要慢。

解决方案:SIFT(“荧光笔”系统)

作者提出了一种名为 SIFT 的新系统。SIFT 不再保存整本书,也不再重读所有内容,而是扮演一个非常聪明的荧光笔的角色。

SIFT 分为两个阶段运行:离线阶段(准备)在线阶段(烹饪)

1. 离线阶段:寻找“黄金点”

在任何客户到来之前,SIFT 会先将图书馆里的每一本书都读一遍。但它不会保存整本书。它利用两条聪明的规则(称为“不变性洞察”)来确定哪些句子才是重要的:

  • 规则 #1:“自我反思”规则(局部注意力不变性)
    • 核心思想: 书中的某些句子非常重要,无论它们旁边的书是什么,它们始终会“注视”着自己。
    • 类比: 想象书中的一句名言。无论你把这本书放在食谱旁边还是历史书旁边,这句名言本身依然显得格外突出。SIFT 会标记这些位置。
  • 规则 #2:“磁铁”规则(交叉注意力一致性)
    • 核心思想: 如果一本书中的某个句子非常吸引人,以至于吸引了该书内其他句子的注意力,那么它也很可能会吸引其他书籍中句子的注意力。
    • 类比: 如果一个段落是整个章节的“磁铁”,那么它很可能也是下一章的“磁铁”。SIFT 会标记这些“磁铁”位置,以便厨师在混合不同的书时知道要额外关注它们。

结果: SIFT 不保存书籍。它保存的是一个微小的位向量(bit vector)(即由 1 和 0 组成的列表),它会说:“高亮第 5 页,第 2 行。忽略第 6 页。” 这个列表比保存整本书要小 24,000 倍。它可以轻松放入计算机的快速内存(RAM)中,而不是缓慢的硬盘。

2. 在线阶段:快速烹饪

当客户提出问题时:

  1. 系统抓取相关的书籍和那个微小的“荧光笔列表”(SIFT 元数据)。
  2. 厨师(AI)不再阅读整本书,而只阅读被高亮显示的句子
  3. 它完全跳过了那些无聊的部分。

为什么 SIFT 能胜出

  • 速度: 因为“荧光笔列表”非常小,它可以从内存中瞬间加载。厨师不会浪费时间从硬盘中拖拽沉重的文件。论文显示,与重读所有内容相比,这使得 AI 生成第一个答案的速度提高了 1.71 倍
  • 准确度: 因为 SIFT 只跳过不重要的部分,并仔细重新计算重要的部分(高亮部分),所以答案的准确度与阅读整本书的效果一样好。论文声称,其准确度能保持在完美的“全文重读”法的 1% 误差范围内。
  • 效率: 它节省了能量,因为计算机进行的数学运算更少,移动的数据也更少。

总结类比

  • 全文重读: 每次为了回答一个常识问题,都要读一遍 500 页的小说。(慢,但准确)。
  • 旧的 KV 复用: 曾经背诵过整本小说,但当问题改变时,你试图根据旧记忆来猜测答案,往往会导致细节错误。(快,但不准确)。
  • SIFT: 你拥有一张神奇的索引卡,它能准确告诉你小说中哪 10 页包含了答案。你只需阅读那 10 页即可。(快,准确且高效)。

论文的结论是,通过利用“某些文本部分始终重要(具有不变性)”这一事实,我们可以跳过数学运算中那些无聊的部分,从而在不损失智能的前提下,让 RAG 系统变得更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →