← 最新论文
💬 NLP

SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

SparDA 引入了一种稀疏且解耦的注意力架构,通过一个专门的“预测”投影实现高效的前瞻选择和 CPU-GPU 重叠预取,从而克服 KV 缓存瓶颈并降低选择复杂度,在保持准确性的同时显著加速长上下文大语言模型的推理。

原作者: Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过阅读一本长达 10 万页的巨著来回答一个问题。你是一个超级聪明的 AI(大型语言模型),正坐在一间高速运转的办公室里(你的 GPU),但这本书太长了,你的办公桌放不下。你必须把书的大部分内容存放在走廊另一头的储藏室里(CPU 内存)。

每当你需要阅读新的一页时,你都必须:

  1. 查找哪些页面是重要的。
  2. 跑向储藏室把它们取出来。
  3. 跑回办公桌前开始阅读。

目前的方法存在两个问题:

  • “奔跑”很慢: 走廊(PCIe 连接)比你的办公桌要慢得多。如果你每读一页都要跑回去一次,那么你花在奔跑上的时间会比读书的时间还要多。
  • “查找”很累人: 在你知道该抓取哪些页面之前,你必须扫描整个页面列表来决定哪些页面是重要的。随着书变得越来越长,这种扫描过程会变得极其漫长,甚至在你开始奔跑之前,你就已经慢下来了。

迎来 SparDA:“水晶球”图书管理员

该论文介绍了一种名为 SparDA 的新系统,旨在让这个过程变得更快。它使用了两个主要技巧,作者称之为“解耦注意力”(Decoupled Attention)。

1. 水晶球(“预测”)

在旧系统中,你必须读完当前的一页,然后 扫描整个列表,才能确定下一句话需要哪些页面。这意味着你总是落后一步。

SparDA 在你的大脑中加入了一个特殊的“水晶球”投影(称为预测,Forecast)。当你正在阅读第 100 页时,水晶球已经在向前观察,并准确地告诉你第 101 页需要哪些页面。

为什么这很重要: 因为水晶球在你完成当前任务之前就已经知道了你需要什么,所以系统可以在你阅读当前页面的同时,向储藏室派出一名跑腿人员去取下一页的内容。这被称为“重叠”(overlapping)。你不需要等待跑腿人员;跑腿人员在你工作的过程中就在后台进行着。

2. 简化的索引(“紧凑选择器”)

在旧系统中,确定要抓取哪些页面就像是有 100 个不同的图书管理员同时在大声叫喊,以决定要取哪本书。这既混乱又缓慢(复杂度为 O(T2)O(T^2))。

SparDA 意识到,寻找书籍的人(“选择器”)并不需要和阅读文本的人(“注意力”)是同一个人。因此,SparDA 用一位高效的图书管理员(一个“预测头”,Forecast head)取代了那 100 个大声叫喊的图书管理员,他只需指向正确的书架即可。

为什么这很重要: 这简化了决策过程。它移除了繁重的数学运算(如“softmax”操作),使得“查找”步骤变得极其快速,无论书有多长。

结果:速度与智慧

作者在两个 80 亿参数的 AI 模型(可以理解为非常聪明但尚未达到“超级”级别的模型)上测试了该系统。以下是结果:

  • 无精度损失: AI 并没有变“笨”。事实上,在某些长文本推理任务中,它变得稍微聪明了一些,因为它能够处理更长的上下文而不会感到困惑。
  • 更快的阅读速度(预填充阶段/Prefill): 当 AI 首先阅读一篇长文档以做好准备时,它的速度提升了高达 1.25 倍
  • 更快的回答速度(解码阶段/Decode): 当 AI 逐字生成答案时,它的速度提升了高达 1.7 倍
  • “批处理”红利: 由于该系统非常高效,你可以同时在办公室里容纳更多的“学生”(批次/batches)。在某些情况下,SparDA 允许系统每秒处理的数据量比那些未使用这种“卸载”(offloading)技巧的系统多出 5.3 倍

总结

可以将 SparDA 看作是对图书管理系统的升级。与其让图书管理员停止阅读、扫描整个目录、然后再去取下一本书,SparDA 给图书管理员提供了一张预测地图和一位超级快速的助手。这使得图书管理员可以在助手在后台取书的同时,保持全速阅读。

该论文声称,这使得长上下文 AI 推理(阅读并理解非常长的文本)变得更加快速且高效,而且不需要从头开始重新训练整个 AI 模型——只需添加这个微小的、专门的“水晶球”组件即可。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →