← 最新论文
💬 NLP

CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection

CompactAttention 通过引入一种块并集键值选择机制,将二维块稀疏掩码转换为高效的、支持分组查询感知的每组键值块表,从而在保持接近稠密精度的同时实现无需显式压缩的原地内存访问,并将长上下文大语言模型中的分块预填充速度提升高达 2.72 倍。

原作者: Jiwon Song, Dongwon Jo, Beomseok Kang, Jae-Joon Kim

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiwon Song, Dongwon Jo, Beomseok Kang, Jae-Joon Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位图书管理员(即人工智能),试图基于一座庞大的图书馆(即上下文)来回答问题。在过去,如果你拥有一座巨大的图书馆,你就必须阅读每一本书才能找到正确的答案,这耗时极长。为了加快这一过程,研究人员发明了一种“分块预填充”系统:你不再一次性阅读整座图书馆,而是将其分成小批次(块)来阅读,并在阅读过程中将笔记添加到一个记事本(即 KV 缓存)中。

然而,一个新的问题出现了:当你收到新的一批问题时,如何快速在记事本中找到正确的页面,而无需每次都重新阅读所有内容?

本文介绍了CompactAttention,一种解决该问题的新方法。以下是其工作原理,使用简单的类比进行说明:

旧方法的问题

本文指出了人们曾尝试解决该问题的两种主要方式,以及它们失败的原因:

  1. “稀疏内核”方法(低效的扫描仪):

    • 核心思路: 想象你拥有一张图书馆地图,上面用红点标记了仅重要的书籍。你试图跳过空白区域,只查看红点。
    • 失败原因: 当你阅读一座巨大的图书馆(长上下文)但只提出一个微小的问题(小块)时,这种方法会变慢。这就像拥有一台擅长扫描整面文字墙的扫描仪,但当你只有一句话时,扫描仪的设置和校准时间过长。跳过空白区域的“开销”实际上使其比直接阅读所有内容还要慢。
  2. “查询子采样”方法(懒惰的图书管理员):

    • 核心思路: 与其检查每一个问题,不如从你的批次中随机挑选几个问题,找出对这些问题重要的书籍,并假设这些书籍对所有人也同样重要。
    • 失败原因: 这很冒险。如果你选错了那几个问题,可能会漏掉某本至关重要的书,而这本书只有某一个特定问题才需要。此外,一旦你选定了这些书,你就必须将它们从书架上物理搬运到一张特殊桌子上才能阅读。这种“搬运”(复制数据)需要耗费大量时间和能量。

解决方案:CompactAttention

CompactAttention 通过将寻找书籍与阅读书籍分离开来,改变了游戏规则。

步骤 1:“并集”策略(分组搜索)

CompactAttention 不使用复杂的“跳表”(稀疏内核)或基于少数问题进行猜测,而是采用了一种聪明的分组技巧:

  • 想象你有一个侦探团队(查询头)正在处理一个案件。每位侦探都有他们自己认为重要的“嫌疑人”(KV 块)列表。
  • CompactAttention 没有让每位侦探单独工作,而是说:“让我们把整个团队的所有嫌疑人合并成一份主列表。”
  • 这分两步完成:
    1. Q-Block 并集: 合并当前批次中所有问题的列表。
    2. 组内并集: 合并协同工作的侦探们的列表。
  • 结果: 你得到了一份单一的、最小化的“嫌疑人主列表”,涵盖了所有人的需求。没有任何重要的书会被遗漏,因为只要任何一位侦探需要它,它就会在列表中。

步骤 2:“零拷贝”执行(原地读取)

这是神奇的部分。

  • 旧方式: 一旦你有了主列表,你就必须将所有这些书从书架物理移动到一张特殊桌子上,以便快速阅读。这种“移动”需要时间。
  • CompactAttention 方式: 你根本不需要移动这些书。你只需交给图书管理员一张地图(元数据),上面写着:“去 A 架第 3 排第 5 本书;然后去 B 架第 1 排第 2 本书。”
  • 图书管理员(计算机内核)直接前往书架上的这些位置并读取它们。这被称为**“零拷贝分页注意力”**。它节省了所有在移动数据上花费的时间和能量。

为何意义重大

本文在具有 128,000 个词(非常长的文档)上下文的巨大 AI 模型(LLaMA-3.1-8B)上测试了这种方法。

  • 准确性: 它与阅读整座图书馆(稠密注意力)一样聪明。它没有遗漏任何关键细节。
  • 速度: 它比标准方法快高达2.72 倍

核心启示

将 CompactAttention 想象成一位聪明的图书管理员,他不再试图重新整理图书馆,而是直接使用一张完美的、合并后的索引卡。

通过认识到“搜索”(寻找重要块)和“执行”(读取它们)应当分离,并利用“分组”技巧确保不遗漏任何内容,他们成功地在没有损失任何智能的情况下,显著加快了长文档 AI 处理的速度。他们证明了瓶颈不仅仅在于选择哪些书,更在于你如何去选取它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →