← 最新论文
🤖 machine learning

Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding

Faster Flash Decoding (FFD) 是一个无需训练的硬件-算法协同设计框架,它通过将选择与计算融合进单个算子,并采用用于分布自适应稀疏性的 top-delta 策略,在保持模型准确性的同时,实现了高达 11.6 倍的算子级加速,并可扩展至 256K 上下文长度。

原作者: Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,被称为大语言模型的现代计算机程序在理解和生成人类语言方面已变得异常出色。这些系统通过逐个预测句子中的下一个词(即一个标记/token)来工作,从而逐步构建出连贯的响应。然而,随着这些模型能力的增强,当被要求处理非常长的文档或对话时,它们面临着一个显著的物理障碍。模型需要记忆的上下文越多,它就必须在快速内部存储器和主存储器之间不断地传输更多数据。这种数据的持续移动造成了瓶颈,就像试图用花园水管去填满一个游泳池,而排水口却开得很大一样。计算机大部分时间都在等待信息的到达,而不是在进行真正的思考,这减慢了整个过程,并限制了模型一次能够处理的文本量。

为了解决这个问题,来自复旦大学和上海人工智能实验室的研究人员开发了一种名为“快速闪存解码”(Faster Flash Decoding)的新方法。他们的方法通过改变模型决定保留哪些信息以及忽略哪些信息的方式来解决这一问题。该系统不再试图阅读大规模文档中的每一个单词来寻找相关的部分,而是使用了一个聪明的捷径。它首先为整个对话历史创建一个微小的、压缩后的“草图”。这个草图非常小,以至于计算机几乎可以瞬间扫描完成。通过查看这个草图,系统可以快速识别出对话历史中哪些部分可能是重要的,以及哪些可以被安全地忽略。只有在完成这次快速扫描后,模型才会检索所选部分的完整详细版本,以进行最终的计算。这个两步走的过程使模型能够在不丢失理解文本核心含义能力的前提下,跳过大量的无关数据。

研究人员在用于高端游戏和科学计算的强力显卡上测试了这种方法,发现它比目前的标准技术要快得多。在处理 256,000 个标记的上下文时,新系统将生成单个标记所需的时间从超过一毫秒降低到了仅为其中的一小部分。在整体速度方面,该系统生成文本的速度比以往的方法快了高达 2.37 倍,同时保持了相同的准确度水平。团队在包括复杂推理和从长文档中检索特定事实在内的广泛任务中验证了这一性能,确认了速度的提升并非以牺牲智能为代价。该系统无需重新训练模型即可运行,这意味着它可以立即插入现有的人工智能系统中以提高其效率。

这项工作的一个关键创新在于系统过滤信息的特定方式。传统方法通常依赖于固定规则,例如仅保留最重要的十个单词,或者需要整个系统在继续执行前暂停并同步的复杂计算。这种新方法使用了一种能够适应对话自然流动的动态阈值。它会寻找与当前上下文中最重要的单词相比具有显著重要性的单词,从而允许它根据注意力的集中程度来调整保留内容的多少。这种灵活性,结合在初始扫描中使用极低精度的数据,使得计算机能够绕过长期阻碍长上下文处理的内存瓶颈。其结果是,该系统能够以此前被认为不可能实现的、且不牺牲回答质量的方式,处理海量的文本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →