← 最新论文
💻 computer science

FlashAttention for Scalable Vector Architectures

本文介绍了 FlashAttention-V,这是一种针对可扩展向量架构优化的分块式 FlashAttention 实现,它通过利用头间并行(inter-head parallelism)和高效的内存访问,显著加速了 CPU 上的 Transformer 推理,在预填充阶段实现了高达 42 倍的加速,在解码阶段实现了 11 倍的加速,同时也强调了当前量化格式在长向量执行中的结构性瓶颈。

原作者: Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

从起草电子邮件的聊天机器人到调试软件的代码助手,现代人工智能系统都依赖于一种被称为“Transformer”的特定类型的计算机程序。这些程序通过观察句子中单词之间的相互关系来理解语言。为了实现这一点,它们使用了一种称为“注意力”(attention)的机制,这种机制就像一个聚光灯,允许系统专注于文本中最相关的部分,同时忽略其余部分。虽然这些系统通常在配备强大显卡的庞大数据中心中运行,但人们对在笔记本电脑、平板电脑甚至物联网中发现的专用微芯片等更小的日常设备上运行它们的需求正在日益增长。这些较小的设备通常使用另一种类型的处理器,这种处理器旨在通过处理被称为“向量架构”(vector architectures)的长行数据来同时处理大量计算。然而,一个主要的障碍出现了:注意力机制对内存的消耗极大,要求处理器不断地获取和存储大量数据,这降低了运行速度。

查尔姆斯理工大学(Chalmers University of Technology)和格拉斯哥大学(University of Glasgow)的研究人员通过重新设计向量处理器上注意力机制的工作方式解决了这个问题。他们创建了一种名为 FlashAttention-V 的新方法,该方法改变了计算机组织工作的方式,以适应这些处理器的独特形状。这种新方法不再试图强迫处理器一次只处理一小块数据,而是将多个独立的计算组合成一条单一的宽数据行。想象一下工厂的装配线,工人通常一次只能处理一件物品;这种新方法允许他们一次抓取一整托盘的物品并同时进行处理,从而大幅减少了往返于储物架之间的时间。通过重新排列操作顺序并更紧密地打包数据,研究人员发现他们可以使这些较小的设备运行得显著更快,尤其是在处理短文本爆发或设备逐个生成新词时。

团队在包括 TinyLlama、Llama 3.2 和 Qwen2.5 在内的多种语言模型上,利用真实硬件和详细的计算机模拟测试了他们的新方法。在一个名为 Banana Pi BPI-F3 的物理开发板上(该板使用 RISC-V 处理器),新方法证明了巨大的改进。当设备准备读取短输入时,新方法的速度是标准非优化版本的十二到十四倍。当设备逐词生成文本时,速度提高了四到五倍。研究人员还进行了广泛的模拟,以观察如果处理器采用更宽的数据线(能够同时处理更大块的信息)时,该方法表现如何。这些模拟显示,随着数据线变得更宽,速度增益持续攀升,在处理输入的最佳场景下,速度达到了基础版本的四十二倍。

然而,这项研究也揭示了一个关于这些设备能变得多快的明显限制。研究人员发现,虽然程序的注意力部分从这些更宽的数据线中获益匪浅,但系统的其他部分——特别是将数字转换为预测的层——则不然。这些层使用一种称为“量化”(quantization)的特定存储数字方式,通过压缩数据来节省空间。目前这种数据的打包方式与宽数据线之间存在结构性不匹配,迫使处理器进行额外且低效的工作来分离和重新组合这些数字。模拟显示,对于这些特定的层,通过同时处理更多数据所节省的时间完全被重新排列数据所耗费的时间抵消了。这意味着,虽然注意力机制可以变得极其快速,但整个系统的速度目前仍受到这些其他组件的制约,这表明未来的改进将取决于如何改变这些数字的存储方式,而不仅仅是处理方式。

这些发现为使人工智能在日常设备上更普及提供了一条清晰的路径。新方法 FlashAttention-V 成功地弥合了现代语言模型的设计与可扩展向量处理器能力之间的鸿沟。它证明了通过仅仅重新排列计算机处理任务的方式并更高效地打包数据,无需新硬件即可实现显著的性能提升。研究证实,对于短任务和实时文本生成,这些优化后的处理器可以非常有效。然而,它也作为一个警示,指出目前这些设备的压缩数据方式可能正在遭遇瓶颈,并且要释放未来更宽处理器在处理这些压缩数字时的全部潜力,可能取决于解决如何更智能地存储和移动这些数字的难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →