Hardware-Aware FP4 FlashAttention-4
本文介绍了硬件感知的 FP4 FlashAttention-4,这是一种通过对非因果推理采用 Direct-P 以及对因果路径采用 FP8 梯度,从而克服 Blackwell FP4 张量核心局限性的方法,在避免了 MXFP4 训练中观察到的发散问题的同时,实现了高达 2.13 倍的前向吞吐量提升和 1.14 倍的单 GPU 训练更新速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,最强大的模型依赖于一种被称为“注意力”(attention)的机制来理解上下文。想象一位读者正在阅读一篇长文档;“注意力”让模型能够专注于句子中最相关的词汇,同时忽略其余部分,从而将跨越遥远距离的思想连接起来。为了实现这一点,计算机需要进行一系列大规模的计算,将每一个词与其他每一个词进行比较,以确定它们之间的关系。多年来,这些计算一直使用高精度数字进行,类似于使用带有微小、精确刻度的尺子来测量一栋建筑。这确保了模型能够正确学习,但速度缓慢且消耗巨大的能量。随着模型规模的增长,对速度的需求变得至关重要。研究人员最近开发出了能够使用更小、更粗略的数字——四位浮点值(four-bit floating-point values)——来执行这些比较,从而大幅提升速度的芯片。然而,仅仅切换到这些较小的数字是不够的;管理数据流的软件也必须随之改变,否则速度上的增益将会消失。
Graphcore的一位研究人员通过一种他们称为 Direct-P 的新方法解决了这一特定的瓶颈。他们的工作专注于注意力的“前向”(forward)传递(即模型处理信息以生成答案的过程)和“后向”(backward)传递(即模型从错误中学习的过程)。研究人员发现,虽然新芯片可以极其快速地进行乘法运算,但中间的步骤——将原始得分转换为概率——却拖慢了整体速度。这就像是一条超高速的流水线,却因为一名工人必须在传递零件之前仔细测量每一个部件而不断停顿。研究人员发现,处理这种转换的标准方式涉及复杂的缩放和舍入,这造成了交通拥堵,抵消了新硬件带来的速度优势。
为了解决这个问题,研究人员重新设计了转换过程,使其变得直接且精简。该方法不再是先计算一个精确的概率然后再进行舍入,而是将原始得分直接映射到硬件使用的特定编码上。这消除了导致延迟的中间环节。当他们在最新一代数据中心芯片上测试这种方法时,结果令人瞩目。对于某些常见的数据形状,新方法处理信息的速度比依赖高精度数字的旧标准快了两倍多。它在保持足以应对视频生成和语言理解等复杂任务的输出精度之余,实现了极高的效率。在涉及视频生成模型的测试中,新方法几乎比标准方法快了两倍,其产生的结果虽然有限且可用,但与速度较慢、精度较高的版本相比,表现出了可测量的漂移和较低的相似度得分。
然而,故事不仅仅关于速度,还关于当模型尝试学习时会发生什么。研究人员探索了是否可以使用这些超快速、低精度的数字来进行整个训练过程,包括更新知识的后向传递。他们发现,虽然前向传递可以全速运行,但后向传递需要一种谨慎的折衷方案。当他们尝试在训练期间对概率值使用最快的四位格式时,学习过程变得不稳定,模型无法改进。数字变得过于粗略,导致学习信号崩溃。因此,研究人员确定,为了保持训练的稳定性,即使其余计算使用较快的四位格式,他们也必须对概率值使用稍精确一点的八位格式。这种混合方法使他们在单个强大芯片上的整个训练周期提速了约 14%,这对于大规模模型来说是一个显著的增益。
研究人员还观察了计算机芯片本身的物理极限。他们发现,计算速度本身已不再是主要问题;问题在于数据如何在芯片内部存储和移动。芯片有一个微小的、超高速的内存区域,用于在工作时存放数字。研究人员发现,这个内存空间已经完全填满,没有空间来重叠计算的不同阶段。这就像一个厨房里的柜台挤满了食材,以至于厨师在处理完当前的蔬菜之前,无法开始切下一种蔬菜,即便手中的刀非常锋利。由于内存空间被完全占用,芯片无法同时处理多个步骤,这限制了整个过程能实现的最高速度。
这项工作凸显了我们在如何让人工智能变快这一思维方式上的关键转变。仅仅建造更快的计算器是不够的;整个工作流必须根据硬件的能力进行重新设计。研究人员表明,通过改变概率的计算方式并仔细管理数据流,可以释放巨大的速度提升。然而,他们也证明了存在硬性限制。芯片的内存约束意味着,即使拥有最快的数学运算,重叠操作也是有上限的。他们指出,未来的道路不仅在于更快的算术,还在于更聪明地组织数据,使芯片的资源永远不会处于等待状态。这种在原始速度与精细数据管理之间的平衡,将使下一代人工智能高效运行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。