← 最新论文
🤖 AI

FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs

本文介绍了 FlashMLA-ETAP,这是一个利用高效转置注意力流水线(Efficient Transpose Attention Pipeline)的新型框架,通过优化 WGMMA 操作,在保持高数值稳定性的同时,显著加速了 NVIDIA H20 GPU 上的多头潜在注意力(Multi-Head Latent Attention)推理,并实现了相比现有方法的实质性加速。

原作者: Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在读一本非常长的书(即“上下文”),只为了回答一个简短的问题(即“查询”)。这本质上就是像 DeepSeek-R1 这样的大型 AI 模型生成文本时的过程:它会回顾之前读过的所有内容,以决定下一个词该说什么。

这篇论文介绍了一种名为 FlashMLA-ETAP 的新方法,它就像是在教 AI 一种更聪明的翻阅书籍的方式,特别是针对一种名为 NVIDIA H20 的特定计算机芯片。

以下是使用日常类比对问题和解决方案进行的拆解:

问题:“尴尬的架子”问题

把 NVIDIA H20 GPU 想象成一位在图书馆工作的图书管理员,而这位图书馆有一个规则:书架必须至少有 64 本书宽才能保持稳定。 如果你试图在架子上只放 16 本书,管理员就必须用“假书”(填充/padding)来填满剩余空间,以免书架坍塌。这既浪费时间又浪费精力。

在 AI 世界中,“书”就是注意力头(attention heads,即大脑中专注于不同事物的部分)。当在单台配备 8 个 H20 GPU 的服务器上运行庞大的 DeepSeek-R1 模型时,工作会被拆分。每个 GPU 最终只能处理 16 个头

因为 16 小于要求的 64,H20 GPU 必须做大量的“无用功”(填充)来满足其硬件规则。这就像是强迫图书管理员搬运 64 个空箱子,仅仅为了运输其中的 16 个真箱子。当 AI 阅读的“书”非常长(长上下文),而它要回答的问题又非常短(一次只出一个词)时,这会让 AI 变得缓慢且低效。

解决方案:把书横过来放 (ETAP)

作者创建了一种名为 ETAP(高效转置注意力流水线,Efficient Transpose Attention Pipeline)的技术。他们并没有试图强行让 16 个头去适应 64 宽的架子规则,而是将问题转向了侧面

想象一下,与其在一个短行里看 16 个头,不如将书的长度(这可能是数千页)作为主要的维度。由于这本书非常长,它可以轻松地填满“64 宽的书架”要求,而不需要任何假书。

通过交换维度——将漫长的对话历史视为主要的“宽度”,将简短的问题视为“高度”——H20 GPU 就可以全速运转,而无需浪费时间处理空闲的填充。这就像是意识到,与其试图把 16 件小物品塞进一个大箱子,不如将它们垂直堆叠,因为那里有充足的空间。

结果:更快、更准确

论文声称这种“侧向”方法在 H20 GPU 上带来了巨大的变化:

  1. 速度大幅提升: 在长对话长度(64,000 个词)下,FlashMLA-ETAP 比针对该特定模型的现有最佳方法(FlashMLA)快了 2.78 倍。它也比 FlashAttention-3 和 FlashInfer 等其他流行方法快得多。
  2. 更准确: 通常,当你尝试加速 AI 计算时,可能会损失一些精度(比如过度舍入数字)。然而,这种新方法实际上比 FlashAttention-3 更准确,其误差率(RMSE)更低。这就像是在读书速度变快的同时,理解得还更透彻了。

为什么这很重要

大多数 AI 优化都是为超昂贵的高端芯片(如 H100)设计的。H20 是一款“中端”芯片——性能不错,但不是最强大的。这篇论文表明,通过正确的软件技巧(ETAP),你可以让中端芯片在特定任务中表现得更好。这就像是找到了一种方法,通过改变换挡方式,让一辆普通的轿车在特定路面上开得像跑车一样高效。

简而言之:FlashMLA-ETAP 是一个软件更新,它告诉 NVIDIA H20 GPU 如何重新组织阅读长篇 AI 对话的方式,消除了无效劳动,并让 AI 的响应变得更快、更准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →