← 最新论文
🤖 machine learning

GQLA: Group-Query Latent Attention for Hardware-Adaptive Large Language Model Decoding

该论文提出了组查询潜在注意力(GQLA),这是对 DeepSeek 多头潜在注意力的一种硬件自适应改进,它使同一组权重能够动态地在面向 H100 级 GPU 的 MQA 吸收路径和面向 H20 等商用 GPU 的 GQA 路径之间切换,从而优化推理效率并支持多 token 预测,且无需重新训练或定制内核。

原作者: Fanxu Meng

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Fanxu Meng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在运营一座庞大的图书馆(一个大语言模型),每当图书管理员写下一句新句子时,他们都必须回顾自己读过的每一本书,以确保新句子合乎逻辑。这种“回顾”是过程中最耗资源的环节,需要大量的内存带宽。

长期以来,处理这一问题的最佳方法是一种称为MLA(多头潜在注意力)的技术。将 MLA 想象为一个超高效的“摘要笔记”系统。图书管理员不再保留每本书的每一个细节,而是将所有重要信息压缩成一张微小的、低秩的“作弊条”(潜在向量)。

旧系统(MLA)的问题
论文指出,虽然这套“作弊条”系统非常精妙,但它最初是专门为一种极其昂贵、高性能的计算机(NVIDIA H100)设计的。

  • H100 的适配:在这台昂贵的计算机上,该系统运行完美,因为它的数学计算速度极快,但内存速度有限。“作弊条”将内存占用降至最低,恰好契合了这台计算机的优势。
  • H20 的不匹配:然而,存在一种更便宜且受出口限制的计算机(H20),它拥有充足的内存速度,但数学计算能力要慢得多。对于这台机器而言,旧的“作弊条”系统是一场灾难。它迫使计算机在移动少量数据时进行过多的数学运算,导致其停滞不前。
  • 僵化性:旧系统就像是为某个人量身定制的一套西装。一旦体型改变,你就无法再穿它。此外,它还阻碍了图书馆高效利用多名工作人员(张量并行),并阻止他们在不降低速度的情况下一次性预测接下来的多个单词(多 Token 预测)。

新解决方案:GQLA(分组查询潜在注意力)
作者提出了一种名为GQLA的新系统。与其说这是一套新西装,不如说它是一套可变形西装,能够利用完全相同的面料(相同的训练权重)完美适配两种不同的体型。

以下是其工作原理的类比说明:

  1. 两条路径

    • 路径 A(“超紧凑”模式):这是原始的 MLA 风格。它保留微小的“作弊条”。这非常适合昂贵且数学计算密集型的 H100 计算机,因为它最大限度地减少了内存流量。
    • 路径 B(“分组”模式):这是新技巧。它不是将所有内容压缩成一张微小的笔记,而是将笔记分组为 8 个独立的“文件夹”。这会创建一个稍大的缓存,但允许计算机在每一步进行更少的数学运算。这非常适合更便宜但数学计算慢、数据传输快的 H20 计算机。
  2. 魔法开关
    最棒的是,图书馆无需重建。“西装”(模型权重)是相同的。当你部署模型时:

    • 如果你在H100上,只需切换开关使用路径 A
    • 如果你在H20上,只需切换开关使用路径 B
    • 无需重新训练:你不需要教图书管理员任何新东西,只需改变他们阅读笔记的方式。
    • 无需定制工具:它使用计算机工具箱中已有的标准工具。
  3. 为何更优

    • 硬件自适应:它为昂贵和便宜的计算机都找到了“最佳点”,在两者上都能最大化速度。
    • 团队协作:与旧系统不同,新的“分组”路径允许多名工作人员高效协作(张量并行),而这一点此前是被阻塞的。
    • 面向未来:它还支持在更便宜的计算机上“一次性猜测多个单词”(多 Token 预测),而旧系统在不崩溃的情况下无法做到这一点。

"TransGQLA"技巧
论文还展示了如何将一个现有的图书馆(一个已经用旧的分组系统训练好的模型)瞬间转换为这种新的“可变形西装”,而无需从头开始。这就像给一件标准夹克加上一个隐藏的拉链,让它能瞬间变身为超紧凑版本。

结果

  • H100上,其表现与原始系统一样好。
  • H20上,它比原始系统快 3.4 倍,因为它阻止了计算机在不必要的数学运算上浪费时间。
  • 他们在标准模型(LLaMA-3-8B)上进行了测试,发现将其转换为这种新格式几乎不改变其智能,在几乎不损失能力的情况下,在更便宜的硬件上获得了巨大的速度提升。

总结
这篇论文介绍了一种灵活的注意力机制,它就像一个“通用适配器”。它允许单个 AI 模型仅通过改变其内存组织方式,即可在高端昂贵芯片和更便宜的限制性芯片上均以峰值效率运行,而无需重新训练模型或构建新软件。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →