← 最新论文
🤖 machine learning

Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention

该论文提出了分组查询专家(Grouped Query Experts, GQE),这是一种应用于分组查询注意力机制的混合专家层,它通过在每个 token 层面动态选择查询头专家的子集,同时保持键值头(key-value heads)的稠密性,从而在不牺牲下游准确性的情况下,减少了活跃计算量并提高了效率。

原作者: Vishesh Tripathi, Abhay Kumar

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Vishesh Tripathi, Abhay Kumar

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一座巨大的图书馆(一个 Transformer AI 模型),其中的每一本书(一个文本 token)都需要与其他每一本书进行交叉引用,才能理解整个故事。这就是“自注意力机制”(self-attention)的工作方式。

问题:“一刀切”的图书管理员
在标准的 AI 模型中,有一组由 16 名专业图书管理员组成的团队(称为“注意力头”,attention heads)。无论你从书架上取下哪本书,这 16 名专家都必须阅读、分析并撰写报告。

  • 如果这本书是一个简单的词,比如“the”或者一个逗号,你并不需要 16 位专家;一两个就足够了。
  • 如果这本书是一个复杂的科学术语,你可能确实需要全部 16 位专家。
    但目前的系统强制要求这 16 名专家对每一个词都进行处理。随着故事变得越来越长(长上下文),这会变得极其缓慢且昂贵,就像雇佣了一整个管弦乐团来演奏一个单音符。

现有的解决方案:分组查询注意力 (GQA)
在此论文之前,研究人员尝试通过对图书管理员进行分组来节省成本。他们没有使用 16 个独特的团队,而是有了 8 个团队,其中每两个图书管理员共享同一份“键与值”(KV heads)笔记(即参考资料)。这节省了一些内存,但所有 面的 16 名图书管理员仍然必须阅读每一个词。这就像是换了一个更小的文件柜,但仍然让每一位员工都要走遍整个大楼去完成工作。

新的解决方案:分组查询专家 (GQE)
作者提出了一种更聪明的系统,称为分组查询专家 (GQE)。可以将其想象为将这些 16 名图书管理员变成了一个“混合专家”(Mixture of Experts)系统,但带有一个转折。

  1. 设置: 他们保持 8 组参考笔记(KV heads)完全不变。这部分始终是“稠密”的(全量激活),因为获取参考资料的成本较低。
  2. 路由 (The Router): 在每个组内部,有多个“专家”图书管理员(查询头,query heads)。对于每一个单词,一个聪明的“路由”(交通警察)会观察这个词并询问:“我们真的需要这个组里的全部 4 位专家来阅读这个词吗?”
  3. 选择: 路由会为这个特定的词挑选出前 1 或 2 位专家(k=1 或 k=2)来执行实际工作。组内的其他专家则去喝杯咖啡休息一下。
  4. 安全网: 为了确保系统不会变得混乱或偷懒,他们增加了两个特殊功能:
    • 共享头 (The Shared Head): 会有一位图书管理员始终在岗,阅读每一个词,以保持团队的稳定性。
    • 加权摘要 (The Weighted Summary): 系统会创建一个“共识报告”,将所选专家的工作进行融合。这至关重要,因为它为路由提供了一个清晰的信号,让它知道自己的表现如何,从而让它能够学习哪些专家最适合处理哪些词。

结果:在不损失智能的情况下实现提速
论文在了一个拥有 2.5 亿参数、并在 300 亿个词汇上训练的小型模型上进行了测试。

  • 准确度: GQE 模型的表现与旧有的、对每个词都使用全部 16 名专家的模型一样出色。通过跳过部分专家,它并没有变得“更笨”。
  • 速度: 由于跳过了大约一半的查询头工作,它变得更快了。
    • 对于短篇故事,它稍微快了一些(1.15 倍)。
    • 对于非常长的故事(如一整本小说),它的速度提升了 1.7 到 1.8 倍

为什么这很重要
该论文声称,通过使“阅读”部分变为条件性的(仅在需要时才进行工作),同时保持“参考”部分保持恒定,可以在不牺牲答案质量的前提下,显著提高长对话或文档分析的速度。

局限性 (The Catch)
作者谨慎地指出,这是在一个相对较小的模型上进行的测试。他们尚未证明这在万亿级参数的巨型模型上同样有效。此外,“路由”需要经过非常精心的训练;如果你只是随机挑选专家而没有“安全网”(共享头和加权摘要),模型的表现实际上会变差。

简而言之:GQE 就像是聘请了一支专家团队,只有最合适的专家才会出现在特定的任务面前,这使得处理长任务的过程更加高效,同时又不会降低工作的质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →