← 最新论文
🤖 machine learning

Do Transformers Need Three Projections? Systematic Study of QKV Variants

本文系统地论证了在 Transformer 中共享查询(query)、键(key)和值(value)投影——特别是 Q-K=V 变体——能够显著降低推理内存和 KV 缓存需求,同时在视觉和语言任务中保持具有竞争力的性能,从而实现高效的端侧部署。

原作者: Ali Kayyam, Anusha Madan Gopal, M Anthony Lewis

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Kayyam, Anusha Madan Gopal, M Anthony Lewis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,Transformer 模型(现代 AI 背后的“大脑”)就像一个极其高效的图书管理员,正试图根据一本巨著来回答问题。为了完成这项工作,他会对书中的每一个词使用三种特定的工具:

  1. 查询 (Query, Q): 一张提问卡,上面写着:“我在寻找什么?”
  2. 键 (Key, K): 书脊上的标签,用来查看是否与问题匹配。
  3. 值 (Value, V): 如果匹配成功,则阅读实际的页面内容。

传统上,图书管理员会为每一个词的这三个步骤都创建一个全新的、独特的工具。这就是标准的“QKV”设置。它效果很好,但很沉重。图书管理员必须为每个词背负三个沉重的工具包,这占用了大量的空间(内存)并降低了速度。

这篇论文提出了一个简单而大胆的问题:“我们真的需要三种独立的工具吗,还是可以将它们合并?”

研究人员测试了三种简化图书管理员工具箱的方法:

三个实验

1. “相同问题,相同标签”法 (Q = K - V)

  • 核心思想: 图书管理员使用相同的工具来进行提问和检查标签。他们仍然保留一个独立的工具来阅读页面。
  • 结果: 这是大赢家。事实证明,“问题”工具和“标签”工具如此相似,以至于它们可以作为同一个对象存在,而不会损害性能。
  • 益处: 图书管理员现在只需要携带两个工具,而不是三个。这使得存储“标签”和“页面”所需的内存减少了一半。这就像是意识到你可以用左手既拿着地图又指向目的地,从而省去了再拿一张地图的麻烦。

2. “相同问题,相同页面”法 (Q - K = V)

  • 核心思想: 图书管理员使用相同的工具作为标签和页面内容,但保留一个独立的工具用于提问。
  • 结果: 这也表现得不错,但在语言任务方面的效率略低于第一种方案。这就像是用同一把钥匙既开门又开保险箱,虽然聪明,但“问题”工具仍需保持独特,以维持搜索的方向性。

3. “一个工具搞定一切”法 (Q = K = V)

  • 核心思想: 图书管理员试图只用一个单一的工具来提问、检查标签并阅读页面。
  • 结果: 这对语言任务来说是一场灾难。这就像试图用一把锤子同时完成提问、检查标签和阅读书籍的工作。AI 会感到困惑,因为它失去了区分“我在找什么”和“我找到了什么”的能力。性能显著下降。

为什么这很重要:“背包”问题

这篇论文最令人兴奋的部分不仅在于让 AI 变得更聪明,还在于让它变得更轻盈

当 AI 生成文本(比如写故事或回答聊天)时,它必须记住它目前为止写下的所有内容。这种记忆被称为 KV 缓存 (KV Cache)

  • 标准 AI: 背着一个带有“标签”和“页面”独立隔层的沉重背包。
  • 新 AI (Q-K=V): 背着一个“标签”和“页面”已合并为一个隔层的背包。

现实世界的冲击力:

  • 双倍内存: 因为背包变轻了,你可以在不耗尽空间的情况下,在 AI 的内存中放入两倍数量的单词
  • 更便宜的服务器: 如果你经营着一家使用 AI 的公司,你可以在相同数量的计算机上服务两倍数量的客户。论文计算出,这可以为公司每月节省数千美元。
  • 在手机上运行: 这种效率使得在你的手机或小型边缘设备上直接运行强大的 AI 模型变得更加现实,而无需依赖数据中心里的巨大超级计算机。

“双重获益”奖励

论文还发现,这种新的“轻量化背包”技巧可以与另一种现有的技巧——多头共享 (Head Sharing)(被 Llama 2 和 Mistral 等模型使用)完美配合。

  • 多头共享 像是减少了图书管理员的人数,但让他们干更多的活。
  • 投影共享 (Projection Sharing)(本文的想法)则是让每位图书管理员的工具箱变得更小。

当你将两者结合时,你会获得巨大的胜利。研究人员展示了通过结合这两种方法,你可以将所需的内存缩减 97%。这是在小型设备上运行 AI 的“圣杯”。

总结

这篇论文证明了标准的 AI 设计有些过度设计了。通过将“问题”和“标签”工具合并为一个,我们可以在几乎不损失智能的情况下,将内存成本减半。这是一个简单的微调,它让 AI 更快、更便宜,并准备好在你的口袋设备上运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →