← 最新论文
💬 NLP

A3 : an Analytical Low-Rank Approximation Framework for Attention

本文提出了 A³,一种后训练低秩近似框架,该框架通过分析性方法降低 Transformer 组件(QK、OV 和 MLP)的隐藏维度以最小化功能损失,从而在零运行时开销的情况下,相较于现有方法实现更优越的压缩与性能。

原作者: Jeffrey T. H. Wong, Cheng Zhang, Xinye Cao, Pedro Gimenes, Christos-Savvas Bouganis, George A. Constantinides, Wayne Luk, Yiren Zhao

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jeffrey T. H. Wong, Cheng Zhang, Xinye Cao, Pedro Gimenes, Christos-Savvas Bouganis, George A. Constantinides, Wayne Luk, Yiren Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一座巨大且极其聪明的图书馆(即大型语言模型),它能写故事、解数学题,还能与你聊天。但有个问题:这座图书馆太过庞大,需要占据整个仓库,需要一支卡车车队来搬运,运行成本也高得惊人。你希望把它缩小到能装进背包,同时又不丧失其讲述精彩故事的能力。

这正是论文 A3 试图解决的问题。

当前“缩小”方法的缺陷

目前,人们主要通过两种技巧来缩小这些图书馆:

  1. 剪枝(Pruning):根据权重的大小,剔除“无用”的书籍(权重)。
  2. 量化(Quantization):将书籍用更简单、更简短的语言(更少的比特位)重写,以节省空间。

还有一种方法叫 低秩近似(Low-Rank Approximation),就像试图将整本书总结为几个要点。然而,论文指出,当前的总结方法十分笨拙。它们孤立地审视单页(线性层),并试图完美地总结每一页。这往往忽略了图书馆整体运作的全貌。此外,这种总结方式常常引发新问题:所谓的“总结”实际上是将两本更小的书粘在一起,导致阅读它们(运行模型)变得更慢、更复杂,因为你每次都需要停下来将它们粘合。

A3 的解决方案:“功能”导向法

A3 的作者表示:“让我们停止单独查看每一页,转而关注图书馆的 功能。”

他们将 Transformer(人工智能的大脑)分解为三个主要功能区域:

  1. QK 房间(Query & Key):这里是图书馆决定 关注什么 的地方。(好比图书管理员扫描主题列表,查看哪些书籍相关)。
  2. OV 房间(Output & Value):这里是图书馆收集实际信息并撰写答案的地方。(好比图书管理员从书架上取下书籍并进行总结)。
  3. MLP 房间(多层感知机):这是图书馆处理和转换信息的思考室。(好比图书管理员实际撰写新故事)。

A3 的类比:
想象你试图缩小一支庞大的管弦乐队。

  • 旧方法 试图单独缩小每位小提琴手乐谱。这往往导致乐谱变得杂乱,需要额外的乐手来演奏那些“粘合”的部分,从而拖慢音乐会。
  • A3 则着眼于乐队的 声部。它意识到“弦乐部”(QK)、“铜管部”(OV)和“打击乐部”(MLP)都共享一个共同的空间。A3 不是简单地削减音符,而是 缩小每个声部的舞台。它让弦乐部的舞台变小,铜管部的舞台变小,打击乐部的舞台也变小。

为何这至关重要

因为 A3 缩小的是“舞台”(隐藏维度),而不仅仅是将两张小纸片粘在一起,它带来了三大优势:

  1. 无额外开销:当乐队演奏时,无需停下来粘合纸张。音乐自然流淌。在计算机术语中,这意味着 零运行时开销。它不会拖慢人工智能;事实上,由于需要移动的数据更少,它往往更快。
  2. 更小的内存:通过缩小舞台,图书馆需要的书架更少。这大幅减少了 KV Cache(人工智能用于记住刚才所说内容的临时内存),使其能在不耗尽空间的情况下进行更长的对话。
  3. 更优的质量:因为 A3 关注的是 功能(房间实际 做什么),而不仅仅是原始数字,所以它能保持人工智能的聪明才智。

结果:A3 与其他方法对比

该论文在著名模型如 LLaMA 3.1-70B(一个非常庞大且强大的模型)上测试了 A3。

  • 竞争对手:当其他方法尝试将该模型缩小 10% 时,写作质量显著下降(“困惑度”分数上升至 7.87,意味着人工智能更加困惑)。
  • A3:当 A3 将同一模型缩小 10% 时,质量保持更高(分数为 4.69)。论文声称这是一个巨大的改进,使得压缩后的模型比其他任何方法都更接近原始的巨型版本。

特殊功能

论文还提到,A3 具有灵活性。它能处理这些图书馆的现代变体,例如:

  • GQA(分组查询注意力):一种通过在声部间共享乐谱来提高图书馆效率的方法。A3 能自然地适应这种共享。
  • RoPE(旋转位置嵌入):图书馆理解单词在句子中位置的方式。A3 有一个特殊技巧(使用一种称为 CUR 分解的方法)来缩小它,而不会破坏图书馆对时间和顺序的感知。

总结

请将 A3 视为一位 建筑师,而非一把随机剪除页面的剪刀。建筑师重新设计建筑,而不是仅仅移除墙壁,而是缩小房间本身。其结果是:建筑更小、运行成本更低,且功能完美,没有那些拖慢其他翻新方法的杂乱“胶水”。

作者甚至已将他们的蓝图(代码)公开,供所有人使用,以便其他人也能构建这些更小、更快的图书馆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →