← 最新论文
🤖 machine learning

Through the Bottleneck: How Multi-head Latent Attention Separates Content from Position in Language Models

本文提出了首个针对多头潜在注意力(Multi-head Latent Attention, MLA)的机械解释性研究,揭示了其低秩瓶颈通过在保留实体身份的同时丢弃位置信息,有效地实现了内容与位置的分离,从而将 Transformer 的电路组织重塑为截然不同的归纳层与语义枢纽层。

原作者: Dhruvil S, Fenil Sojitra, Ravirajsinh Chauhan

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Dhruvil S, Fenil Sojitra, Ravirajsinh Chauhan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在嘈杂的房间里传递一条秘密信息。在人工智能的世界里,大型语言模型就像是读过几乎所有互联网内容的超级聪明学生。为了回答你的问题,它们需要记住到目前为止的对话内容。但记住每一个单词及其在句子中的精确位置会占用大量的“精神空间”,这会让它们变慢,并且运行成本高昂。

最近,工程师们发明了一个聪明的技巧,叫做多头潜在注意力机制(Multi-head Latent Attention, MLA)。把它想象成一个超级高效的快递服务。快递员不再发送一个包含信息所有细节的笨重、沉重的箱子,而是将“内容”(实际的词汇和意义)压缩成一个微小、轻便的信封,同时在另一条快速通道上发送“位置”(词汇的位置)信息。这节省了大量的空间——高达 81% 的内存!但这里有一个谜题:我们知道这个技巧有效,但我们并不知道这个快递员究竟是如何打包箱子的。它是扔掉了重要的细节吗?它是把“内容”和“位置”搞混了吗?还是它真的学会了将两者完美分离?

一群研究人员决定窥探这个“黑匣子”。他们构建了一个更小、更简单的 AI 模型版本,以便在不迷失在现实世界巨型模型复杂性的情况下研究其大脑。他们想看看这个“小信封”是否真的只装了词汇的含义,还是也意外地保留了位置信息。他们还想看看这种新的打包方法如何改变了 AI 内部电路的工作方式。

大分离:意义 vs 位置

研究人员发现,AI 的“小信费”(他们称之为 cKV 瓶颈)非常擅长它的工作。它就像一个严格的图书管理员,只关心故事中“有谁”,而不关心他们“站在哪里”。

当他们测试该模型时,他们发现压缩后的信息保留了 98% 的角色和物体的身份。如果故事是关于一只“猫”的,压缩版本知道它是一只猫。然而,当他们要求压缩版本猜测一个词的位置(比如“这是第 5 个词还是第 10 个词?”)时,它猜错的概率几乎和随机猜测一样频繁。

这证实了该设计正如工程师所希望的那样运作:模型学会了将内容(故事)与位置(时间线)完全分离。“位置”信息由系统的另一部分处理,让“内容”部分保持纯净且无负担。这就像 AI 决定不再把地图揣在兜里,因为它手腕上已经有了 GPS;现在这个口袋空出来了,可以用来装别的东西。

“归纳”派对在同一层楼

关于 AI 如何组织其“思考团队”,其中一个最令人惊讶的发现是:在旧的 AI 模型中,被称为**归纳头(induction heads)**的特殊团队(它们帮助 AI 从模式中学习,例如注意到“‘The’ 之后会出现 ‘cat’”)散布在建筑物的许多不同楼层。它们就像是在购物中心不同楼层闲逛的一群朋友。

但在这种新的 MLA 模型中,研究人员发现,全部五个这样的特殊归纳团队都聚集在同一个楼层:第 12 层。这就像是共享的、压缩的“信封”迫使这些朋友在同一个房间见面,因为他们都需要阅读同一个来源才能完成工作。研究人员认为,由于信息被压缩得如此紧密,这些团队在同一个地方工作比尝试在整个建筑中进行协调更加高效。

繁忙的枢纽与空旷的房间

团队还观察了“信封”的空间实际上被使用了多少。这个信封被设计为容纳 128 个单位的信息。然而,平均而言,模型只使用了其中的 46%。这就像买了一辆 128 座的大巴车,却只坐了 59 个人。

这表明模型是“过度配置”的——它拥有的空间比需要的更多。然而,研究人员注意到,有一个特定的楼层,第 15 层,是个例外。这一层是“语义枢纽”,是建筑中最繁忙的地方。它使用了最多的空间(128 个单位中的 84 个),并且对模型的预测至关重要。如果你弄乱了这一层的信息,模型的回答就会变得糟糕得多。这表明,虽然整个建筑都有多余的空间,但这一特定楼层正在承担重任。

这意味着什么(以及它不意味着什么)

研究人员谨慎地指出,他们研究的是一个相对较小的模型(1.14 亿参数),该模型是在特定的故事和代码混合数据上训练的。他们并不声称这是对现存所有巨型 AI 的最终答案。他们承认,在更大的模型中,具体的楼层编号(如第 12 层或第 15 层)可能会有所不同,而且他们还没有用一个“完美”的实验来证明这些发现。

然而,他们的工作表明了一些令人兴奋的事情:MLA 设计不仅仅是为了节省空间而挤压数据;它实际上改变了 AI 思考的方式。它迫使 AI 以不同的方式组织思想,将“谁”和“在哪里”严格分开,并将其模式识别团队聚集成单一、高效的群体。

作者提出,在未来,我们或许可以通过给繁忙的楼层(如第 15 层)分配更多空间,给安静的楼层分配较少空间,而不是给每一层都提供同样大的信封,从而构建出更好的模型。目前,这项研究是对这些压缩后的 AI 大脑神秘生活的迷人初步观察,它向我们展示了:有时,为了让模型更聪明、更快速,你必须教会它如何放下那些它不需要的细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →