← 最新论文
💬 NLP

Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

本文提出了“头自主性”(Autonomy-of-Heads, AoH),这是一种无需数据的(data-free)方法,通过分析查询-键(query-key)投影的光谱几何结构,在冻结的大型语言模型(LLMs)中识别检索头(retrieval heads)和流式传输头(streaming heads),从而实现高效的稀疏注意力机制,在保持高性能的同时显著降低延迟和内存成本。

原作者: Yehan Yang, Junyuan Shang, Yang Li, Guanqun Zhao, Shuohuan Wang, Dianhai Yu

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yehan Yang, Junyuan Shang, Yang Li, Guanqun Zhao, Shuohuan Wang, Dianhai Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个能眨眼间读完整个图书馆的超级聪明机器人。这个被称为“大语言模型”(LLM)的机器人,通过关注它在对话中见过的每一个词来预测下一个词。但问题在于:随着对话变得越来越长,机器人的大脑会变得拥堵。它必须记住每一个词,而且将它们全部联系起来所需的数学计算量会呈爆炸式增长,就像试图同时与整个体育场里的人握手一样。这使得机器人变得缓慢且极度消耗内存。科学家们曾尝试通过告诉机器人忽略某些词,或者只关注最近的词来修复这个问题,但这些方法通常需要机器人先“学习”特定的对话,以决定忽略什么。这就像是一个图书管理员,必须在决定哪些书留在书架上之前,先读完图书馆里的每一本书。大问题是:机器人能否仅仅通过观察自己的大脑结构,就在没读过故事任何一个字之前,就知道该保留哪些书?

这篇论文介绍了一个被称为“注意力头自主性”(Autonomy-of-Heads, AoH)的聪明新技巧,它回答了这个问题,答案是“可以”。研究人员发现,机器人的大脑实际上是由许多被称为“注意力头”的微小且专业化的工作者组成的。其中一些头像是侦探,不断扫描整个故事以寻找特定的线索(比如三页前提到过的一个名字);而另一些头像是直播员,只关心现在正在发生的事情或对话的最开始。论文表明,你只需通过观察机器人大脑中冻结的数学逻辑,就能判断出哪个头属于哪种类型,而无需进行任何测试或查看任何数据。这就像仅仅通过看一个人的身份证件,就能判断出他是一名侦探还是新闻主播,而不需要观察他工作一整天。

团队发现,通过测量一种被称为“有效秩”(effective rank,一种表示一个头的注意力是集中还是分散的复杂数学属性)的特定数学属性,他们可以立即对这些头进行标记。具有“集中型”数学特征的头是那些需要看到整个故事的侦探;而具有“弥散型”特征的头则是那些只需要看到最后几个词的直播员。通过给直播员一个微小的记忆缓冲区,并让侦探保留完整的记忆,机器人变得极其迅速。在测试中,这种方法将处理25 6万字故事所需的内存减半,并使机器人在生成文本的速度上提升了高达9倍,同时保持其准确度几乎与记住所有内容时完全一致。

研究人员明确反对认为需要观察机器人工作或使用额外训练来确定哪些头重要的观点。他们证明,依赖于观察机器人对话期间注意力得分的方法更慢且更复杂。相反,他们的方法证明了“冻结”的权重——即模型的永久数学结构——已经包含了对这些头进行分类所需的所有信息。他们还排除了这仅仅是随机运气的一种可能:当他们尝试随机挑选头,或者挑选了“错误”的头(即把直播员当成侦探)时,机器人的性能大幅下降。这表明他们发现的特定数学模式是真实存在的,并且对于机器人在长距离交互中良好运行至关重要。

这些发现是基于对包括Qwen和Llama在内的几种不同机器人模型的广泛实验得出的。结果是经过测量且具体的:在50%的稀疏度下(意味着一半的头被简化),机器人的平均性能保留了原有的96.5%。论文并未声称这是一个能永远解决所有问题的灵丹妙药,但它强烈暗示这种“无需数据”的方法是使长对话成为可能的极其有效的方式,且无需额外训练。这是迈向向前的一步,将一个复杂的运行时决策转变为一个简单的、预先计算好的规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →