← 最新论文
💬 NLP

You Need Better Attention Priors

本文介绍了 GOAT,这是一种通过利用熵正则化最优传输(Entropic Optimal Transport)将标准注意力机制中的隐式均匀先验替换为可学习的连续先验,从而实现对标准注意力的泛化,进而解决注意力汇聚(attention sinks)问题并实现具备长度泛化能力的空间编码,同时保持与 FlashAttention 等优化内核的兼容性,这是一种新颖的注意力机制。

原作者: Elon Litman, Gabe Guo

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Elon Litman, Gabe Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的广阔版图中,一种被称为 Transformer 的特定类型计算机程序已成为一些现存最强大的语言和图像系统的引擎。在这些系统的核心,存在着一种被称为“自注意力”(self-attention)的机制,它允许软件决定在任何给定时刻应该关注句子或图像的哪些部分。想象一位正在阅读长篇文档的读者;自注意力就是那种让读者能够瞬间将代词如“它”关联回其所指代的特定名词,或者将动词与其主语联系起来的心理过程,无论两者之间间隔了多少个单词。多年来,工程师们一直依赖一套标准且略显僵化的规则来引导这一聚焦过程。这些规则在许多情况下表现良好,但当文本变得非常长,或者系统遇到从未见过的模式时,它们就会显得力不从心,往往导致混乱或对关键信息的关注丧失。

斯坦福大学的一个研究小组提出了一种关于这种聚焦机制运作方式的根本性转变。他们认为,标准的规则基于一个隐藏的假设,即计算机在查看内容之前,应该认为每一个可能的单词或图像块都有同等的可能重要。研究人员指出,这是一个过于简化的起点。相反,他们开发了一种名为 GOAT 的新方法,允许系统学习属于自己的“预期”去何处寻找。GOAT 并非强迫计算机从一张白纸开始,而是让它发现并采用特定的结构化习惯,例如一种自然倾向于关注句子开头或最近单词的习惯,而无需受到单词实际含义的干扰。

这一发现的核心在于重新构想注意力——它不仅仅是一个简单的相似度计算,而是一个在序列项中分配注意力的过程。在标准方法中,系统会尝试尽可能均匀地分散注意力,除非内容强烈暗示了其他方向。研究人员发现,这种“均匀分布”的假设正是系统在内容模糊或序列极长时失效的原因。通过用一个灵活的、可学习的引导取代这种均匀假设,新方法使系统即使在信息稀疏的情况下也能保持稳定的焦点。这对于被称为“注意力汇聚”(attention sinks)的现象尤向尤为重要:在长对话中,模型往往会将不成比例的注意力倾倒在少数几个特定的标记(tokens)上,通常是第一个标记,仅仅是因为系统没有其他地方可以放置其注意力。新方法将这种行为解释为一种逻辑结果,即当系统缺乏明确信号时如何分配注意力,并提供了一种有意识控制这种行为的方法。

为了测试他们的想法,研究人员构建了一个将注意力的结构规则与单词的实际含义分离的系统。在以往的方法中,寻找目标的规则往往与单词的含义纠缠在一起,使得系统难以推广到新的长度或语境。新方法将这两者区分开来。它学习一个连续的预期映射,该映射可以在系统训练过程中进行调整。这个映射可以捕捉复杂的模式,例如对紧邻当前单词的前一个单词的偏好,或者对序列开头的偏向,而不会扭曲单词本身的含义。研究人员证明,该系统可以使用驱动当前大型语言模型的高速计算机芯片进行高效实现,不需要额外的内存或处理能力。

实验结果令人瞩目。当他们在海量文本上训练模型时,新方法在理解长序列方面表现优于现有技术。在要求模型在长上下文中寻找特定隐藏信息的测试中(这项任务通常被称为“大海捞针”),即使上下文长度是训练期间所见长度的许多倍,新系统仍能保持近乎完美的准确度。相比之下,其他依赖固定位置规则处理方法的性能随着文本增长而迅速下降。新系统在模拟生物序列(如 DNA)以及处理图像方面也表现出了卓越的性能,在图像处理中,它学会了处理二维空间关系,而无需被明确告知如何操作。

其中一个最重要的发现是系统如何处理“注意力汇聚”问题。在标准模型中,过度关注第一个标记的倾向通常是模型试图理解数据的副作用,这有时会干扰其处理新信息的能力。研究人员表明,通过明确教导系统将第一个标记作为一种结构规则的默认焦点,实际上可以提高稳定性。这使得模型可以将第一个标记作为一个可靠的锚点,当其余文本不清晰时使用,而不会破坏其他单词的表示。这种结构与含义的分离意味着系统能够比以前更优雅地适应新的长度和语境。

研究人员还探索了当输入数据发生意外变化时,这种新方法是如何表现的。在一个实验中,他们在一个短序列上训练模型,然后将其测试在长十六倍的序列上。虽然其他方法性能显著退化,但新系统仍能保持高准确度运行。这表明,该系统已经学习了一套稳健的组织信息规则,可以应用于远超其训练数据的场景。这种高效泛化的能力是构建能够处理现实世界人类交流中开放式、变长特性的人工智能的关键一步。

在计算机视觉领域,该方法同样展现了多功能性。当应用于图像识别任务时,系统学会了理解图像不同部分之间的空间关系。它发展出一种观察相邻图像块的偏好,这种模式模仿了人类扫描视觉场景的自然方式。这使得系统即使在从未见过的分辨率下也能识别物体和场景,而这种能力在其他模型中通常难以实现,除非进行广泛的重新训练。研究人员发现,系统自发地发现了这些空间偏差,证实了该方法不仅限于文本,也可以应用于任何具有序列或空间结构的数据。

这项工作还为为什么某些行为会在大型语言模型中出现提供了更清晰的理论解释。通过将注意力框架化为一个平衡内容与学习到的预期的过程,研究人员解释了为什么模型有时在长上下文中表现挣扎,以及如何解决它。他们表明,这些系统中常见的稳定性问题并不是架构本身固有的缺陷,而是使用固定且无信息起始点的后果。通过允许系统学习自己的起始点,他们创造了一个更稳定、更可靠的基础。

这项研究并不声称已经解决了人工智能的所有问题,但它为构建更稳健的系统提供了一个强大的新工具。该方法旨在直接替换当前最先进模型中使用的注意力机制,这意味着它可以以极小的改动集成到现有软件中。作者已公开其代码,允许其他研究人员测试并基于其发现进行开发。随着领域向能够处理更长上下文和更复杂任务的模型迈进,控制和理解注意力如何分布的能力可能会成为一项标准要求。新方法提供了一种比以往更具灵活性和精确性的方式来实现这一点,为开发不仅更聪明而且更稳定、更可靠的推理系统铺平了道路。

这项工作的意义超越了仅仅提升模型的阅读或视觉能力。它为机器如何组织信息提供了一个全新的视角。通过将注意力的规则视为可以被学习和完善的东西,而非由工程师硬编码的规则,研究人员为构建能够根据特定任务需求调整其内部结构的系统打开了大门。这种从僵化规则向灵活学习的转变是人工智能发展中的重要一步,让我们离能够以人类般的轻松应对现实世界复杂性的系统又近了一步。研究结果表明,构建更强大机器的关键可能不在于使其规模更大,而在于赋予它们更好的聚焦方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →