← 最新论文
💬 NLP

Characterizing the Expressivity of Local Attention in Transformers

本文通过证明在正则语言上,通过引入第二个时间算子严格扩展了模型的表达能力,为 Transformer 中局部注意力的质量提升提供了正式的理论解释,这一发现得到了实验的佐证,即混合全局 - 局部架构优于仅全局模型。

原作者: Jiaoda Li, Ryan Cotterell

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaoda Li, Ryan Cotterell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个 Transformer 模型(现代 AI 聊天机器人背后的“大脑”)是一位超级智能的读者,试图逐字理解一个故事。为了理解当前的词,这位读者需要回顾它之前的词。

本文研究了这位读者为了做到最好,应该回顾多远

回顾的两种方式

作者比较了读者收集信息的两种主要策略:

  1. 全局注意力(“图书馆借书卡”):
    这是标准方法。读者可以查看故事中迄今为止写下的每一个词,从第一个词一直到当前词的前一个词。

    • 弊端: 随着故事变长,读者必须翻阅越来越多的页面。这变得缓慢且昂贵(二次方成本)。
    • 擅长之处: 它非常擅长记住故事的开头以理解结尾。这就像拥有整本书的完美记忆。
  2. 局部注意力(“便利贴”):
    这是一种捷径。读者只被允许查看当前词之前的一小段固定窗口的词(例如,最后 5 个词)。

    • 弊端: 它会忘记那个小窗口之前发生的一切。
    • 令人惊讶的是: 尽管这似乎是一种更“愚蠢”的阅读方式(忽略大部分文本),但研究人员发现,使用这种方法模型往往比那些查看所有内容的模型表现更好且更快。本文提出了一个问题:为什么忽略大部分文本实际上会有所帮助?

读者的“逻辑”

为了回答这个问题,作者将 AI 不仅仅视为一台数学机器,而是视为一个逻辑谜题求解器。他们使用一种称为线性时序逻辑的系统(一种描述时间和顺序规则的方法)来精确描绘每种读者可以解决哪些类型的模式。

他们发现,这两种注意力方法就像两种不同的专用工具

  • 全局读者(过去算子):
    这位读者是擅长识别依赖于句子开头的模式。

    • 类比: 它可以轻松回答:“这句话是否以单词'The'开头?”或者“我们是否在很远的开头看到了单词'cat'?”
    • 局限性: 它难以处理严格依赖于句子结尾的模式(例如“这句话是否以句号结尾?”)。
  • 局部读者(昨天算子):
    这位读者是擅长识别依赖于直接过去的模式。

    • 类比: 它可以轻松回答:“这句话是否以单词'the'结尾?”或者“单词'dog'是否紧接在这个词之前出现?”
    • 局限性: 它无法记住句子的开头。如果规则依赖于第一个词,这位读者就会失败。

重大发现:它们是最佳搭档,而非对手

本文证明,这两位读者是互补的。其中一个并非另一个的“较弱”版本;它们擅长不同的事情。

  • 如果你只使用全局读者,你会错过直接过去的细微细节。
  • 如果你只使用局部读者,你会错过从开头开始的全局图景。

魔法解决方案:混合团队
作者表明,如果你将它们结合起来——赋予模型一些“眼睛”去查看整个故事(全局),同时赋予一些“眼睛”去 intensely 关注最后几个词(局部)——你就能得到最强大的读者

  • “窗口为 1"的惊喜:
    最惊人的发现是关于局部窗口的大小。你可能会认为查看最后 10 个词比只查看最后 1 个词更好。
    • 本文的主张: 不。 最强大的局部注意力实际上是只查看紧挨着的最后一个词(窗口大小为 1)。
    • 为什么? 只查看直接的前驱词,能为模型提供最精确的“昨天”信息。将窗口扩大到 2、4 或 10 个词实际上会稀释这种能力,使模型在识别某些模式时表现更差。

现实世界的证明

作者不仅做了数学推导;他们还进行了实验:

  1. 形式语言测试: 他们给模型出谜题(例如“找出所有以'ab'结尾的字符串”)。

    • 仅使用全局的模型在“以……结尾”的谜题上失败了。
    • 仅使用局部的模型在“以……开头”的谜题上失败了。
    • 混合模型(全局 + 大小为 1 的局部) 完美地解决了所有问题,即使是在比训练时长得多的字符串上也是如此。
  2. 真实文本(WikiText-2): 他们在实际的英语文本上测试了这一点。

    • 带有“窗口为 1"的混合模型始终写出了更好、更连贯的文本(更低的“困惑度”),优于那些只查看所有内容或只查看大窗口的模型。

结论

本文解决了一个谜团:局部注意力不仅仅是一个节省计算机资源的廉价技巧;它实际上为 AI 的“大脑”增添了一种新的“超能力”。

通过结合“长程记忆”(全局)与“高度专注的短期记忆”(局部,特别是只查看最后一个词),模型变得比单独使用任何一种方法都要严格更聪明。这就像拥有一位知晓世界完整时间线的历史学家,同时也拥有一位痴迷于你脚下脚印的侦探。在一起,他们可以解决任何案件。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →