← 最新论文
🤖 machine learning

Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization

本文研究了 Transformer 注意力头在结构等价推理任务上的学习动态,揭示了成功的学习涉及独特的位次机制与符号机制的涌现,其中后者相比前者在长序列上的鲁棒性和泛化能力表现得更为优越。

原作者: Felipe Urrutia, Juan José Alegría, Cinthia Sanchez Macias, Jorge Salas, Cristian B. Calderon, Cristobal Rojas

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Felipe Urrutia, Juan José Alegría, Cinthia Sanchez Macias, Jorge Salas, Cristian B. Calderon, Cristobal Rojas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个 Transformer 语言模型(就像许多聊天机器人背后的 AI)就像是一个由无数微小且专业化的图书管理员组成的庞大图书馆。每个图书管理员就是一个“注意力头”(attention head),他们的工作是弄清楚在他们当前手持的那本书之外,房间里的哪本书与之相关。

这篇论文研究了这些图书管理员是如何学习工作的,以及为什么有些人在处理长篇故事时表现得更好。研究人员通过设置两个非常相似的“记忆游戏”来进行受控实验,以观察这些图书管理员的行为。

两种游戏:“数字跳跃”与“名称跳向”

研究人员创建了两个表面看起来相同但需要不同思维方式的任务:

  1. 数字跳跃(位置型): 想象一排人拿着写有字母的牌子。在队伍末尾有一个数字,比如“3”。规则是:“从这里向后数 3 个位置,并抓取你找到的那个字母。”如果数字变成“5”,你就向后数 5 个位置。

    • 机制: 这需要位置注意力(Positional Attention)。图书管理员必须忽略牌子上写的是什么,而完全专注于它们站在哪里。“后退三步”是一个位置,而不是一个名字。
  2. 名称跳向(符号型): 想象一排人拿着写有字母对(如“A-B”或“C-D”)的牌子。在队伍末尾有一块牌子写着“B”。规则是:“找到那个牌子以 B 开头的人,然后看他们牌子上的第二个字母。”

    • 机制: 这需要符号注意力(Symbolic Attention)。图书管理员必须忽略这些人站在哪里,而专注于他们的牌子写着什么。“寻找 B”无论那个人在队伍中的什么位置都有效。

训练期间发生了什么?

研究人员观察了这些模型从零开始的学习过程。他们发现了一个迷人的模式:

  • 纯粹的图书管理员: 为了精通这项游戏,图书管理员必须变得“纯粹”。他们不能处于“既能数步数又能读名字”的中间状态。他们必须完全专业化。有些成为了位置型图书管理员(擅长数步数),而另一些则成为了符号型图书管理员(擅长匹配名字)。
  • 学习曲线:
    • 数字跳跃游戏中,模型必须先学会数 1 步,然后是 2 步,接着是 3 步。它学习得很慢,循序渐进,因为它需要建立起一个由位置型图书管理员组成的链条。
    • 名称跳向游戏中,模型几乎是一次性学会了。一旦“符号型图书管理员”掌握了如何匹配名字,他们就能同时解决 1 步、2 步和 3 步的版本。

“长篇故事”问题

这里是关键发现:这些图书管理员如何处理很长的一排人?

研究人员发现,这两类图书管理员在处理长序列(更长的故事或更长的输入)时表现出巨大的差异:

  • 位置型图书管理员(数字跳跃)会迷失方向。 随着人群变长,“向后数步”的机制开始变得模糊。这就像是在一个拥挤且无尽的长廊里尝试数出“后退 100 步”;信号变得微弱,图书管理员无法准确追踪到停止的位置。随着序列变长,模型的表现会迅速下降。
  • 符号型图书管理员(名称跳向)依然敏锐。 因为这位图书管理员是在寻找一个特定的名字(比如“B”)而不是特定的距离,所以队伍的长度对他们影响不大。即使在有 1,000 人的长廊里,寻找那个拿着“B”牌子的人,也和在只有 10 人的长廊里一样容易。

“差异”测量计

为了用数学方法证明这一点,作者发明了一个概念叫做差异(Discrepancy)。你可以把它理解为一个“信心计”:

  • 高差异意味着图书管理员感到困惑,无法区分正确答案和错误答案。
  • 数学表明,对于位置型方法,这种困惑随着序列变长而迅速增长。
  • 对于符号型方法,即使序列非常长,这种困惑也保持在较低水平。

现实世界测试

最后,研究人员在大型现实世界 AI 模型(如 GPT 和 Claude)上测试了这个理论:他们给这些巨型模型提供了相同的两个游戏,但使用了更长的输入。

结果完美印证了他们的理论:

  • 当被要求在长输入下进行数字跳跃(数步数)时,这些大模型表现得非常糟糕。
  • 当被要求进行具有相同长输入的名称跳向(匹配符号)时,这些大模型依然保持了高度的准确性。

核心结论

论文得出结论:虽然现代 AI 模型非常强大,但它们有一个特定的弱点:它们在处理极长上下文时,难以将“计数”或“基于位置”的逻辑进行泛化。 然而,它们在进行“符号匹配”逻辑方面表现得更为出色。

这表明,为了让 AI 处理极长的文档或复杂的推理链,我们可能需要鼓励它使用更多的“符号化”策略(匹配概念),而不是“位置化”策略(数步数),因为前者在故事变长时要稳健得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →