← 最新论文
💬 NLP

How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability

本文通过基于训练梯度动力学推导出的大词元、词元可互换性及上下文映射的复合闭式表达式,为变换器如何学习语义关联提供了机制性解释。

原作者: Shawn Im, Changdae Oh, Zhen Fang, Sharon Li

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Shawn Im, Changdae Oh, Zhen Fang, Sharon Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将 Transformer(现代 AI 聊天机器人背后的“大脑”)视为一本巨大的空白笔记本。当我们开始训练它时,页面是空白的。你所询问的这篇论文提出了一个简单却深刻的问题:这本笔记本如何仅通过阅读数百万个句子,就学会将“鸟”和“飞”这样的词联系起来?

作者没有去观察最终成型的复杂 AI,而是决定放大观察学习的最初几个瞬间。他们使用数学上的“放大镜”,审视 AI 在开始更新其记忆时所采取的最初几步

以下是他们发现的拆解,使用了简单的类比:

1. “第一步”捷径

训练 AI 就像尝试预测句子中的下一个词。通常,AI 更新其记忆背后的数学极其混乱且复杂。

作者意识到,在最初阶段,AI 并不需要执行复杂的微积分运算。它只需要遵循数据中最强、最明显的信号。他们称之为“主导项”。这就像一名徒步者开始攀登一座高山。在起步阶段,路径清晰且笔直。只有到了后来,随着他们爬得更高,路径才变得曲折复杂。作者证明,在相当长的一段时间内,AI 的“记忆权重”都紧紧跟随那条简单、笔直的初始路径。

2. 三个构建模块

该论文揭示,AI 的记忆并非随机的混乱。相反,它是由堆叠三种特定类型的“乐高积木”(作者称之为基函数)构建而成的。这些积木直接源自 AI 所阅读文本的统计数据:

  • “下一个词”模块(双词映射):

    • 类比: 想象一个孩子学习到"The"后面几乎总是跟着像"cat"或"dog"这样的名词。
    • 作用: 这个模块简单地记录:“如果你看到词 A,下一个最可能出现的词 B 是什么?”它捕捉简单、直接的关联。
  • “可互换”模块(互换性映射):

    • 类比: 想想同义词词典。如果你能在句子中将"car"替换为"truck"而不破坏语法,它们就是“可互换的”。
    • 作用: 这个模块学习某些词扮演相同的角色。如果"red"通常描述"car",而"fast"也描述"car",这个模块帮助 AI 意识到"red"和"fast"可能是相关的,因为它们都与相同的词共现。它根据词的功能而非仅仅是紧邻的邻居来对词进行分组。
  • “上下文”模块(上下文映射):

    • 类比: 想象阅读一个关于“鱼”的故事。即使"pond"这个词没有紧挨着"fish",故事前面可能会提到"water"、"lake"或"boat"。
    • 作用: 这个模块在句子中向后看得更远。它学习到,如果一个词出现在特定的上下文中(例如关于自然的故事),它很可能与该上下文中的其他词相关联,即使它们相距甚远。

3. 它们如何协同工作

该论文表明,AI 内部的“权重”(决定其思考方式的数字)仅仅是这三个模块的组合

  • 输出层(负责猜测下一个词的部分)主要是下一个词模块。这是 AI 在说:“基于我刚刚看到的,接下来是什么?”
  • 注意力层(负责决定关注什么的部分)是可互换模块和上下文模块的混合。这是 AI 在说:“我看到了‘鱼’这个词。我应该回看‘池塘’这个词,因为它们经常出现在类似的故事中,即使它们没有紧挨着。”

4. 证明:它确实有效

作者不仅写了方程;他们在真实的 AI 模型上测试了这一点。

  • 他们在儿童故事数据集上训练了一个小型 AI。
  • 他们将 AI 实际学到的记忆与他们的数学公式进行了比较。
  • 结果: 匹配度极高(在某些情况下相似度超过 99%)。即使当他们观察一个巨大的现实世界 AI(Pythia-1.4B)时,同样的模式依然成立。AI 确实正在使用这三个简单的统计构建模块来组织其记忆。

核心启示

该论文认为,我们不需要将 AI 视为一个神秘地“理解”语言的“黑盒”。相反,在其核心,它只是通过以下方式在统计上组织世界

  1. 记录什么通常跟随什么。
  2. 将执行相同工作的词分组。
  3. 链接共享背景故事的词。

通过理解这三条简单的规则,我们终于可以看到机器如何学会将“鸟”与“飞”联系起来,将“国家”与“首都”联系起来。这不是魔法;这是一种非常结构化的方式来总结它所阅读的文本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →