← 最新论文
💻 computer science

Explaining Attention with Program Synthesis

本文提出了一种可扩展的流水线,该流水线利用程序合成技术,通过人类可读且可执行的 Python 程序来近似 Transformer 注意力头,证明了这些符号代理能够准确地重现注意力模式,并在对模型性能影响极小的情况下,取代显著比例的神经注意力头。

原作者: Amiri Hayes, Belinda Li, Jacob Andreas

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Amiri Hayes, Belinda Li, Jacob Andreas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个现代语言模型(比如驱动这次对话的 AI)就像一个规模宏大、极其复杂的管弦乐团。在这个乐团内部,有成千上万名乐手(被称为“注意力头”,attention heads),他们演奏着不同的乐器。每一位乐手都会倾听其他乐手的演奏以及乐谱(输入文本),从而决定何时该奏响强音,何时该转为弱音,以及该击打出什么样的音符。

长期以来,科学家们一直试图理解每一位乐手究竟在做什么,但这些解释总是很模糊。他们可能会说:“这位乐手似乎很喜欢名词,”或者“那位乐手专注于句子的开头。”这些描述就像是通过说“这听起来很开心”或“这听起来很忧伤”来描述一场交响乐。这很有帮助,但它并没有告诉你音乐究竟是如何被制造出来的。

新方法:编写乐谱

这篇论文提出了一种理解这个乐团的不同方式。研究人员不再仅仅是描述音乐,而是尝试编写实际的乐谱(可执行代码),来告诉每一位乐手具体该做什么。

以下是他们操作的具体步骤:

  1. 观察乐手: 首先,他们观察 AI 模型阅读数千个句子的过程,并记录下每一位“乐手”(注意力头)是如何做出反应的。他们记录了每一位注意力头都在关注哪些词汇。
  2. 询问“影子作家”: 他们将这些记录交给另一个非常聪明的 AI(一个“程序合成”智能体),让它编写一个简单的 Python 程序,能够模拟这些反应。可以把这想象成要求一位影子作家去观察一位乐手的表演,并写下他所遵循的精确规则,例如:“如果前一个词是句号,则观察下一个词。如果该词是一个名字,则观察动词。”
  3. 测试影子作家: 他们将影子作家生成的代码运行在新的句子上,以观察其是否与原始 AI 的行为相匹配。他们使用了一种评分系统(类似于相似度测试)来查看代码与真实情况的接近程度。
  4. 大替换: 这是最令人兴奋的部分。他们将原始复杂的神经“乐手”从乐团中移走,并用他们刚刚编写的简单、人类可读的代码取而代代之。他们想看看乐团是否仍能保持原有的节奏。

他们的发现

结果非常成功:

  • 许多乐手遵循简单的规则: 他们发现,AI 的大量注意力头实际上都在遵循非常逻辑化的符号规则。例如,有些头仅仅被设定为“观察句子的第一个词”,而另一些则是“寻找逗号”或“寻找开启新句子的单词”。
  • 乐团依然在演奏: 当他们用这些简单的代码脚本替换掉高达 25% 到 40% 的复杂神经乐手时,乐团(AI 模型)几乎没有出现任何失误。模型回答问题或理解故事的能力几乎保持不变。
  • 更大的模型更容易解码: 有趣的是,模型越大、越先进(例如 Llama-3B),就越容易找到这些简单的代码规则。看起来,随着模型规模的扩大,它们变得更加有序,每一位乐手都有一个非常具体且易于理解的任务。

总结

这篇论文表明,我们并不总是需要将 AI 视为一个神秘的“黑盒”。对于这些模型运作方式中的很大一部分,我们实际上可以用简单的、人类可读的计算机代码来取代复杂的、难以解释的数学运算。

这就像是意识到一个复杂的魔术其实并不是真正的魔法;它只是一套特定的指令,任何人都可以写下来并遵循。研究人员证明了,对于现代 AI 的许多组成部分,我们可以将“魔法”替换为“指令”,而不会破坏整场演出。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →