← 最新论文
🤖 machine learning

A Controlled Study of Attention-Only Transformers

这项研究表明,前馈网络对于 Transformer 的性能并非严格必要,因为在参数量、计算量和深度相匹配的情况下,仅含注意力机制的模型(SANs)所达到的损失值与标准 Transformer 几乎完全一致,而剩余的微小差距完全归因于参数化召回能力的差异,而非架构上的局限性。

原作者: Henry Ndubuaku, Karen Mosoyan, Jakub Mroz, Noah Cylich, Satyajit Kumar, Parkirat Sandhu, Roman Shemet, Justin H Lee

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Henry Ndubuaku, Karen Mosoyan, Jakub Mroz, Noah Cylich, Satyajit Kumar, Parkirat Sandhu, Roman Shemet, Justin H Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图为机器人构建一个终极大脑。多年来,科学家们一直将两种类型的“神经元”堆叠在一起,以使这些机器人变得更加聪明。第一种类型就像是一个信使,它观察当下正在发生的事情,并决定该把注意力放在哪里。第二种类型则像是一个笔记本,用于存储从过去学到的事实和规则。机器人的大脑由一种重复的模式构建:一个信使,接着一个笔记本,然后是一个信使,再接着一个笔记本。

在人工智能领域,这些“信使”被称为注意力机制(attention mechanisms),而这些“笔记本”被称为前馈网络(FFoles/FFNs)。长期以来,大家一直认为笔记本是必不可少的。事实上,在现代机器人的大脑中,这些笔记本占据了大约三分之二的总空间(参数)。核心问题在于:这个笔记本真的必要吗? 或者说,如果我们给信使足够的空间,它能否承担所有的工作?这篇论文是一场巨大的、受控的实验,旨在探究我们是否可以只使用信使,完全不使用笔记本,来构建一个超级聪明的机器人。


大脑手术实验

来自 Cactus Compute, Inc. 的研究人员决定对一个标准的 AI 模型进行一次非常精确的“大脑手术”。他们拿出了一个标准模型,逐层地将“笔记本”(前馈网络)彻底移除,只留下“信使”(注意力机制)。他们将这种全新的、精简后的模型称为简单注意力网络(Simple Attention Network, SAN)

但棘手之处在于:你不能仅仅删除大脑的一大块区域就指望它能像以前一样工作。如果你移除了笔记本,你会发现突然多出了大量的空白空间。因此,研究人员运行了三个不同版本的实验,以观察究竟什么才是至关重要的:

  1. 相同深度(Same Depth): 他们保持层数不变,但删除了笔记本。(这使得 SAN 变得更小、更弱)。
  2. 相同计算量(Same Compute): 他们调整了规模,使得两个模型在思考时使用的电量(FLOPs)完全相同。
  3. 相同规模(Same Size): 他们利用删除笔记本后留下的空白空间,增加了更多的信使层。这是最公平的测试:“如果我们给信使与笔记本相同的总脑力,它能胜任这项工作吗?”

令人震惊的结果:笔记本并非魔法

结果令人惊讶。当他们只是删除笔记本而不给予信使更多空间时,机器人的智力显著下降。但当他们将那部分“被删除”的脑力用于构建更深的信使堆叠时,两者之间的差距几乎消失了。

在最公平的测试(匹配总规模)中,带有笔记本的标准模型与新的“仅含信使”模型几乎完全相同。两者的差异仅为 0.006 nats(一个衡量预测错误程度的单位)。换句话说,性能差异仅为 0.27%。其微小程度足以说明,如果你使用不同的随机种子运行实验,结果在万分之一的精度内也是可重复的。

论文得出结论,对于他们使用的数据类型(一种侧重推理的合成语料库)而言,“笔记本”并不是一个神奇且不可替代的组件。它仅仅是一种存储信息的方式。如果你给“信使”足够的深度,它本身就可以存储这些信息。

微小的差距隐藏在哪里

既然它们几乎一样,为什么差距不是完全为零呢?研究人员深入挖掘,试图找出“仅含信使”的模型在何处表现不佳。他们发现问题并非无处不在,而是非常具体。

仅含信使的模型在处理那些上下文(提供的故事或文本)无法为其提供任何线索的问题时,表现稍逊一筹。

  • “基于上下文”的优势: 当答案隐藏在提供的文本中时(例如在维基百科文章中寻找事实),仅含信使的模型实际上表现得更好或持平。
  • “记忆”的缺失: 只有当模型必须凭空提取事实——即在文本没有提供任何线索时的纯记忆提取时,才会出现微小的差距。

你可以这样理解:信使擅长说:“嘿,我看到文本里有个线索,让我们看那里!”但笔记本则稍微擅长说:“我记得这个事实,尽管这里没有任何线索。”研究人员发现,仅含信使的模型仍然可以记忆事物,但它必须更努力地将其存储在“注意力”层中,而不是专门的“笔记本”层中。

大脑究竟是如何运作的

论文还通过“拆解”模型内部结构,观察了这些模型是如何学习的。他们发现了一个关于大脑增长的迷人节奏:

  1. 路由机制(Routing)过早结晶: 决定“看向哪里”的部分(路由)在训练的前四分之一阶段就已确定,之后便保持固定。
  2. 内容生长缓慢: 实际“存储”信息的部分在整个训练过程中会持续增长并变得更加复杂。

当他们移除笔记本时,“存储”的任务并没有消失,只是转移了。信使的输出层接管了存储事实的工作。这就像如果你从办公室里撤走了文件柜,员工们(信使)就会开始把文件随身带在口袋里。这行得通,但是一种略有不同的组织方式。

秘诀:归一化

其中一个最实用的发现是,如何防止这些深层的“仅含信使”大脑崩溃。研究人员发现,一种被称为 QK-归一化(QK-normalization) 的特定技巧是绝对关键的。如果没有它,深层的仅含信使模型将会崩溃并停止学习。事实证明,维持大脑稳定的并不是“笔记本”,而是这种特定的归一化技术。

总结

这篇论文并不是说笔记本是没用的。它说的是,对于他们测试的这类侧重推理的数据,笔记本并不是智能的一个基本要求。如果你有有限的脑容量预算,你可以用更多的信使层来交换笔记本,并获得几乎相同的结果。

只有在模型需要回忆与当前文本无关的事实时,笔记本才会真正展现出优势。但即便如此,这种差异也非常微小。主要的启示是,“信使”是非常强大且灵活的,只要给予足够的深度,它就能胜任“笔记本”的工作。两者之间的差距如此之小,以至于几乎可以忽略不计,这证明了 Transformer 的架构比我们想象的更加灵活。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →