← 最新论文
🤖 machine learning

Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks

本文表明,虽然标准 Transformer 在特定任务中很少是最优的,但通过优化其非线性特性可以发现,高度任务特定的架构能显著提高在算法任务上的性能,而更具通用兼容性的设计在语言和代码领域仅能带来适度的提升。

原作者: Damien Teney, Liangze Jiang, Hemanth Saratchandran, Simon Lucey

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Damien Teney, Liangze Jiang, Hemanth Saratchandran, Simon Lucey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教会一个机器人如何思考。长期以来,科学家们一直使用着一种基本的蓝图来构建这些机器人,称之为“Transformer”。你可以把 Transformer 想象成一把万能的瑞士军刀:它拥有一套特定的工具(数学函数),这些工具在处理从写诗到翻译语言的几乎所有任务时,表现得都出奇地好。因为这种设计应用广泛,许多人开始认为它可能是应对所有工作的“完美”工具,并且认为提高结果的唯一方法就是把机器人做得更大,并喂给它更多的数据。

然而,这里有一个陷阱。仅仅因为一把瑞士军刀可以开瓶盖和割绳子,并不意味着它是这两项工作的“最佳”工具。专门的开瓶器开瓶更快,而锋利的厨刀割绳子更利索。在人工智能领域,这些“最佳工具”被称为归纳偏置(inductive biases)。你可以把归纳偏置看作是机器人的天性或内置的捷径,能帮助它快速学习特定类型的模式。科学家们正在问的一个大问题是:Transformer 的这种“瑞士军刀”式的本能真的是处理每项任务的最佳选择吗?还是我们正在强迫它去做一些它并非天生设计的任务?

这篇题为《Transformer 真的能包揽一切吗?》的论文旨在寻找答案。研究人员不仅仅是在猜测;他们设计了一个聪明的实验,看看是否可以为特定工作设计一种“定制工具”。他们采用了标准的 Transformer,并将其核心的“思考”部分(决定如何处理信息的非线性函数)替换成了空白板。然后,他们利用一种特殊的训练方法(这种方法可以防止机器人仅仅是死记硬背答案),让计算机针对特定任务(如电子游戏或数学问题)学习出最完美的形状。一旦找到了这个完美的定制形状,他们就将其固定下来,并测试这个新设计在其他任务上的表现如何。

实验结果既让人“惊叹”,也让人“唏嘘”。当研究人员测试这些定制设计在算法任务(例如教机器人做数学题、记忆数字列表或检查括号是否平衡)上的表现时,结果非常显著。定制机器人学习这些任务的速度快了 2 到 3 倍,表现得更加稳定(不会随机出错),并且能够泛化到它们从未见过的更长序列上。然而,这里有一个巨大的权衡:这些定制设计极其“挑剔”。一个针对数学优化的机器人处理列表记忆的能力很差,反之亦然。事实证明,对于这些基于规则的逻辑任务,标准的 Transformer 其实相当笨拙,而且对于一个数学问题而言“完美”的工具,对另一个数学问题却是毫无用处的。

在观察语言和代码时,情况则有所不同。当研究人员尝试优化机器人以编写故事、莎士比亚剧作或计算机代码时,定制设计表现得比标准设计略好,但提升幅度很小且表现稳定。更重要的是,这些用于语言的定制设计具有更强的灵活性;一个针对英语优化的机器人仍然可以相当好地处理计算机代码。这表明,对于语言任务,标准的 Transformer 已经非常接近于一个“局部最优解”——即一个很难通过大幅改动来超越的极佳状态。

最终,这篇论文表明,虽然 Transformer 是一个出色的通用工具,但它并不是解决所有问题的完美方案。对于严格的逻辑任务(如数学和算法),标准设计远非最优,我们可能需要为这些工作构建截然不同的专业化机器人。对于语言,标准设计已经足够优秀,虽然我们可以对其进行微调以使其稍好一些,但我们并没有错过什么巨大的潜在提升空间。其核心启示是:不存在一种能完美应对所有人类技能的“万能架构”;有时,为了获得最佳结果,我们需要停止试图强迫一种工具包揽一切,转而为特定的工作设计合适的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →