A Reproducibility Study of Partial Residual Ablations in Pre-LN Transformers
这项复现性研究调查了 Pre-LN Transformer 中的部分残差消融现象,揭示了移除注意力残差会一致导致性能崩溃,而移除前馈网络残差则表现出与规模相关的恢复,并最终提出了一个跨位置路由假设来解释这些不对称性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能在进行写作、翻译和推理时,依赖于一种被称为“Transformer”的特定架构设计。这一设计的核心是深层的处理层堆栈,每一层都在精炼从前一层接收到的信息。为了防止这些深度网络在训练过程中崩溃,工程师们使用了“跳跃连接”(skip connections)。想象一条河流流经一系列瀑布;跳跃连接就像是一个分流渠,允许水流绕过瀑布并重新汇入下游的溪流。这确保了无论数据必须经过多少层,信号都不会丢失或被稀释。多年来,标准做法是在每一个处理步骤之后都包含这些旁路。但最近的一项调查提出了一个简单的结构性问题:如果我们仅仅移除其中一个旁路,会发生什么?系统是会彻底失效,还是会找到适应的方法?
一位名叫 Pratik Kumar Babariya 的研究人员试图通过构建人工智能模型并有系统地移除这些安全网来回答这个问题。他测试了两种特定的场景:一种是移除了注意力机制(attention mechanism)之后的旁路,另一种是移除了前馈网络(feed-forward network)之后的旁路。注意力机制是模型中决定句子中哪些词语彼此最相关的部分,而前馈网络则是处理和转换这些信息的部分。其目标是观察模型在失去这些特定捷径后能否生存,或者这种移除是否会导致整个学习过程崩溃。
最初在较小模型上进行的实验暗示了一个令人沮丧的结果。当研究人员移除这两个旁路中的任何一个时,模型都无法学习,其性能表现始终处于与没有旁路的模型相同的低水平。看起来这两个捷径都是同样重要的。然而,这一早期结果很可能是测量工具造成的误差。研究人员意识到,他评估模型的方式引入了随机噪声,使得无法观察到细微的性能差异。他用更严谨的设置重建了实验,使用固定的测试数据并确保每个变量都得到了控制。
当实验使用这种更干净的方法再次运行时,一种显著的不对称性出现了。移除前馈网络之后的旁路导致模型完全失败,正如最初测试所示。模型无法学习,其性能一直停留在高错误率水平。但是,当移除注意力机制之后的旁向时,模型做出了出人意料的表现:它学会了。虽然它的表现不如拥有所有捷径的完整模型那样出色,但它成功学会了处理语言,达到了远好于失败模型的性能水平。这一结果并非偶然;研究人员在不同的随机起始点下运行了八次成功的配置,在每一种情况下,模型都有效地学习了。而另一个配置的失败同样具有一致性,每次测试时都会发生。
研究人员随后探究了这种差异产生的原因。他观察到,在失败的模型中,从底层到顶层的信息流完全停止了,这种现象被称为“梯度饥饿”(gradient starvation)。这在两种失败的情况下都发生了。然而,在成功的模型中,注意力机制似乎找到了一个变通方法。由于注意力机制可以同时观察句子中的所有单词,它可以学习在不同位置之间路由信息,从而有效地为数据的流动重建了一条路径,即使在没有物理捷径的情况下也是如此。相比之下,前馈网络是孤立地处理每个单词的,无法创造这种跨连接。如果没有其旁路,它就无法恢复丢失的信息。
故事并未止于一个完美的、已解决的谜题。当研究人员将实验规模扩大到更大的模型时,结果变得不再那么清晰。虽然移除前馈旁路的模型仍然失败,但移除注意力旁路的模型显示出了学习的迹象,但其性能根据随机起始条件的不同而剧烈波动。在某些运行中,它学得很好;而在另一些运行中,它则表现挣扎。这表明,虽然适应能力是真实存在的,但随着模型变得更大、更复杂,维持这种能力变得更加困难。研究人员还发现了自己早期工作中一个重大的方法论错误:他曾尝试通过在训练过程中调整一个乘数来修复失败的模型,这使得它们看起来很成功。他后来意识到,训练算法自动补偿了这一变化,使得这种调整变成了一种错觉。通过纠正这个错误并透明地报告失败,他确保了最终结论是基于现实而非软件的人为产物。
核心发现是,人工智能大脑中的所有捷径并不都是平等的。移除连接词语之间部分的路径,允许系统生存并学习,这很可能是因为该部分系统可以自我重构以进行补偿。而移除处理单个单词部分的路径,则会导致系统彻底崩溃。这种区别在较小模型中成立,并在较大的模型中也得到了强烈的暗示,尽管较大的模型仍需要进一步的研究来确认其适应性的极限。这项工作提醒我们,在复杂系统中,连接的具体排列方式与连接本身一样重要,并且即使当一个系统看似失败时,更深入的观察也能揭示出隐藏的恢复能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。