← 最新论文
🤖 machine learning

SG-Blend: Learning an Interpolation Between Improved Swish and GELU for Robust Neural Representations

本文介绍了 SG-Blend,这是一种逐层自适应激活函数,它通过学习一种新型偏置修正 Swish 变体(SSwish)与 GELU 之间的最优插值,证明了其相比于标准的固定激活函数,能够降低训练方差并在自然语言处理和计算机视觉任务中展现出卓越的性能。

原作者: Gaurav Sarkar, Syed Affan Daimi, Jay Gala, Subarna Tripathi

发布于 2026-09-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Gaurav Sarkar, Syed Affan Daimi, Jay Gala, Subarna Tripathi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

深度学习,即现代人工智能背后的技术,依赖于由层层处理信息的庞大数学路径网络。为了运行,这些网络需要被称为“激活函数”的特殊开关。这些开关决定了多少信息可以从一层传递到下一层,从而塑造了网络学习复杂模式的能力。多年来,研究人员一直依赖于几种标准的开关,例如 Swish 和 GELU,它们作为几乎所有现代 AI 模型的默认设置。然而,这些标准开关是僵化的;它们对网络中的每一层都应用完全相同的形状和行为,无论该层处于过程的开始、中间还是结尾。这种“一刀切”的方法产生了一个问题:虽然网络在平均水平上可能表现良好,但其性能会根据其随机初始化方式而发生剧烈波动,使得人们难以一致地信任或复现结果。

一个研究团队提出了一种名为 SG-Blend 的新解决方案,这是一种灵活的开关,允许神经网络的每一层都在两种不同行为之间找到其完美的平衡。这种新方法并没有强迫每一层使用相同的僵化设置,而是让每一层学习它更倾向于哪种类型的开关。研究人员发现,通过赋予每一层这种微小的自由度,整个网络变得显著更加稳定。在语言模型测试中,这种方法比标准方法降低了 42% 的结果不可预测性,同时也实现了最高的准确率得分。关键的发现在于,最佳性能并非来自于选择一个单一的完美开关,而是来自于允许网络在两个知名选项之间进行平滑的插值或融合,让早期层与深层表现得有所不同。

这项工作的核心思想是,当前激活函数的僵化本质与现代神经网络的构建方式存在不匹配。在旧的网络中,一种不同类型的归一化有助于平滑信息流,掩盖了这些固定开关的缺陷。但在用于语言和视觉的新型、更深层的架构中,这种平滑效应消失了。没有了它,固定的开关会导致信息流在经过神经网络的许多层时变得不稳定。研究人员观察到,这种不稳定性导致了高方差,这意味着如果你用略微不同的随机起点运行两次相同的训练实验,你可能会得到两个截然不同的结果。一次运行可能会产生一个高度准确的模型,而下一次可能无法有效地学习,仅仅是因为固定的开关无法适应每一层的特定需求。

为了解决这个问题,该团队引入了一种结合了修正版 Swish 开关和 GELU 开关的新机制。他们并非简单地将两者随机混合,而是创建了一个系统,使网络中的每一层都拥有一套自己的小型可调节旋钮。一个旋钮控制该层向 Swish 风格倾斜的程度,另一个控制过渡的锐度,第三个则调整信号的基准水平。在训练过程中,网络会自动学习如何设置这些旋钮。研究人员发现,网络自然会进入一种状态,即大多数层都选择一个中间地带,大致等量地融合这两种风格。这表明,纯粹的 Swish 或纯粹的 GELU 并不是对每个部分都完美的答案;相反,最优状态是一个随层而略微变化的定制混合体。

该方法的成果在多个不同任务中得到了衡量。在一项涉及电影评论情感分析的研究中,这种新方法达到了现有最佳模型的峰值准确率,但其表现出的稳定性远高于后者。虽然标准方法在不同的随机起始点之间显示出巨大的差距,但新方法使结果保持紧密聚集。这种一致性对于实际应用至关重要,因为这意味着开发者可以训练一次模型,并确信它会表现良好,而不是必须进行数十次实验来寻找一个幸运的起点。此外,在针对预测句子中下一个词的大规模语言模型进行测试时,新方法实现了所有测试模型中的最低错误率,证明了其益处已超越了简单的分类任务,扩展到了复杂的生成式模型。

研究人员还通过观察网络内部信号的流动,调查了为什么这种融合如此有效。他们发现,新方法维持了从第一层到最后一层稳定且均匀的信息流,避免了使用固定开关时经常出现的峰值和跌落。通过观察新方法的行为恰好位于其两个组成部分的行为之间,有效地借鉴了两者的优点而未引入新的弱点,这种稳定性得到了证实。有趣的是,网络还学会了针对早期层与后期层以不同的方式调整信号的基准水平,这是固定开关无法实现的细微差别。这种能够针对每个层单独调整其内部状态的能力,似乎是提高稳定性和性能的秘诀。

然而,这种灵活性也带来了成本。由于新方法需要为每一层计算两种不同的开关行为并进行融合,因此它需要更长的训练时间。研究人员测量了这种开销,发现使用这种新方法训练模型比在相同硬件上使用标准 GELU 开关大约要多花 33% 的时间。虽然网络学习得更可靠且产生了更好的结果,但所需增加的时间对于那些需要快速训练模型或在有限计算资源下工作的人来说是一个重要的考量因素。团队承认了这种权衡,指出减少方差和提高准确率带来的收益必须与达到这些结果所需的增加的时间和计算能力进行权衡。

尽管需要额外的时间,但这些发现表明了我们对神经网络设计思考方式的转变。SG-Blend 的成功表明,激活函数那种僵化的、“一刀切”的方法可能已成为过去。通过允许网络学习自身的内部设置,研究人员可以构建出不仅更准确,而且更稳健、更可预测的模型。这项研究证明,通往更优人工智能的路径可能不在于寻找一个单一的、完美的数学公式,而在于创造出足够灵活的系统,使其能够根据手头任务的具体需求来调整自身的内部机制。这种方法为未来的研究提供了一个充满前景的方向,特别是对于驱动现代语言和视觉技术的那些大型、复杂的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →