← 最新论文
🤖 machine learning

HORST: Composing Optimizer Geometries for Sparse Transformer Training

本文介绍了 HORST,一种模块化优化器,它通过双曲镜像映射将非交换算子步骤进行组合,从而融合自适应方法的稳定性与 L1L_1 稀疏性偏差,在视觉和语言任务的稀疏 Transformer 训练中显著优于 AdamW。

原作者: Tom Jacobs, Rohan Jain, Rebekka Burkholz

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Tom Jacobs, Rohan Jain, Rebekka Burkholz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《HORST:为稀疏 Transformer 训练组合优化器几何结构》的解释,已转化为通俗易懂的语言并辅以生动的类比。

核心难题:笨重的“AI"

想象你建造了一个巨大且极其聪明的机器人(一个Transformer)。它能写故事、翻译语言并识别图像。然而,这个机器人过于沉重和庞大,以至于运行它需要一个巨大的仓库(巨大的内存)和一个庞大的发电厂(巨大的计算成本)。

为了让这个机器人变得实用,我们需要剔除赘肉。我们要移除不必要的肌肉和齿轮(权重),使其变得轻便且快速。这被称为稀疏化

问题在于,当我们尝试修剪这种特定类型的机器人时,它往往会分崩离析,失去其智能。为什么?因为用来教导机器人的“训练师”(即优化器)无意中教导它变得过于平衡。

两位训练师:“均衡者”与“选择者”

论文指出,训练这些机器人的方式产生了一种隐藏偏差。这就像两位不同的教练在教导一名运动员:

  1. “均衡者”教练(标准优化器,如 AdamW):

    • 工作原理: 这位教练认为,为了保持稳定和安全,每块肌肉的大小应该大致相同。如果某块肌肉变得太大,教练就会把它缩小;如果另一块变得太小,教练就会把它增大。
    • 结果: 机器人最终拥有一个每一部分都略微活跃的身体。它非常稳定,但很沉重。没有“零”肌肉。你无法轻易切除任何部分,因为每部分都在做一点点工作。
    • 论文术语: 这是一种LL_\infty偏差(万物均衡)。
  2. “选择者”教练(镜像下降/稀疏性偏差):

    • 工作原理: 这位教练信奉专业化。他们希望机器人挑选出几块超级强壮的肌肉,并将其余部分完全关闭。他们迫使机器人将所有能量集中在极少的部分上。
    • 结果: 机器人变得非常轻便且稀疏。然而,如果你使用这位教练,机器人可能会在训练过程中变得不稳定或崩溃,因为它过于激进。
    • 论文术语: 这是一种L1L_1偏差(质量集中)。

冲突所在: 标准的 AI 训练使用“均衡者”,因为它很稳定。但为了让 AI 变小(稀疏),我们需要“选择者”。你不能简单地更换教练:“选择者”对于复杂的机器人来说风险太大,而“均衡者”则不允许你剔除赘肉。

解决方案:“组合式”教练(HORST)

作者 Tom Jacobs 及其团队意识到,你不必只选择一位教练。你可以创建一个混合训练方案,同时使用两者,但遵循非常特定的顺序。

他们将这种新方法称为HORST(Robust Sparse Training 的双曲算子)。

类比:雕塑家与凿子
想象你正在从一块巨大的大理石块(神经网络)中雕刻一尊雕像。

  • 步骤 1(均衡者/Adam): 首先,你使用一把宽而平的工具来磨平粗糙的边缘,并确保雕像直立而不摇晃。这保持了结构的稳定性。
  • 步骤 2(选择者/双曲镜像): 紧接着在打磨之后,你使用一把锋利、精确的凿子来凿去多余的石头,迫使形状变得纤细且稀疏。

关键秘诀: 顺序至关重要!

  • 如果你先凿刻再打磨,打磨工具会填补你刚刚凿出的孔洞。稀疏性就会消失。
  • 如果你先打磨再凿刻,凿子就能在稳定的形状上发挥作用,成功去除多余的重量。

论文从数学上证明,这种特定的顺序(稳定步骤 \rightarrow 稀疏步骤)允许机器人在变得极其轻便的同时保持稳定性。

他们的发现(结果)

团队在两种类型的机器人上测试了这种新的“组合式教练”(HORST):

  1. 视觉 Transformer: 观察图片的机器人(如识别猫或汽车)。
  2. 语言 Transformer: 理解文本的机器人(如撰写本摘要的机器人)。

结果:

  • 当他们尝试削减机器人 80% 到 90% 的权重(使其非常稀疏)时,标准教练(AdamW)导致机器人表现极差。它忘记了如何看或说话。
  • HORST 教练则让机器人在削减了大部分权重后,性能仍几乎与完整、沉重的版本相当。
  • 简单来说:HORST 找到了一种方法,使机器人变得微小而不破坏其大脑。

总结

这篇论文解决了一个谜题:“我们如何在使 AI 模型变小的同时不让它们变笨?”

  • 旧方法: 使用稳定的训练师,但它不允许你让模型变小。
  • 新方法(HORST): 按正确的顺序结合稳定训练师与稀疏性训练师。
  • 结果: 你获得了一个轻量级、高效的 AI,即使移除了其 90% 的部件,它仍能完美工作。

作者并没有发明一种新的剪除权重的方法(如剪枝);他们发明了一种新的训练模型的方法,使得权重自然地想要被剪除,而模型在此过程中不会分崩离析。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →