Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers
本文提出了一种与对称性相容的优化器设计原则,该原则使梯度更新规则与不同参数块(如嵌入层、语言模型头、SwiGLU 多层感知机以及混合专家路由器)的特定等变性结构相一致,并通过大量预训练实验证明,这些定制化优化器在最终验证损失和训练稳定性方面始终优于 AdamW。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个巨大且复杂的机器人学习一门新语言。这个机器人由许多不同的部分组成:一个词汇词典、一个用于处理句子的“大脑”,以及一个用于决定咨询哪位专家的决策系统。
多年来,教导这个机器人的标准方法就像使用一把通用的、一刀切的画笔。你将画笔蘸上“学习颜料”,然后不管机器人的各个部分实际功能如何,都一视同仁地涂抹在它的每一个部位。这种方法(称为AdamW)将机器人“大脑”中的每一个微小数值都视为独立、孤立的点。这种方法虽然勉强可行,但它忽略了一个事实:机器人的某些部分实际上是结构化的网格、表格或相互连接的网络。
本文认为,我们应该停止用同一把画笔处理所有事情。相反,我们应该使用专用工具,这些工具要匹配机器人每个部分的特定形状和对称性。作者将这一理念称为**“对称兼容原则”**。
以下是他们利用简单类比进行的分解说明:
1. 问题:“坐标-wise"的错误
大多数现有的优化器将机器人的“大脑”视为一长串扁平的数字列表。想象你有一张城市的照片。一种“坐标-wise"的优化器试图通过独立地、逐个地调整每个像素的亮度来修复这张照片。它没有意识到建筑物是一个连接的结构,或者天空具有平滑的渐变。它忽略了数据的几何结构(形状和结构)。
2. 解决方案:让工具匹配工作
作者指出,神经网络的不同部分具有不同的“对称性”(关于它们如何在不被破坏的情况下进行重排的规则)。优化器应当尊重这些规则。
词典(嵌入层与语言模型头部):
- 形状: 将词汇表想象成一个巨大的电子表格,其中行是单词,列是特征。你可以打乱单词(行)的顺序而不改变含义,但你不能随意旋转特征(列)。
- 旧方法: 通用优化器将每个“单词 - 特征”对视为一个独立的点。
- 新方法: 本文建议使用**“行范数”或“右谱”**更新。
- 类比: 与其给每个像素上色,不如根据每个单词的活跃程度来调整整行(单词)的亮度。如果一个单词很少被使用,就给它一个轻微的推动;如果它经常被使用,就给它一个更强的推动。这尊重了单词作为列表中独立项的事实。
大脑的隐藏层(SwiGLU MLPs):
- 形状: 这些层拥有可以相互交换的“神经元”。如果你将神经元 A 与神经元 B 交换,数学运算依然以同样的方式工作。
- 新方法: 本文建议使用**“行感知”或“列感知”**更新。
- 类比: 想象一个工人团队。如果你交换两名工人的名字,团队依然能正常运作。优化器意识到了这一点,并一起调整整个团队的努力,而不是将每个工人视为孤立的个体。
专家交换机(MoE 路由器):
- 形状: 在“专家混合”模型中,路由器决定呼叫哪位专家。专家是可互换的(如果你交换专家 1 和专家 2 的名字,它们是一样的),并且路由器具有“共享偏移”(给所有分数加上一个常数不会改变选择)。
- 新方法: 本文建议使用**“中心化行范数”或“左谱”**更新。
- 类比: 想象一位经理给一群相同的专家分配任务。经理并不在乎谁是“专家 1"或“专家 2"。新的优化器确保经理将团队作为一个整体来对待,调整他们的集体工作量,而不会被任意的标签所迷惑。
3. 结果:一个更好的机器人
作者通过训练几种不同类型的语言模型(如 Qwen、Gemma 和 OLMoE)来测试这一想法。他们用这些针对模型特定部分的专用、对称感知的工具,替换了通用的“一刀切”优化器。
发生了什么?
- 性能提升: 在几乎每一项测试中,这个机器人学习得更快,并且最终比使用通用方法训练的机器人拥有更低的错误率(更好的验证损失)。
- 稳定性: 训练过程更加平滑,错误值的突然尖峰更少。
- 可扩展性: 在更大的模型和拥有巨大词汇量的模型中,这些优势尤为明显。
核心结论
本文并不声称旧方法“坏了”或者它将不再被使用。相反,它论证了几何结构至关重要。正如你不会用锤子去拧灯泡一样,你也不应该对复杂神经网络的每一个部分都使用通用的、基于坐标的优化器。
通过设计“学习工具”以匹配其正在更新的大脑部分的特定形状和对称性,我们可以构建更好、更高效、更稳定的 AI 模型。这是一种转变:从将 AI 视为一堆随机数字,转变为将其视为一个结构化的几何对象。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。