Optimizer-Induced Mode Connectivity: From AdamW to Muon
本文表明,像 AdamW 和 Muon 这样的优化器会在神经网络中诱导出不同且通常互不连通的零损失解流形,从而揭示出模式连通性根本上取决于特定的优化器及其隐式正则化,而非损失景观的普遍属性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一片广阔的山地景观中找到最低点。这片景观代表了神经网络的“损失函数”:你所在的位置越高,模型的表现就越差;位置越低,表现就越好。
长期以来,研究人员认为,如果你训练两个不同的模型到达这片山谷的最底部(即“零损失”状态),你可以在它们之间画出一条简单、平滑的路径,而无需重新爬上山坡。这个概念被称为模式连通性(Mode Connectivity)。这就像在说:“如果两名徒步者找到了同一个山谷的底部,那么一定有一条平坦的小径将他们连接起来。”
然而,这篇论文提出了一个新问题:路径是否取决于徒步者“如何”行走?
作者引入了两种不同的“徒步风格”(优化器):
- AdamW:经典且可靠的徒步者。
- Muon:一种更新、更专业的徒步者,其移动方式不同。
以下是论文通过简单类比所揭示的发现:
1. “谱指纹”
每个模型都有一个由数字构成的独特“指纹”,称为奇异值(可以将这些值视为模型内部的“肌肉张力”或“形状”)。
- AdamW 模型往往拥有少数非常强劲的“肌肉”和许多较弱的“肌肉”(谱中的离群值)。
- Muon 模型则倾向于拥有大小大致相同的“肌肉”(更平衡、各向同性的谱)。
论文发现,如果你取两个用AdamW训练的模型,你可以在它们之间行走,且它们的“肌肉张力”保持一致。如果你取两个Muon模型,情况也是如此。它们始终停留在各自的“邻域”内。
2. 同优化器高速公路(优化器内部连通性)
论文从数学上证明,如果神经网络足够宽(拥有足够多的神经元),那么所有由AdamW找到的解都由一条平滑、低损失的路径连接。对于Muon也是如此。
- 类比:想象一片广阔平坦的草地。如果你和你的朋友都穿着同样的徒步靴(AdamW),你就可以从你的位置走到朋友的位置,而无需踩到岩石或上坡。你们始终停留在同一个“靴印”区域内。
3. 跨优化器障碍(优化器间不连通性)
这是最令人惊讶的部分。如果你试图从AdamW模型走到Muon模型,会发生什么?
- 理论:在小型、简单的网络中,作者证明了"AdamW 山谷”和"Muon 山谷”可能被一座高山脊隔开。你无法在不攀登并损失性能的情况下从一处走到另一处。它们位于解空间的不同“岛屿”上。
- 现实(大型模型):在他们的大规模实验(使用语言模型 GPT-2)中,他们发现虽然你可以将它们连接起来,但这条路径是特殊的。当你从 AdamW 走向 Muon 时,模型的“肌肉张力”(谱)并不会保持不变,而是平滑地转变。
- 类比:想象从一片松树林(AdamW)走向一片橡树林(Muon)。你不是直接瞬移,而是穿过一个过渡地带,那里的树木逐渐从松树变为橡树。路径确实存在,但它穿过了一种独特的“混合”景观,这是任何单一优化器单独都无法自然创造的。
4. “冰沙”效应(泛化能力)
论文测试了如果取一个位于 AdamW 解和 Muon 解中间位置的模型会发生什么。
- 结果:这些“混合”模型在未见过的数据(分布外泛化)上的表现往往优于原始模型。
- 类比:如果你将咖啡(AdamW)和茶(Muon)混合,你会得到一种新饮料,对某些人来说,其口感可能比单独的咖啡或茶更好。这种“混合”探索了单个优化器所忽略的景观部分。
主张总结
- 相同优化器:如果你两次使用相同的优化器,所得解由一条平滑路径连接,该路径保持模型内部结构的一致性。
- 不同优化器:如果你使用不同的优化器,在小型网络中,解可能被障碍隔开;而在大型网络中,它们则由一条平滑转变模型内部结构的路径连接。
- 益处:在这些不同优化器解之间行走,会创造出“混合”模型,使其能更好地泛化到新的、未见过的数据。
本文并未声称这适用于医疗诊断、自动驾驶或特定的未来 AI 应用。它严格聚焦于这些模型如何连接的数学几何结构,以及混合它们能改善语言模型训练中泛化能力的实证观察。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。