← 最新论文
💻 computer science

Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws

本文表明,优化器的选择从根本上改变了 Transformer 模型的谱缩放定律,揭示出如 Muon 之类的优化器在难以学习的场景中相比 AdamW 能显著更有效地利用谱容量,从而确立了优化作为与架构设计相抗衡的关键且独立的表征缩放维度。

原作者: Nandan Kumar Jha, Brandon Reagen

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Nandan Kumar Jha, Brandon Reagen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在建造一座庞大的图书馆(大型语言模型)来存储和检索人类知识。你拥有图书馆书架的蓝图(架构),还有一位负责整理书籍的图书管理员(优化器)。

多年来,研究人员一直认为,只要把图书馆建得更大(增加更多书架/参数),并喂给它更多的书籍(数据),图书管理员的工作就会以可预测的方式自动变得更好。他们假设,只要图书管理员在履行职责,其类型并不重要。

本文论证道:图书管理员是谁,与图书馆有多大同样重要。 事实上,图书管理员决定了新书架究竟如何被使用。

以下是利用简单类比对本文研究发现的拆解:

1. 两种“图书馆容量”

研究人员考察了模型如何使用其内部的“大脑空间”(具体指前馈网络,即 FFNs)。他们通过两种方式进行了测量:

  • 软秩(Soft Rank,即“扩散”): 想象一个图书馆,书籍均匀地散落在每一个书架上。空间被广泛利用,但可能不够深入。这是一种“弥散式”容量。
  • 硬秩(Hard Rank,即“聚焦”): 想象一个图书馆,最重要、最稀有和最复杂的书籍被紧密地打包在特定的、高质量的书架上,而其他书架则是空的。这是一种“主导式”容量。它关乎拥有少数几种非常强大的方式来表征复杂概念。

2. “标准图书管理员”(AdamW)的问题

最常见的图书管理员 AdamW 擅长将书籍分散开来。当你给它一个更大的图书馆(更宽的宽度)时,它会广泛地填满书架(软秩上升)。

然而,当面对稀有且困难的书籍(即“长尾”token——如冷僻事实或复杂概念)时,AdamW 难以将它们组织成强大且聚焦的书架。

  • 结果: 即使你将图书馆的规模扩大一倍,AdamW 处理难题的能力也不会翻倍。它只是将困惑分散到了更大的空间里。本文称此为“弱硬秩缩放”。

3. “超级图书管理员”(Muon)

研究人员测试了另一位名为 Muon 的图书管理员。

  • 结果: 当 Muon 获得更大的图书馆时,它不仅仅是分散事物。它会主动为那些稀有且困难的书籍构建强大、聚焦的书架。
  • 神奇之处: Muon 将新增空间转化为可用能力的速度要快得多。如果 AdamW 处理复杂概念的能力增长缓慢(像慢走),那么 Muon 的能力增长则是直线的(像冲刺)。用本文的术语来说,Muon 实现了线性缩放,而 AdamW 则陷入了“弱”增长模式。

4. “困惑度陷阱”(我们之前为何忽略了这一点)

你可能会问:“如果 Muon 在组织方面如此出色,为什么我们以前没注意到?难道它不会只是获得更低的误差分数吗?”

本文揭示了一个陷阱:你可以拥有完全相同的最终得分,但内部结构却截然不同。

  • 如果你让“标准图书管理员”(AdamW)训练非常长的时间,它最终可以匹配“超级图书管理员”(Muon)的最终测试分数(困惑度)。
  • 然而: 在内部,它们完全不同。标准图书管理员拥有混乱、弥散的结构。超级图书管理员拥有锐利、有序的结构。
  • 结论: 仅仅因为两个模型获得了相同的测试分数,并不意味着它们“思考”的方式相同。超级图书管理员实际上正在构建一个更好的内部世界地图,即使最终的成绩看起来相似。

5. “稀有书籍”问题

语言就像齐普夫定律(Zipf's Law)分布:少数词汇被频繁使用(如"the"或"is"),但大多数词汇是稀有的。

  • AdamW 对常见词汇尚可应付,但在面对稀有词汇时会迷失方向。
  • Muon 在稀有、长尾知识方面表现卓越。随着模型变大,它处理这些稀有 token 的能力几乎完美地随之扩展。

6. 图书管理员与蓝图(架构)

研究人员问道:“图书管理员比图书馆设计更重要吗?”
他们测试了改变图书馆设计(例如改变注意力头的数量或移除位置信号)。

  • 发现: 改变图书管理员(优化器)对模型学习的影响,比改变蓝图(架构)更大。
  • 事实上,一位“超级图书管理员”可以让一个标准的图书馆设计,比“标准图书管理员”让一个花哨的新设计运作得更好。图书管理员和蓝图是一个团队;你不能只挑选一个蓝图,就假设任何图书管理员都能胜任。

总结

本文得出结论:优化在 AI 设计中是“一等公民”。

  • 旧观点: “把模型做大,它就会变得更聪明。”
  • 新观点: “把模型做大,但选择正确的优化器,以确保额外的规模真正转化为有用、聚焦的智能,特别是针对那些困难、稀有的事物。”

如果你想要一个真正理解人类知识“长尾”的模型,就不能仅仅依赖标准工具。你需要一个懂得如何为困难书籍构建强大、聚焦书架的优化器,而不仅仅是填满空白空间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →