✨ 要点🔬 技术摘要
想象一下,你正在试图教一个庞大而复杂的机器人(即大型语言模型)如何说人类语言。为此,你必须根据其错误不断微调其内部的“旋钮”和“表盘”。这一过程被称为训练 。
长期以来,调整这些旋钮的标准方法就像使用一把通用的螺丝刀:你只是朝着看似有帮助的方向稍微转动它们。最近,一种名为Muon 的新方法成为了冠军。这就像从螺丝刀升级为一把高科技的自水平扳手,它确切地知道该朝哪个方向转动旋钮,以使机器人学得更快、更稳定。
DynMuon 是下一阶段的进化。它是一个“智能调度器”,意识到扳手不应始终设定为完全相同的方式。相反,它会随着训练的进展改变其策略。
以下是其工作原理的简要分解,使用了一些类比:
1. 问题:“一刀切”的扳手
当前的冠军方法 Muon 使用特定规则来调整机器人的旋钮。它对所有学习“方向”一视同仁。
类比 :想象你正在攀登一座山。Muon 就像一位总是告诉你走最陡峭路径的向导。当你位于山脚(训练初期)时,这非常有效,因为陡峭的路径能让你迅速向上。
问题 :当你接近山顶(训练后期)时,地形发生了变化。陡峭的路径可能布满岩石且危险(充满噪声),而平坦的路径实际上隐藏着通往顶峰的最后几步。如果你继续强行走陡峭路径,可能会被困住或偏离方向。
2. 发现:中途改变策略
本文的作者发现,调整旋钮的“最佳”方式取决于你处于训练过程的哪个阶段。他们观察了一个名为p p p (谱指数)的数学“旋钮”,它控制着扳手的行为方式。
早期阶段(攀登期) :在开始时,机器人会犯下巨大而明显的错误。此时,“陡峭”的方向(高曲率)充满了有用的信息。
DynMuon 的做法 :它将旋钮设置为正值 。这就像大喊:“在陡峭路径上全力冲刺!”这有助于机器人在初始阶段快速冲上山。
后期阶段(登顶期) :随着机器人变得更好,大错误已消失。现在,有用的信息隐藏在“平坦”的方向(低曲率)中。然而,这些平坦的路径也是随机噪声(杂音)倾向于隐藏的地方。
DynMuon 的做法 :它缓慢地将旋钮调整为轻微负值 。这就像轻声细语:“要温和,但专注于平坦路径。”它将机器人的注意力转移到那些仍包含有用信号的微妙、平坦的方向上,同时小心避开嘈杂的噪声。
3. 魔法:“动态”调度器
本文引入了DynMuon ,它自动处理这种切换。
工作原理 :它从正值设置开始(激进、专注于陡峭路径),并随着训练的进行平滑过渡到负值设置(温和、专注于平坦路径)。
结果 :这就像拥有一位向导,他确切知道何时从“冲刺模式”切换到“精准模式”。
4. 为何重要(结果)
本文在各种规模的机器人(从小型到巨型)上测试了该方法,发现:
更快的训练 :DynMuon 能达到与旧 Muon 方法相同的智能水平,但所需的步骤减少了 10% 到 26% 。这就像用 3 天而不是 4 天登顶。
更好的性能 :它最终获得更低的“错误分数”(验证损失),意味着最终的机器人更聪明。
高效性 :它不需要超级计算机来运行;它几乎不会为训练的每一步增加额外时间。这是一个软件升级,而非硬件升级。
总结
将Muon 想象为一位非常优秀、遵循固定规则的登山向导。DynMuon 则是同一位向导,但拥有一张地图,告诉他何时从“攀登陡峭悬崖”切换到“行走平缓山脊”。通过动态改变策略,机器人学得更快,并最终到达比始终遵循单一规则更好的位置。
本文声称,该方法专门适用于训练大型语言模型,并未声称将其用于医疗诊断、自动驾驶汽车或其他通用人工智能训练效率之外的具体应用。
技术摘要:DynMuon:Muon 的动态谱整形视角
问题陈述
Muon 最近已成为训练大型语言模型(LLM)和 Transformer 的主导优化器。其核心机制涉及将标准梯度更新矩阵 M = U Σ V ⊤ M = U\Sigma V^\top M = U Σ V ⊤ 替换为其极分解因子 U V ⊤ UV^\top U V ⊤ ,从而有效地“扁平化”奇异值,同时保留奇异方向。尽管这提高了收敛性和稳定性,但论文指出了一个关键局限:Muon 采用了一种静态 谱变换(具体而言,是谱指数 p = 0 p=0 p = 0 的情况,属于 U Σ p V ⊤ U\Sigma^p V^\top U Σ p V ⊤ 族)。
本工作旨在解决的核心未决问题是:单一的固定谱整形规则是否在整个训练过程中始终保持最优。 prior 工作已探索了谱整形的固定变体(例如固定的幂律整形或抑制主导子空间),但缺乏关于不同谱方向的相对影响如何随训练进展而演变的理论模型。作者假设,最优谱指数 p p p 应根据损失函数景观的变化、梯度噪声的性质以及训练阶段进行动态调整。
方法论
1. 理论框架:噪声感知局部建模
作者开发了一种噪声感知局部模型,用于分析定义为 D ( p ) : = U Σ p V ⊤ D(p) := U\Sigma^p V^\top D ( p ) := U Σ p V ⊤ 的谱整形操作的训练动力学。
信号 - 噪声权衡 :该模型将更新分解为局部曲率方向(模态)。它揭示了由指数 p p p 控制的基本权衡:
高 p p p (正值) :加速高曲率 (强)模态中残差信号的收缩,但抑制平坦模态中的更新。
低 p p p (负值) :增加低曲率 (平坦)模态中的收缩,但同时放大这些相同方向中的随机梯度噪声。
阶段依赖动力学 :
训练早期 :残差信号集中在高曲率方向。正值 p p p 是有益的,因为它优先考虑这些方向,在有限的噪声放大下加速信号收缩。
训练晚期 :随着训练进展,强模态中的残差信号衰减,集中点转向平坦模态。轻微负值的 p p p 变得有利,将更新强度重新分配给这些仍包含有用信号的平坦方向。然而,p p p 不能过于负,否则噪声放大将破坏优化。
2. DynMuon 算法
基于 p p p 应从正值过渡到轻微负值的理论见解,作者提出了DynMuon ,一种动态谱整形算法。
调度策略 :DynMuon 采用简单的逻辑调度,将谱指数 p p p 从早期阶段的正值(p m a x = 1 p_{max} = 1 p ma x = 1 )单调递减至晚期阶段的轻微负值(p m i n = − 0.25 p_{min} = -0.25 p min = − 0.25 )。
高效实现 :为任意 p p p 计算精确 SVD 在计算上是不可行的。DynMuon 扩展了 Muon 中使用的牛顿 - 舒尔茨(NS)近似:
对于 p ≥ 0.25 p \ge 0.25 p ≥ 0.25 ,使用原始 Muon 更新(或对于 p ∈ [ 0 , 0.25 ) p \in [0, 0.25) p ∈ [ 0 , 0.25 ) 使用标准 NS 正交化)。
对于 p < 0 p < 0 p < 0 ,使用围绕单位矩阵的二阶泰勒展开来近似分数谱整形 A p / 2 A^{p/2} A p /2 (其中 A = X n X n ⊤ A = X_n X_n^\top A = X n X n ⊤ )。这仅在标准 NS 计算中添加了一个多项式修正项,保持了与 Muon 相同的渐近复杂度。
稳定性锚定 :为确保 p p p 为正且较大时的稳定性,算法将正态区锚定在稳定算子上,避免在该区域使用不可靠的泰勒近似。
主要贡献
动态谱视角 :将 Muon 风格的优化从固定谱操作重新框架化为一个自适应问题,即选择一个随训练动力学演变的谱指数 p p p 。
噪声感知局部模型 :开发了一种理论模型,通过局部曲率方向上的残差信号减少与随机噪声放大之间的权衡,解释了 p p p 的阶段依赖性偏好。
阶段依赖机制的发现 :揭示了正指数有利于早期训练(强调强模态),而轻微负指数 (此前被忽视)通过强调仍保留有用残差信号的平坦模态来改善晚期优化。
DynMuon 算法 :提出了一种高效的动态谱整形算法,将 p p p 从正值调度至轻微负值,在几乎零计算开销的情况下,相比固定 Muon 实现了持续改进。
实验结果
作者在多种模型规模(1.27 亿至 11 亿参数)、架构(GPT 风格和 Qwen 风格)以及训练设置(FineWeb 和 FineWeb-Edu 数据集)上评估了 DynMuon。
性能 :DynMuon 始终比标准 Muon(p = 0 p=0 p = 0 )和 AdamW 基线实现更低的验证损失。
效率 :要达到相同的目标验证损失(定义为 Muon 在训练 80% 时达到的损失),DynMuon 所需的训练步数减少了 10.6% 至 26.5% 。
开销 :DynMuon 的每步时间成本仅为 Muon 的1.003–1.025 倍 ,证实了泰勒近似谱整形的高效性。
鲁棒性 :
架构 :收益可迁移至 Qwen 风格架构。
训练预算 :改进在 25 亿至 200 亿 token 的预算范围内均成立。
学习率 :与 Muon 相比,DynMuon 对学习率选择表现出更低的敏感性。
损失目标 :轻微负整形的收益在 CE-Brier 损失插值族中持续存在,表明该机制对不同概率空间损失具有鲁棒性。
消融实验 :实验证实,平滑的逻辑过渡优于 abrupt 切换或固定的负值调度。最优 p m i n p_{min} p min 被发现为 $-0.25;更激进的负值(例如 ;更激进的负值(例如 ;更激进的负值(例如 -0.5$)会因噪声放大而降低性能。
意义与主张
论文主张,DynMuon 证明了“最佳”谱偏置并非静态的,而是在训练过程中演变的。通过动态地将重点从高曲率方向转移到平坦方向,DynMuon 捕捉到了固定变换(如 Muon)所遗漏的优化动力学。
作者将这项工作定位为迈向更自适应优化器的步骤。他们谦逊地指出,虽然他们的逻辑调度优于固定选择,但这可能并非最终定论;最优 p p p 可能取决于实时优化统计量。他们建议未来的工作可以专注于 p p p 的在线估计,可能使用更昂贵但应用频率较低的信号,因为 p p p 的有用范围似乎相对较小。该方法被提出作为一种通用的 LLM 训练优化改进,在无需显著计算成本的情况下提升效率和性能。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。