Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
本文介绍了 Pion,一种高通谱优化器,它通过抑制噪声梯度分量并保留每头专业化,改进了 Muon,从而在 Muon 和 AdamW 难以胜任的具有可验证奖励的视觉 - 语言 - 动作训练及强化学习中实现了更优越的性能与稳定性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和日常类比对论文《Rethinking Muon Beyond Pretraining》(重新思考预训练之外的 Muon)的解释。
全景图:面向机器人与推理的新优化器
想象训练人工智能就像教导一名学生。长期以来,AdamW 一直是大型语言模型(LLM)最好的老师(优化器)。最近,一位更先进的老师Muon出现了。Muon 在“预训练”阶段表现出色——在这个阶段,AI 阅读整个互联网以学习通用知识。Muon 的工作原理是将 AI 的大脑视为一种乐器,确保每一个音符(数学方向)都以相同的音量演奏,从而鼓励大胆的探索。
然而,这篇论文的作者发现,当你尝试将 Muon 用于两项特定的高级任务时,它存在一个重大缺陷:
- 教导机器人(VLA): 将智能语言模型转化为能够看、说和移动的机器人。
- 教导数学/逻辑(RLVR): 利用奖励机制教导 AI 解决数学谜题等难题。
在这些新场景中,Muon 经常失效,导致机器人动作笨拙,或者数学求解器忘记所学的一切。作者提出了一种名为Pion的新老师来解决这些问题。
问题所在:Muon 为何在新情境中失效
要理解这个问题,不妨将 AI 的学习过程想象成一个拥有许多扬声器(数学方向)的音响系统。
1. 机器人问题(“低秩”问题)
在训练机器人时,控制手臂的大脑部分(“动作模块”)非常简单。它只需要在几个特定的方向上移动。
- 类比: 想象一个合唱团,只有 3 名歌手唱对了歌词,但其余 97 人只是在哼唱随机噪音。
- Muon 的做法: Muon 就像一位音频工程师,将所有歌手的音量都调到完全相同的水平。它让那 3 名好歌手声音洪亮,但同时也将那 97 名嘈杂歌手的音量推到了同样的高度。结果呢?机器人被噪音搞得晕头转向,动作 erratic( erratic 意为 erratic,此处指 erratic 动作,即 erratic 动作 erratic)。
- 修正方案: 你需要一个系统,既能保持好歌手的音量洪亮,又能静音那些嘈杂的歌手。
2. 数学问题(“低信噪比”问题)
当使用奖励机制(RLVR)教导 AI 解决数学问题时,反馈非常“嘈杂”。AI 进行猜测,获得奖励,然后再次尝试。信号(实际的数学课程)很微弱,而噪音(随机猜测)却很强烈。
- 类比: 想象在飓风中试图听清耳语。
- Muon 的做法: Muon 试图让耳语和飓风的风声一样响亮。这完全淹没了耳语,导致 AI“崩溃”并停止学习。
- 修正方案: 你需要一个滤波器,能够放大耳语但阻挡飓风的风声。
解决方案:Pion 登场
作者创建了Pion(Spectral hIgh-pass Optimization on momeNtum,动量谱高通优化)。把 Pion 想象成 Muon 忘记包含的一个智能音频均衡器。
Pion 不是同等地调大所有音量,而是采用两步流程:
- 提升(Promotion): 它增强重要、清晰的信号(声音的“头部”)。
- 抑制(Suppression): 它主动静音嘈杂、微弱的信号(声音的“尾部”)。
这被称为**“高通”滤波器**。就像音乐中的高通滤波器会切掉低沉、轰鸣的低音噪音,让清晰的人声闪耀一样,Pion 切掉数学噪音,让有用的学习方向闪耀。
Pion 的关键特性:
- 即插即用(Drop-in Replacement): 它可以精确地嵌入到 Muon 所在的现有训练代码中。它不需要更多的计算能力或时间;速度一样快。
- 每头模式(Per-Head Mode): 对于数学问题,Pion 可以单独处理 AI 大脑的不同部分(称为“注意力头”)。这就像意识到班级里有些学生擅长几何,而另一些擅长代数,从而给他们布置不同的作业,而不是把整个班级当作一个大杂烩来对待。
结果:机器人与数学变得更聪明
论文在两个主要领域测试了 Pion:
1. 真实机器人(VLA)
- 测试: 他们训练机器人抓取物体(如黄瓜或立方体)并将其放入碗或盘子中。
- 结果:
- AdamW: 机器人很吃力,经常掉落物体或错过目标。
- Muon: 机器人表现稍好,但仍显得 jittery(抖动),有时会撞上物体,因为它“听”到了太多噪音。
- Pion: 机器人动作流畅且精准。在一次测试中,Pion 在 1,500 步后达到了100% 的成功率,而 Muon 仅为 97%,AdamW 仅为 32%。
- 现实世界: 他们甚至在一台真实的物理机械臂(Franka Research 3)上进行了测试,Pion 依然获胜,成功抓取和放置物体的可靠性远高于其他方法。
2. 数学推理(RLVR)
- 测试: 他们使用强化学习教导 AI 模型(Qwen3)解决数学问题(MATH 和 GSM8K 数据集)。
- 结果:
- Muon: 模型崩溃了。由于噪音压倒了学习信号,其准确率降至接近零。
- AdamW: 模型学习缓慢但稳定。
- Pion: 模型学习更快,并取得了比 AdamW 更高的准确率,成功在嘈杂的数学环境中导航。
总结
该论文认为,虽然 Muon 是 AI 训练初始“阅读”阶段的绝佳工具,但对于控制机器人或解决数学问题等精细任务而言,它过于“嘈杂”且不加区分。Pion 是新的工具,它就像 AI 训练的降噪耳机:它在保持重要学习信号清晰洪亮的同时,消除干扰噪音,从而在不减慢任何速度的情况下,造就更聪明的机器人和更优秀的数学求解器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。