When Does Muon Help Agentic Reinforcement Learning?
本文表明,在组中组策略优化(Group-in-Group Policy Optimization)过程中,专门将 Muon 优化器应用于隐藏权重矩阵,在稀疏奖励智能体强化学习任务中的表现显著优于 AdamW,且其性能增益高度依赖于优势估计器、学习率与策略优化策略之间的相互作用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何在一家巨大的、凌乱的房子里寻找隐藏的宝藏。这个机器人是一个由代码构成的“大脑”,每当它迈出一步时,都会得到一位老师的微小提示,告诉它这一步是好是坏。这就是强化学习 (Reinforcement Learning, RL) 的世界——在这里,智能体通过试错来学习。这个故事中的“老师”是一个被称为优化器 (optimizer) 的数学工具,它决定了在每次失误或成功后,机器人的大脑应该如何改变。多年来,最受欢迎的老师是一种叫做 AdamW 的方法,它就像一位细心且稳健的教练,根据反馈信号的大小来调整机器人的步伐。
最近,一位更华丽的新教练——Muon 出现了。Muon 以在从零开始教机器人(这个过程称为预训练)时表现得极其快速且高效而闻名,它完成任务时消耗的能量通常只有一半。但现在有一个大问题:当一个机器人已经学会了基础知识,现在正试图精通某项特定的困难任务时,Muon 是否依然表现得同样出色?一些早期的报告表明,Muon 在这种“微调 (fine-tuning)”阶段可能过于激进,会导致机器人忘记已学到的知识,或者被噪声搞混。这篇论文深入研究了这个谜团,测试了 Muon 是否能成为教导智能体解决复杂的、长程任务(即奖励稀缺且难以寻获的任务)的秘密武器。
伟大的优化器对决
在实验室里,研究人员组织了一场高规格的竞赛。他们选取了一个小型但功能强大的 AI 智能体(基于 Qwen2.5-0.5B-Instruct 模型),并要求它在 ALFWorld 中解决谜题。ALFWorld 是一个模拟环境,智能体必须执行诸如拿起物体、清洁或加热食物等家务活动。难点在于:智能体只有在完成一系列长序列动作的最后时刻才会获得“成功”奖励,并且在过程中做错任何事都会受到惩罚。这就像是在走迷宫,只有当你到达出口时才会听到“你赢了!”,但每走错一步,你都会听到一声“哔——”。
为了测试 Muon 是否能提供帮助,研究人员并没有直接把机器人扔进迷宫,而是给了它三种不同类型的“反馈教练”(称为优势估计器 (advantage estimators))来解读它的表现:
- GRPO: 这位教练只看最终结果。“你赢了吗?赢了?太棒了!没赢?再试一次。”它忽略了个体步骤。
- GiGPO: 这位教练更聪明。它不仅看最终结果,还会将机器人多次面临完全相同情况的时刻组合在一起。它会问:“当你站在冰箱前时,你通常能正确打开它吗?”
- GraphGPO: 最先进的教练,它将整个旅程映射为一个图 (graph),分析每一个步骤距离目标的远近。
令人惊喜的发现
团队运行了实验,让老牌可靠的 AdamW 教练与新锐 Muon 教练展开对决。他们保持其他所有条件完全一致,仅更换了用于调整机器人“隐藏”大脑权重(复杂的内部连接)的优化器,而将基础部分(如词汇表)保留在 AdamW 上。
实验结果呈现出一种取决于使用哪种反馈教练的“平庸”与“惊艳”并存的状态。
“惊艳”时刻:GiGPO
当使用 GiGPO 教练时,Muon 让机器人变成了一个超级学习者。
- 使用标准的 AdamW 教练时,机器人在最终测试运行中的成功率约为 29%。
- 使用 Muon 时,这个数字飙升至 54.6%。
- 这实现了 88% 的相对提升。
- 更令人印象深刻的是,当 AdamW 驱动的机器人由于某种原因在一定阶段后彻底崩溃并无法解决任何任务时,Muon 驱动的机器人却能一直学习并持续成功,直到 200 次更新结束。
“平庸”时刻:GRPO
当使用较简单的 GRPO 教练(它只关心最终的胜负)时,Muon 也有所帮助,但并不显著。它将成功率从 16.1% 提升到了 26.8%。虽然这是一个进步,但机器人的学习速度和效果都不如使用 GiGPO 时那样出色。
“接近完美”时刻:GraphGPO
在使用超级聪明的 GraphGPO 教练时,机器人使用 AdamW 已经表现得非常出色了(成功率约为 81%)。Muon 在特定的学习率下将其推高到了 90.1%,并且比 AdamW 早了 30 到 60 个步骤达到了这一成功水平。然而,由于机器人已经接近顶峰,随着两者接近终点,两名教练之间的差距也随之缩小。
为什么 Muon 赢了?(以及为什么它有时会输)
研究人员对这种现象的原因提出了理论假设。他们怀疑这与噪声 (noise) 有关。
想象一下,机器人的大脑正试图在迷雾森林中寻找路径。
- AdamW 就像一个跟随最强、最响亮路径的徒步者。如果雾气很浓(高噪声),它可能会陷入困境或迷失方向。
- Muon 则像是一个能抚平地形的徒步者,它让微弱、安静的路径变得和响亮的路径一样清晰可见。如果这些安静的路径确实通向有用的地方,那么这种能力就非常出色。
论文指出,在 GRPO 设置(单轮、低奖励任务)中,“安静的路径”大多只是随机噪声。Muon 的这种“抚平”效应放大了这些噪声,这也是为什么它在其他研究中偶尔会失败或表现挣扎的原因。然而,在 GiGPO 设置中,“步骤级”的反馈就像一座灯塔。它过滤掉了噪声,并突出了真正有用的方向。因为 GiG1PO 提供了关于“哪些特定步骤是好的”更清晰的信号,Muon 将微弱信号转化为超能力的能力,从一种诅咒变成了神技。
本研究排除了什么
需要注意的是,这项研究并未发现什么。研究人员测试了这种成功是否仅仅是因为 Muon 使用了更高的“学习率”(更大的步长)。他们尝试调高 AdamW 的速度以匹配 Muon 的步伐,但机器人立即崩溃并失败了。这证明了 Muon 的成功不仅仅在于迈出的步子更大,而是在于它计算步子的方式。
此外,论文并未声称 Muon 是解决所有问题的完美方案。事实上,它明确指出在其他类型的任务(如单轮数学问题)中,Muon 过去曾遭遇过失败。这里的成功是针对长程、稀疏奖励任务,且必须配合精心构建的反馈系统(如 GiGPO)。
核心结论
这篇论文表明,Muon 是进行智能体强化学习 (agentic Reinforcement Learning) 的强大工具,但前提是必须与正确的反馈机制相匹配。
如果你正在教 AI 解决复杂的、多步骤的谜题,仅仅更换为 Muon 可能是不够的。你需要一个能够将问题分解为更小、更清晰部分的反馈系统(如 GiGPO)。当将 Muon 发现“安静”且有用的路径的能力,与 GiGPO 过滤噪声的能力结合在一起时,AI 的学习速度会显著加快,并能解决更多的谜题。
作者承认这是一项使用单一种子(单次实验运行)的“探索性”研究,因此需要更多的测试来观察这种模式是否能在不同模型和任务中保持一致。但结果是令人振奋的:通过同时调整优化器和反馈系统,我们或许能够构建出在复杂、真实的现实世界中游刃有余的 AI 智能体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。