MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
本文介绍了 MONA,这是一种新颖的优化器,它将 Nesterov 式加速集成到 Muon 框架中,以逃离尖锐的局部极小值,并在参数量从 10 亿到 680 亿的语言模型上实现最先进的收敛性和下游性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个巨大且超级聪明的机器人说人类语言。为此,你必须调整其大脑中数百万个微小的旋钮。寻找这些旋钮完美设置的过程被称为“训练”,而用来转动这些旋钮的工具被称为优化器。
长期以来,这项工作的标准工具被称为AdamW。它像一位稳健、谨慎的徒步者,迈着小步并不断查看地图。最近,一种名为Muon的新工具问世了。Muon 像是一位能一眼纵观整座山脉的徒步者,将成组的旋钮视为一个整体。这使得 Muon 更快、更高效,但它仍有一个缺陷:它可能会陷入“尖锐山谷”。
问题:尖锐山谷陷阱
想象机器人学习过程的景观是一片丘陵地带。
- 平坦山谷是理想的定居点;这意味着机器人找到了一个稳定的、通用的解决方案,能在多种情况下良好运作。
- 尖锐山谷则是狭窄、深邃的坑洞。如果机器人掉进其中一个,它可能看似找到了最低点,但实际上却被困在一个非常具体且脆弱的地方。如果你轻轻推它一下,它就会从那个“完美”的位置跌落,表现变差。
AdamW 和 Muon 都可能意外掉入这些尖锐山谷并被困其中。它们缺乏一种方式来“感知”前方地面的形状,从而判断某个位置是否过于尖锐。
解决方案:MONA(带 Nesterov 加速的 Muon)
本文的作者创造了一种名为MONA的新工具。可以将 MONA 想象为配备了一副声呐护目镜的 Muon。
以下是通过一个简单类比的工作方式:
- 旧方法(Muon): Muon 查看它站立位置的正下方坡度并向下移动。它在高效移动方面表现出色,但它不知道前方的地面是平缓的斜坡还是悬崖边缘。
- 新方法(MONA): 在 Muon 迈出一步之前,MONA 会查看坡度从上一站到当前站是如何变化的。
- 如果坡度变化非常突然(就像撞上陡峭的悬崖),MONA 会意识到:“哇,这是一个尖锐山谷!让我们用力推一把,弹出去。”
- 如果坡度变化非常缓慢(一个平缓、平坦的山谷),MONA 会说:“这看起来很安全。让我们在这里安顿下来。”
MONA 在数学公式中添加了一个特殊的“加速项”。它计算当前方向与先前方向之间的差异。这种差异就像一个传感器,用于检测地形的“尖锐度”。如果地形尖锐,它就会将机器人推出坑洞;如果地形平坦,它就让机器人休息。
他们发现了什么?
研究人员在三种不同规模的語言模型(小、中、大)上测试了这一新工具,参数量从 10 亿到 680 亿不等。他们在海量文本(多达 1 万亿个单词)上对它们进行了训练。
- 更好的训练: 在每一项测试中,MONA 都帮助模型学得更快,并达到比旧标准(AdamW)和新工具 Muon 更好的最终状态。
- 更聪明的机器人: 使用 MONA 训练的模型在通用任务、数学问题和代码编写方面表现更佳。例如,在一个 680 亿参数的模型上,MONA 在数学和代码编写的基准测试中取得了最高分。
- 微调: 即使在初始训练之后,当给予模型额外的特定训练(例如专门教它们编写代码)时,那些以 MONA 为起点的模型也比以 Muon 为起点的模型表现更好。
使其实用化(MONA-Lite)
作者们也意识到,添加这种“声呐”系统会占用稍多的计算机内存。为了解决这个问题,他们创建了一个更轻量级的版本,称为MONA-Lite。
- 他们使用了一种技巧来压缩内存数据(就像从高清视频切换到标清视频),并采用了一种方法,在不存储额外文件的情况下实时计算坡度变化。
- 这将所需的额外内存减少了约 75%,使其即使在内存有限的计算机上也易于使用,同时不会损失其优势。
总结
简而言之,MONA是 Muon 优化器的升级版。它保留了 Muon 的速度和效率,但增加了一个“曲率传感器”,帮助 AI 在学习过程中避免陷入糟糕的尖锐位置。这造就了更智能、更强大的语言模型,它们在数学、代码和通用推理方面表现更佳,同时效率足以在标准硬件上运行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。