Reassessing Muon for Matrix Factorization
本文通过在低秩矩阵分解上重新评估 Muon 优化器,以将其更新规则从混淆因素中分离出来,结果表明它并不始终优于 AdamW,且其报道的优势往往对超参数的选择较为敏感。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何学习。为了做到这一点,你需要一个“教练”来告诉机器人下一步该往哪儿走才能变得更好。在人工智能的世界里,这个教练被称为优化器(optimizer)。多年来,最受欢迎的教练是一种叫做 AdamW 的方法,它擅长根据路径的湿滑或颠簸程度来调整步伐。但最近,一位名为 Muon 的华丽新教练登场了。Muon 声称自己很特别,因为它不仅观察路径,还试图利用一种被称为**正交化(orthogonalization)**的高级数学技巧来“矫正”机器人的步伐。你可以把它想象成一位舞蹈指导,强迫舞者向着完美且互不重叠的方向移动,希望这样能让舞蹈更加高效。
大家心中最大的疑问是:对于现代人工智能所从事的那些大规模、复杂的任务(比如写故事或生成图像),Muon 真的比 AdamW 是更好的教练吗?还是说,Muon 表现出色仅仅是因为舞池实在太巨大且混乱了?科学家们一直在对巨型 AI 模型进行大规模测试,而 Muon 似乎赢得了比赛。但当你处理数十亿个变量时,很难分辨到底是教练在发力,还是问题的规模本身掩盖了教练的错误。这正是故事有趣的地方:为了寻找真相,你不能只看大型表演;你必须在一个安静、受控的房间里进行测试。
这篇题为《重新评估用于矩阵分解的 Muon》(Reassessing Muon for Matrix Factorization)的论文,将 Muon 和 AdamW 从混乱的、拥有数十亿参数的舞池中带了出来,丢进了一个简单、光线充足的练习室。研究人员决定在一种被称为**矩阵分解(matrix factorization)**的特定基础任务上测试它们。如果你把这想象成一张巨大的数字表格,而你想将其分解为两个较小的、更简单的数字表格,且两者相乘能还原回原表,这就是矩阵分解。这是一个纯粹的数学谜题,我们完全知道解的形式是什么,也能衡量教练迈出的每一步微小的变化。
研究人员进行了一项大规模实验,在许多不同版本的谜题中,针对两种教练的“学习率”(即机器人迈步的大小)进行了调整。他们测试了从容易、平滑的谜题到极其困难、具有“病态条件(ill-conditioned)”的谜题(即数字非常棘手且迅速衰减的情况)。他们还研究了不同类型的谜题,包括一些数字必须保持为正数的类型(非负矩阵分解)。
以下是他们的发现,这可能会让你感到惊讶:Muon 并不是万能灵药。 当研究人员给予两种教练公平的机会去寻找它们完美的步长时,Muon 并没有持续击败 AdamW。事实上,对于标准的低秩分解任务,AdamW 甚至普通的梯度下降法(Gradient Descent)往往能与 Muon 持平,甚至表现得更好。人们在巨型 AI 模型中看到的 Muon 的“优越性”,在控制变量后似乎消失了。论文指出,Muon 在现实世界中的成功,可能是由于那些庞大模型的特定规模和架构所导致的产物,而不是因为优化器本身在数学逻辑上更胜一筹。
然而,Muon 也并非一无是处。论文发现,Muon 在一种特定场景下确实拥有明显的优势:非负矩阵分解(NMF)。在这些数字必须保持为正数的谜题中,Muon 那种独特的“矫正步伐”的方式帮助它避免了冗余解,并找到了更多样化的答案。看起来,Muon 是一个专家,而非全才。当问题具有特定的几何特征(如 NMF 约束)时,它会大放异彩;但在面对标准的、表现良好的数学谜题时,它难以占据统治地位。
这项研究还揭示了问题的“条件性”(即数字有多棘手)会改变胜负。在非常困难、具有病态条件的场景中,教练的排名会根据数据的形状发生彻底的反转。作者得出结论:我们不能仅仅通过观察一次测试或一个默认设置来决定哪个优化器更好。我们需要在广泛的条件和步长范围内对其进行测试。其核心启示是:虽然 Muon 是一个强大的工具,但它并不会在所有情况下都自动取代像 AdamW 这样的老牌冠军。它的成功高度依赖于它试图解决的问题的具体形态。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。