← 最新论文
⚡ electrical engineering

DeMuon: A Decentralized Muon for Matrix Optimization over Graphs

本文介绍了 DeMuon,它是 Muon 优化器的首个去中心化扩展版本,通过结合 Newton-Schulz 正交化与梯度追踪技术,在通信图上的矩阵优化任务中实现了可证明的收敛性和卓越的性能,特别是在重尾噪声条件下。

原作者: Chuan He, Shuyi Ren, Jingwei Mao, Erik G. Larsson

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Chuan He, Shuyi Ren, Jingwei Mao, Erik G. Larsson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一群朋友正试图共同解决一个巨大的、复杂的拼图。他们都处于不同的房间里(去中心化),并且只能与他们的直接邻居交流。他们没有老板或中央领导来指挥他们,必须通过分享所见并根据邻居告诉他们的信息来调整自己的拼图块。

这篇论文介绍了一种让这些朋友更快、更准确地解决拼图的新方法。他们将这种新方法称为 DeMuon

以下是其工作原理的分解,使用了简单的类比:

问题: “矩阵”拼图

在人工智能(特别是深度学习)的世界里,这些“拼图块”不仅仅是单个数字,而是被称为矩阵的巨大数字网格。

  • 旧方法(向量化): 传统上,计算机将这些大网格视为长而扁平的数字列表(向量)。这就像是试图先将一个 3D 拼图压扁成一张 2D 薄片后再去解决它。这虽然可行,但很笨拙,且忽略了拼图块的形状。
  • 新方法(Muon): 最近的一种名为 Muon 的方法意识到,将这些拼图块视为它们天然的 3D 形状(矩阵)效果要好得多。它使用一种特殊的“指南针”(称为谱范数)来决定移动拼图块的方向。当所有人都处在同一个房间时(中心化),这种方法效果极佳。

挑战:走向去中心化

作者们问道:我们能否在朋友们身处不同房间且无法向中央老板求助的情况下,使用这种聪明的 “Muon” 指南针?
这很难,因为:

  1. 视角不同: 每个朋友看到的拼图部分略有不同(局部数据)。
  2. 没有老板: 他们不能直接问领导:“最好的移动方案是什么?”他们必须通过倾听邻居的声音来猜测“全局”的最佳移动方案。
  3. 混乱: 如果他们不小心,大家可能会开始朝不同的方向移动,导致拼图永远无法完成。

解决方案:DeMuon

作者提出了 DeMuon,一种让这些朋友在没有老板的情况下共同解决拼图的方法。它结合了两个主要技巧:

1. “共享指南针”(梯度追踪)
想象每个朋友都有一枚指南针。因为他们在不同的房间,他们的指南针指向的方向略有不同。

  • 旧的去中心化方法: 朋友们只是把指南针指向邻居,然后寄希望于它们能对齐。
  • DeMuon 的技巧: 他们使用了一种叫做梯度追踪的技术。这就像一场接力赛,每个朋友传递的不只是当前的移动方向,还包括一份关于其方向自上一步以来如何变化的“修正笔记”。这有助于整个群体达成共识,即便彼此相距甚远,也能确定真正的“全局”方向。

2. “矩阵正交化”(Muon 的魔力)
当一个朋友决定移动他的拼图块时,他并不仅仅是随机推动。他使用 Muon 技术,这就像是一个专门的“变形者”。

  • 与其只是向前推动拼图块,Muon 会检查拼图块的“形状”(使用谱范数),并在移动前将其旋转到完美对齐的状态。
  • 这就像一位舞者,不仅是向前走,还会先摆出一个完美的姿势以确保平衡。这可以防止拼图块“卡住”或移动效率低下。

超级强化版:DeMuon-A

作者还创造了一个更快的版本,叫做 DeMuon-A

  • 类比: 如果说 DeMuon 是一个观察地面并迈出一步的跑步者,那么 DeMuon-A 就是一个观察地面、预测自己两步之后的位置,并基于该预测迈出巨大跨步的跑步者。
  • 工作原理: 它使用了一种多重外推法。它会询问:“如果我继续这样移动,我会到哪里?”并利用这个预测来迈出更大、更聪明的步伐。这需要拼图过程是“平滑的”(可预测的),但一旦奏效,它能更快地收敛到解决方案。

他们证明了什么?

作者做了两件事:

  1. 数学证明: 他们使用了高级数学证明,如果朋友们遵循这些规则,他们最终会达成共识(一致性),并找到拼图块的最佳排列方式(平稳性)。他们证明了即使在复杂的网络中(有些人可以联系很多人,有些人只能联系少数人),这依然有效。
  2. 现实世界测试: 他们在训练语言模型(一种会写文章的 AI)时测试了这一点。
    • 他们设置了 8 台以不同方式连接的计算机(节点)(例如完美的圆环、环形或杂乱的网络)。
    • 结果: DeMuon 和 DeMuon-A 在学习语言任务方面,比标准方法(如 DSGD)表现得更好、更快。它们达到了更低的“误差”得分,意味着 AI 变得更聪明了。

总结

  • DeMuon 是一种让计算机群组在没有中央老板的情况下共同训练 AI 模型的新方法。
  • 它保留了原始 Muon 方法的“智能形状变换”(矩阵优化)。
  • 它增加了一个“接力赛”系统(梯度追踪),以便所有人都能达成方向一致。
  • DeMuon-A 增加了“预测跨步”功能,使速度更快。
  • 该论文通过数学证明了其有效性,并通过实验表明它在速度和准确性上都优于现有方法。

该论文并未声称这用于医疗用途或特定的未来应用;它严格专注于提高在去中心化网络中训练 AI 模型的数学效率。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →