← 最新论文
🤖 machine learning

Exploiting weight-space symmetries for approximating curvature

本文引入了一种利用权重空间对称性从单次梯度中构建可处理的结构化 Hessian 近似值的创新框架,在提供精度与计算成本之间可调平衡的同时,统一了包括 Shampoo 在内的现有方法,并实现了大规模模型中的二阶优化。

原作者: Artem Artemev, Rui Xia, Benjamin M. Boyd, Youjing Yu, Felix Dangel, Guillaume Hennequin, Alberto Bernacchia

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Artem Artemev, Rui Xia, Benjamin M. Boyd, Youjing Yu, Felix Dangel, Guillaume Hennequin, Alberto Bernacchia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一片巨大的、雾气缭绕的山脉(即“损失平面”)中寻找路径,目标是找到那个最深的谷底(即最好的 AI 模型)。为了高效地到达那里,你不仅需要知道哪边是“下坡”(梯度),还需要了解你脚下地形的形状。是陡峭的悬崖?还是平缓的斜坡?亦或是平坦的高原?这种“形状”被称为曲率

了解曲率可以帮助你迈出更大、更聪明的步伐。然而,在现代 AI 中,地形图如此庞大,以至于计算精确的形状就像是在跑马拉松时试图数清沙滩上的每一粒沙子一样。这太慢了,也太耗费内存。

这篇论文介绍了一个巧妙的捷径,叫做 Symo(对称优化器)。它是这样工作的,这里使用简单的类比来解释:

1. “对称性”的魔力(镜厅效应)

深度学习模型有一个奇特的特性:它们通常具有对称性。想象一条带有相同珠子的项链。如果你交换两颗相同的珠子,项链看起来仍然完全一样。在 AI 中,如果你对层中的某些部分进行置换(比如交换神经元),模型的性能并不会改变。

作者意识到,由于模型在这些交换后看起来是一样的,因此它下方的“地面”也必然看起来是一样的。这就像站在一个镜厅里。如果你知道面前的地形是什么样的,你就能自动知道所有镜像反射中的地形是什么样的,甚至无需亲自走过去。

2. 捷径:一步,多维视角

通常,为了了解地形,你可能需要在无数个不同的方向上迈出一步,以观察地形的变化。这需要耗费大量时间。

作者的方法如下:

  • 你迈出仅仅一步,观察地面。
  • 你不需要走到其他一百万个地方,而是利用镜像规则(对称性)来瞬间想象出在所有其他位置的地形。
  • 然后,你对所有这些镜像视图进行平均

通过这种数学方法,他们只需通过一次计算就能构建出一张“足够好”的曲率图,而不是进行数百万次计算。这就像是通过观察一片披萨,并已知这块披萨是完美的圆形,从而推测出整块披萨的形状。

3. 权衡:使用多少面“镜子”?

论文显示,你可以选择使用多少面“镜子”(对称性):

  • 镜子太多: 地图变得非常简单且易于计算,但它可能会因为过于模糊而变得没用(“地面”看起来太远了)。
  • 镜子太少: 地图非常详细且精确,但计算起来既慢又昂贵。
  • 恰到好处: 作者找到了一个“甜点位(sweet spot)”,在这个位置,地图既足够详细到有用,又足够简单到快速。

4. 惊喜:它已经在发挥作用了!

这篇论文中最令人兴奋的部分是一个“尤里卡(Eureka!)”时刻。作者发现,当设置为这个“甜点位”时,他们的全新方法 Symo 在数学上与两个已经在使用的、高性能的著名 AI 工具——ShampooMuon 是完全等价的。

你可以这样理解:科学家们多年来一直在使用一辆非常快、高科技的汽车(Shampoo/Muon),因为它表现出色,但他们并不完全理解它为什么这么快。这篇论文从零开始构建了一个新引擎,而当他们把旋钮调到正确的设置时,他们意识到:“嘿,这个新引擎竟然和那辆著名的汽车一模一样!”

这证明了 Shampoo 和 Muon 的“秘密配方”实际上就是对称性。它们一直都在无意识地利用这些对称性,而这篇论文解释了其中的理论。

5. 他们实际做了什么

作者不仅仅是在写理论;他们还进行了测试:

  • 他们构建了一个库,允许用户告诉计算机:“这是我的模型,这是它的对称性”,然后计算机会自动寻找捷径。
  • 他们在标准 AI 任务(如识别手写数字和预测故事中的下一个词)上进行了测试。
  • 他们确认了这种新方法的效果与著名的 Shampoo 和 Muon 优化器一样好。

总结

这篇论文的核心观点是:“我们找到了一种方法,通过利用模型自身的对称性作为捷径,来推测 AI 训练地形的形状。这使我们能够极其快速地计算曲率。我们也证明了这解释了为什么两个流行工具(Shampoo 和 Muon)如此有效。”

他们并没有声称这在本文中适用于医疗诊断、自动驾驶或预测股市。他们的重点完全在于如何让 AI 训练变得更快、更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →