← 最新论文
🤖 machine learning

Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors

本文引入了幅度-方向(MD)解耦,这是一种优化器改进方法,它将权重矩阵分解为固定范数的方向和以不同速率更新的可学习幅度,从而在各种模型架构和优化器中稳定训练动态,并消除对权重衰减和预热的需求。

原作者: Alexander Hägele, Alejandro Hernández-Cano, Atli Kosson, Martin Jaggi

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Hägele, Alejandro Hernández-Cano, Atli Kosson, Martin Jaggi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨大的、复杂的机器人(神经网络)说一种新的语言。机器人的大脑由数十亿个被称为**权重(weights)的小开关组成。为了教导这个机器人,你使用了一位名为优化器(optimizer)**的老师(比如 Adam 或 Muon),它通过轻推这些开关来让机器人变得更聪明。

长期以来,这些老师都将每个权重视为一个单一的、坚固的整体。它们会朝着特定方向推动整个整体。但本文的作者意识到这里存在一个问题:每个权重实际上有两个截然不同的部分:

  1. 方向(Direction): 开关指向哪个方向(就像指南针上的指针)。
  2. 幅度(Magnitude): 这个开关有多强或多响(就像音量旋钮)。

问题:“音量”与“方向”的纠缠

在标准训练中,老师试图同时移动整个整体。这造成了一种混乱的纠缠:

  • 音量漂移: 当老师试图旋转开关的方向时,即使老师并非本意,其“音量”(幅度)也会产生副作用,变得更大或更小。
  • 方向变得混乱: 如果音量太大,微小的推动很难改变方向;如果音量太小,同样的推动会让方向剧烈旋转。
  • 补救工具箱: 由于这种混乱,工程师不得不使用复杂的“创可贴”,比如权重衰减(weight decay)(一条不断尝试缩小音量的规则)和预热(warmup)(通过从极慢的速度开始以避免混乱)来保持训练的稳定。

解决方案:幅度-方向(MD)解耦

作者提出了一种教导机器人的新方法。他们不再将权重视为一个坚固的整体,而是在优化器内部将其拆分为两个独立的部分:

  1. 指南针(方向): 他们强制要求方向保持在一个固定的“球面”上(就像一个地球仪)。老师可以在这个地球仪上旋转指南针的指针,但指针的长度永远不会改变。
  2. 音量旋钮(幅度): 他们为开关的每一行和每一列添加了独立的、可学习的“音量旋钮”(增益)。这些旋钮独立地控制着响度。

类比:
想象你正在驾驶一艘船。

  • 旧方法: 你有一个巨大的杠杆,同时控制着舵(方向)和引擎功率(幅度)。如果你试图转动舵,引擎功率会意外地升高或降低,导致船只难以操控。你必须不断地与引擎作斗争,以保持航向稳定。
  • 新方法(MD 解耦): 你有一个专门控制舵的转向轮和一个独立的控制引擎节流阀。你可以随心所欲地转动转向轮,而引擎功率不会发生变化。你也可以独立地调节节流阀,让船行得更快或更慢。

使用这种方法会发生什么?

论文表明,这种简单的分离带来了一些令人惊喜的好处:

  1. 不再需要“创可贴”: 因为方向被锁定在固定大小,且音量被单独控制,所以机器人不再需要权重衰减预热。训练过程自然地保持稳定。
  2. 可预测的缩放: 通常情况下,如果你把机器人做大(增加开关数量),你必须从头开始重新调整老师的设置。使用这种新方法,无论机器人是大是小,“转向灵敏度”(学习率)都保持不变。你可以先调优一个小模型,然后直接将完全相同的设置用于一个庞大的模型。
  3. 学习更快: 机器人学得更好、更快。在针对大型模型(混合专家模型,Mixture-of-Experts)的测试中,这种方法达到了与现有最佳方法相同的性能水平,但使用的计算能力仅为一半

核心结论

本文认为,通过将神经网络权重的“方向”和“响度”视为两个可以独立控制的变量,我们可以更高效地训练 AI 模型,减少规则的使用,并获得更好的结果。这就像是意识到,要开好车,你需要分别控制转向和油门,而不是试图用一只手同时完成这两件事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →