← 最新论文
🤖 machine learning

A Physical Response-and-Memory Model for Muon Optimization

本文提出了一个用于解释训练动态的物理响应与记忆模型,旨在阐明 Muon 优化器的有效性,并引入了 Bi-Maxwell 优化器,该优化器利用双时间尺度记忆核在大型语言模型基准测试中实现了更快的收敛。

原作者: Yinze Hu, Hongjun Xiang, Xingao Gong, Hongyu Yu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yinze Hu, Hongjun Xiang, Xingao Gong, Hongyu Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能那宏大而沉默的架构中,最昂贵且最耗时的任务并非模型本身的设计,而是对其进行教导的过程。为了训练大型语言模型,工程师们向其输入数十亿个词汇,并调整被称为“权重”的内部设置,以减少误差。这一过程依赖于一种被称为“优化器”的数学工具,它扮演着教师之手的角色,决定在每一次课程之后,究竟要对这些权重进行多大幅度的偏移。多年来,最有效的“老师”都是通过试错法选出的,其背后是工程直觉而非对其运作原理的深刻理解。目标非常简单:在固定的计算能力下,误差率能降到多低,以及能多快达到那个水平?答案完全取决于优化器遵循的将错误转化为修正的规则。

复旦大学和同济大学的研究人员最近的一项研究提供了一个观察这一过程的新视角。他们没有将神经网络的训练视为一系列抽象的计算,而是将网络的权重矩阵视为一个具有记忆能力的物理对象,就像一块会对力量做出反应的金属或凝胶。他们提出,当网络出错时,会产生一种内部应力,类似于拉伸弹簧中的张力。优化器的任务就是高效地释放这种应力。通过将物理定律应用于这种数字介质,研究人员推导出了关于网络应如何学习的一套新规则。他们发现,更新权重的最有效方式是朝着尽可能快地消散这种应力的方向移动,同时遵守一个关于网络输出变化幅度的安全限制。这种物理视角解释了为什么一种近期备受欢迎的方法——Muon——之所以如此有效,同时也揭示了该方法在记忆过往教训方面的一个缺陷。

研究人员发现,这些优化器记忆过去的方式过于简单。它们通常使用单一、统一的时间尺度来平均近期的错误,仿佛它们所构成的材料只能以一种速度释放张力。然而,研究人员认为,真实的材料以及延伸出的复杂神经网络,拥有更复杂的内部结构。它们既拥有快速的局部反应,也拥有缓慢的深层结构变化。为了测试这一点,他们用一种名为 Bi-Maxwell 的新版本取代了标准优化器的单速记忆;Bi-Maxwell 使用两种不同的速度:一个快速速度用于捕捉即时变化,一个慢速速度用于保留长期模式。当他们在训练语言模型的公开基准测试中测试这种新方法时,结果立竿见影且可衡量。新优化器在 2,635 步内达到了目标准确度,打破了之前 2,690 步的纪录。这听起来可能差别微小,但在训练大规模模型时,成千上万台计算机需要运行数周,哪怕节省几十步,也意味着在时间和能源上的显著节省。

为了确保这种改进并非偶然,团队进行了一系列严格的检查。他们保持训练过程的其他部分完全相同,仅改变了负责记忆过去梯度的“记忆核”。他们在不同的计算机硬件和不同的随机起点上运行了实验,新优化器始终优于旧优化器。他们还通过测量网络需求随时间的变化,研究了为什么双速记忆效果更好。他们发现,在训练初期,网络学习迅速,需要短时记忆以保持敏捷;随着训练的进行,学习速度放缓,网络则受益于长时记忆以平滑路径。单速优化器无法适应这种转变,它在整个过程中都固定在一种设置上。而双速版本则能够自然地兼顾初期所需的快速反应以及后期所需的深度、稳定的记忆。

这项研究还阐明了优化器究竟在做什么。它表明,最高效的更新方向并非随机猜测,而是一条特定的几何路径,旨在最大化释放误差势能,同时不会导致网络变得不稳定。这正是 Muon 优化器所采用的方向,但研究人员为其提供了物理层面的推理:它是受安全约束限制下的最大能量耗散路径。此外,他们证明了这些系统中的“记忆”不仅仅是一个数学技巧,用来平滑噪声,它代表了累积的内部应力。正如物理对象在受到推挤后需要时间沉降一样,神经网络也需要时间来整合从错误中吸取的教训。通过将神经网络视为一种具有弛豫时间谱的响应式介质,研究人员得以设计出一种尊重学习自然节奏的优化器。

这项工作表明,人工智能训练的未来可能在于更深入地借鉴物理科学。通过从材料科学和热力学的视角审视学习过程,研究人员得以超越试错法,推导出植根于系统基本行为的规则。他们不仅找到了一种更快的模型训练方法,还提供了一个理解为何某些方法有效以及如何改进它们的框架。Bi-Maxwell 优化器的成功——它仅仅是为记忆增加了一个第二时间尺度——证明了即使是微小的、由物理驱动的改变也能产生显著收益。随着语言模型变得越来越庞大和复杂,其训练效率变得愈发关键,而这种物理方法为实现更快、更稳定且更高效的训练提供了一条充满前景的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →