← 最新论文
🤖 machine learning

The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training

本文将奇异分布稳定性(SoSD)识别为语言模型预训练中的基本谱现象,证明归一化奇异值谱的早期稳定化主导了向慢损失下降阶段的过渡,并为理解和优化跨多种架构与策略的训练动态提供了理论框架。

原作者: Hongtao Zhang, Wenjie Zhou, Chenxi Jia, Wei Chen, Xueqi Cheng

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongtao Zhang, Wenjie Zhou, Chenxi Jia, Wei Chen, Xueqi Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个巨大的数字大脑(大型语言模型),让它学会人类语言。你可能会预期这个大脑会以稳定、可预测的速度学习。然而,研究人员发现了一种奇怪的模式:这个大脑在最初阶段学习速度快得惊人,但随后很长一段时间内,它似乎只能缓慢爬行,仅取得微小的进步。

这篇论文《奇异分布的稳定性》("The Stability of Singular Distribution")试图探究为什么会发生这种情况。作者提出了一种观察大脑内部机制的新视角,他们称之为SoSD(奇异分布的稳定性)。

以下是使用简单类比进行的分解说明:

1. 两阶段旅程:冲刺与爬行

将训练语言模型想象成跑马拉松。

  • 第一阶段(冲刺): 在开始时,模型会非常迅速地学习到巨大且显而易见的内容。“损失”(衡量模型错误程度的指标)会像石头一样急剧下降。
  • 第二阶段(爬行): 过了一段时间后,模型撞上了一堵墙。它仍在继续运行,但只能寸步前行。损失下降得非常缓慢。

这篇论文提出的核心问题是:是什么导致了从“冲刺”到“爬行”的转变?

2. 秘密配方:大脑的“形状”

在模型内部,存在着巨大的数字网格,称为权重矩阵。这些是决定模型如何思考的“权重”。

  • 通常,我们认为模型之所以能学习,是因为这些数字在不断变化。
  • 作者发现了一个令人惊讶的事实:这些数字的整体形状(具体而言,是它们的“奇异值分布”)在很早的阶段就停止变化了。

类比: 想象一座正在被塑形的黏土雕塑。

  • 权重: 这些是构成雕塑的单个黏土颗粒。它们在很长一段时间内仍在不断移动和重新排列。
  • 奇异分布: 这是雕像的整体轮廓或大致形状。
  • 发现: 作者发现,轮廓会迅速稳定下来(停止改变形状),即使内部的单个黏土颗粒仍在不断移动。

他们将这种现象称为SoSD(奇异分布的稳定性)。

3. 同步:当形状停止变化时,速度也随之停止

最重要的发现是,当“轮廓”停止变化(即达到 SoSD)的那一刻,模型的学习速度立即从“冲刺”切换到“爬行”。

  • SoSD 之前: 形状仍在重组中。这使得模型能够进行巨大而快速的改进。
  • SoSD 之后: 形状已稳定为一种固定模式。即使模型继续训练,它也无法再进行大的结构性改变。它现在只是在固定形状内微调细节。这就是进步大幅放缓的原因。

4. 为什么会发生这种情况?(学习的物理学)

这篇论文利用数学证明了这是不可避免的。

  • 随着模型训练,其内部数字的“大小”(或范数)会自然增长变大。
  • 这就像是一个变速箱。当齿轮很小(训练早期)时,一个微小的推力(学习步长)就能让车移动很长一段距离。
  • 随着齿轮变得巨大(训练后期),同样的微小推力几乎无法让车移动分毫。
  • 由于“齿轮”(权重范数)持续增长,模型改变其“形状”(奇异分布)的能力在数学上受到了限制。一旦达到一定规模,形状就会被锁定,快速学习随之结束。

5. 如何破解系统(学习策略)

作者解释说,常见的训练技巧实际上是通过操纵这个“变速箱”或“形状稳定性”来发挥作用的。

  • 学习率调度(减速):

    • 是什么: 在训练过程中逐渐减小“推力”的大小。
    • 论文观点: 通过减小推力,你迫使“形状”改变得更慢。这防止模型过早锁定在一个糟糕的形状中,使其能够更长时间地保持有效学习。这就像为了继续爬坡而换到低档位。
  • 权重衰减(保持精简):

    • 是什么: 一种惩罚机制,防止内部数字变得过大。
    • 论文观点: 如果数字不会变得太大,“齿轮”就不会变得太重。这能让模型改变形状的能力在更长时间内保持活跃,使其即使在缓慢阶段也能继续改进。
  • 不同的优化器(Muon 与 Adam):

    • 论文测试了一种名为Muon的新优化器。研究发现,Muon 比标准的 Adam 优化器能更有效地保持“形状”的变化,从而使模型学习速度更快,达到更低的误差率,尽管“形状稳定性”现象依然会发生。

总结

这篇论文认为,人工智能训练中“先快后慢”的模式并非缺陷,而是这些模型演化过程中的基本特征。

  1. 快速阶段: 模型正在积极重塑其内部结构。
  2. 缓慢阶段: 内部结构已稳定(SoSD),模型现在只是在打磨细节。

理解这种“奇异分布的稳定性”,为科学家提供了一个新的视角,去洞察为什么训练会放缓,以及如何调整设置(如学习率),使模型能够更长时间地保持高效学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →