← 最新论文
🤖 machine learning

Training nGPT

本文提出了一种针对归一化 Transformer (nGPT) 的实用训练方案,该方案结合了 Logit 梯度预处理 (Logit Gradient Preconditioning) 和 GatedAdamW 等技术,使 14B 参数的混合 Mamba-Transformer MoE 模型能够仅使用约一半的训练 Token,就达到与其非归一化对应模型相同的验证损失。

原作者: Ilya Loshchilov, Boris Ginsburg

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Ilya Loshchilov, Boris Ginsburg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下人工智能的世界就像一座巨大而繁忙的图书馆,计算机正试图学习如何写故事、解数学题以及像人类一样聊天。为了做到这一点,它们使用被称为“神经网络”的特殊数学结构,这就像是巨大的、相互连接的神经元网络。在这些网络内部,信息以数字的形式传递,网络通过调整这些神经元之间连接的强度来进行学习。长期以来,科学家们注意到这些数字会变得很混乱——有时变得过于庞大,有时又缩减到微乎其微,导致整个系统会对前进的方向感到困惑。这有点像背着一个重量不断变化的背包尝试爬陡峭且雾气缭绕的山:你可能刚向前迈出一步,却又立刻滑回原处。这项研究的目标是找到一种更好的背负背包的方式,让计算机能够更快、更高效地攀登学习这座大山。

你即将阅读的这篇论文来自 NVIDIA 的团队,由 Ilya Loshchilov 和 Boris Ginsburg 领导。他们正在解决一个具体的问题:如何通过强制要求所有内部数字都保持在一个完美的、隐形的球面上,来让这些 AI 模型学得更好。想象一下这就像是一条规则,规定:“无论你走多远,你必须始终保持在距离市中心正好一英里的地方。”这种被称为“归一化”(normalization)的规则,能防止数字变得过大或过小,从而帮助计算机保持专注。作者们基于之前的一个名为 “nGPT”(归一化 GPT)的想法,并在一种非常现代且强大的 AI 类型上进行了测试,这种类型结合了两种不同的技术:“Mamba-2”(擅长记忆长序列)和 “Transformers”(擅长理解上下文)。他们想看看这种新的训练规则是否能让这些混合模型比标准方式学得更快。

核心思想:一种新的训练食谱

作者们不仅仅是微调了一点东西;他们为这些 AI 模型烹饪了一套全新的“训练食谱”。想象一下你正在教一个机器人走路。旧的方法(使用一种称为 AdamW 的标准方法)就像是让机器人踉踉跄跄地走,有时迈出笨拙的大步,有时又迈出细碎、犹豫的小步,并寄希望于它最终能找到路径。他们的新食谱,即 nGPT 训练食谱,就像是将机器人放在一台跑步机上,并为其设定了一套非常具体的规则,以确保它的步伐完美无缺。

以下是他们是如何实现的,通过简单、日常的概念进行拆解:

1. “Logit 梯度预处理”(音量旋钮)
当 AI 尝试预测句子中的下一个词时,它会产生一组被称为“logits”的分数。在旧系统中,随着训练的进行,这些分数的“音量”可能会变得异常响亮或微弱,从而让机器人对该如何发力感到困惑。作者添加了一个特殊的“音量旋钮”(一个可学习的缩放向量),我们可以对其进行调节。但聪明之处在于:他们意识到如果只是单纯地转动旋钮,会破坏机器人的行走记忆。因此,他们发明了一个名为 Logit 梯度预处理 的技巧。这就像是一个可以改变你听到的声音大小的音量旋钮,但当机器人试图从错误中学习时,系统会自动将音量调回正常水平,以免机器人感到困惑。这使得即使预测的“响度”发生变化,学习过程也能保持稳定。

2. “对数学习率衰减”(赛车手)
通常在训练 AI 时,你会从较快的学习速度开始,然后逐渐减慢速度,就像赛车手慢慢松开油门一样。作者发现,标准的减速方式(如平滑曲线)并不适合他们的新型“球面”系统。相反,他们使用了“对数学习率衰减”。想象一辆赛车在起跑线上冲出,最初极快地减速以找准方向,然后在剩下的比赛中保持长时间的平稳巡航。这种“前置型”的时间表让模型能够快速掌握基础知识,然后在很长一段时间内精炼技能,事实证明这更加高效。

3. “GatedAdamW”(聪明的守门人)
更新机器人大脑的标准方式是 AdamW。作者将其升级为 GatedAdamW。可以将标准方法想象成一个允许所有更新通过的守门人,即使这些更新微乎其微且几乎察觉不到。有时,这些微小的更新仅仅是噪声。新的 GatedAdamW 有一个“智能门”,它会观察每一次更新。如果一次更新太小(比如像是在耳语),守门人会温柔地说:“今天不行,”并将其拦截。如果更新是一个呐喊(显著的变化),门就会大开。这防止了机器人浪费能量在微不足道的调整上,帮助它专注于重大且重要的变化。

4. “角度步长限制”(安全牵引绳)
由于机器人在球面上行走,迈出的步子过大会导致它失控旋转或跳到世界的另一端。作者添加了一个“角度步长限制”,这就像是一条安全牵引绳。如果机器人试图迈出过大的步子,牵引绳会将它轻轻拉回到一个安全的、较小的角度。这确保了机器人永远不会进行疯狂、危险的跃迁,让它的旅程保持平稳和稳定。

结果:更高效地学习

团队在了一系列规模从 10 亿到 140 亿参数(即机器人的“大脑容量”)的 AI 模型上测试了这一新食谱。他们将新的 nGPT 模型与使用旧方法的标准 GPT 模型进行了对比。

结果令人印象深刻。新的 nGPT 模型始终比标准模型实现了更低的误差率(以“验证损失”衡量)。具体而言,140 亿参数的 nGPT 模型达到与标准 140 亿模型相同的技能水平,但所需的训练 Token 量(模型阅读文本的数量)大约只有一半。换句话说,要到达同一个目的地,nGPT 模型阅读的文本量仅为标准模型的一半左右。

论文指出,这种进步来自于所有这些新规则协同工作的结合,而不仅仅是单一的技巧。他们还测试了“智能门”的一个特定设置(称为锐度参数 aa),并发现一个较软的门(a=0.5a=0.5)比一个严格的门效果略好,但最大的提升来自于整个新的训练系统,而非仅仅是门本身。

这意味着什么

作者们谨慎地指出,他们并没有尝试这些规则的所有可能变体(他们没有进行“完整的消融实验”),因此可能还存在他们尚未发现的更优设置。然而,他们确实发现的结果是可靠的:通过迫使 AI 在一个完美的球面上行走,并使用一种更聪明、更受控的方式来迈步,我们可以用显著更少的数据和时间来教这些庞大的模型变得更聪明。这是一个实用的配方,它表明我们可以通过更高效地利用互联网的一部分,而不是喂给它们整个互联网,来构建更好的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →