← 最新论文
🤖 machine learning

Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio

本文介绍了 MoLS,一种通过估计模块级信噪比来自适应校准 Adam 优化器的方法,旨在解决大语言模型中的梯度噪声不平衡问题,从而在不进行人工调优的情况下提升收敛速度和泛化能力。

原作者: Ziqing Wen, Zhouyang Liu, Jiahuan Wang, Ping Luo, Li Shen, Dongsheng Li, Tao Sun

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziqing Wen, Zhouyang Liu, Jiahuan Wang, Ping Luo, Li Shen, Dongsheng Li, Tao Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一支庞大的专家团队(一个大语言模型)来解决复杂的谜题。这支团队由不同的部门组成:**嵌入(Embedding)**部门(将原始词汇转化为数字)、**注意力(Attention)**部门(厘清词汇间的关联)、**前馈神经网络(MLP)部门(处理逻辑)以及输出头(Head)**部门(做出最终预测)。

目前,教练(Adam 优化器)给每一位团队成员下达完全相同的指令:“根据你认为自己正确的程度向前迈一步。”教练试图通过为每个人单独调整步幅来保持公平。

问题所在:“嘈杂的房间”与“安静的图书馆”
该论文揭示了这种方法的一个隐藏缺陷。事实证明,有些部门在安静的图书馆里工作(高信号,低噪声),而另一些部门则在摇滚音乐会中工作(低信号,高噪声)。

  • 注意力与逻辑团队(Q/K, V/O, MLP): 他们身处安静的图书馆。他们的“梯度”(指引他们如何改进的线索)清晰且强劲。教练的指令对他们来说完美适用。
  • 嵌入与输出头团队: 他们身处摇滚音乐会。他们的线索被静电和噪声淹没。由于教练的数学计算假设线索是清晰的,它意外地指示这些嘈杂的团队迈出微小而犹豫的步伐。由于教练过于害怕让它们在噪声中快速移动,它们实际上被“抛在了后面”。

这种不平衡意味着,尽管团队其余部分已准备好冲刺,但整个团队却以那些最缓慢、最困惑的成员的步速前进。

解决方案:MoLS(信噪比调节器)
作者提出了一种名为MoLS(基于信噪比的模块级学习率缩放)的新方法。将 MoLS 想象成一位聪明的音响工程师,他在训练刚开始的“预热”阶段倾听团队几分钟,以测量每个部门的噪声水平。

  1. 校准: MoLS 计算每个部门的信噪比(SNR)。它问道:“你听到的有多少是真正的线索,有多少只是静电噪声?”
  2. 调整:
    • 对于嘈杂的部门(嵌入/输出头),MoLS 说:“教练太谨慎了!你需要更大的 boost 来穿透噪声。”它自动调高它们的音量(学习率)。
    • 对于清晰的部门(注意力/MLP),它说:“你们做得很好,保持当前速度。”
  3. 结果: 与其手动猜测该为每个团队增加多少 boost(这就像盲目转动旋钮来调收音机),MoLS 自动完成数学计算。它重新平衡团队,使每个人都能根据其特定环境以正确的速度前进。

为何这很重要
该论文表明,使用 MoLS 就像给团队提供了涡轮增压,而无需给他们的背包增加任何额外重量。

  • 更快的训练: 模型学习得更快,因为“嘈杂”的团队不再被困在慢动作中。
  • 更好的结果: 最终模型对语言的理解更好(困惑度更低),优于使用标准方法训练的模型。
  • 无额外成本: 它不需要昂贵的超级计算机或复杂的手动调整。它只需倾听片刻,设定音量,然后让训练运行。

简而言之
该论文揭示,标准的 AI 训练将所有大脑部分一视同仁,尽管某些部分天生就比其他部分更“嘈杂”。MoLS 通过自动调高嘈杂部分的音量并调低安静部分的音量来修复这一问题,确保整个大脑高效且和谐地学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →