← 最新论文
📊 statistics

Correcting Stochastic Update Bias in Preconditioned Language Model Optimizers

本文通过提出一种结合交叉拟合预条件与方差校正逆运算的单批次框架,识别并修正了预条件语言模型优化器中的两种有限样本偏差——梯度预条件器耦合与非线性逆偏差,从而降低了预训练损失,并提升了 AdamW、Sophia 和 Shampoo 等模型的性能。

原作者: Nikhil Nayak, Julia White, Urchade Zaratiana, Kelton Zhang, Henrijs Princis, Dhruv Atreja, Henry Fawcett, Matthew Thomas, George Hurn-Maloney, Ash Lewis

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikhil Nayak, Julia White, Urchade Zaratiana, Kelton Zhang, Henrijs Princis, Dhruv Atreja, Henry Fawcett, Matthew Thomas, George Hurn-Maloney, Ash Lewis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人写诗。为此,你向它展示成千上万首诗的示例,并要求它调整其“大脑”(即其参数)以变得更好。机器人使用一种称为优化器(optimizer)的特殊工具,来确定该如何微调其“大脑”。

大多数现代优化器都是“聪明”的。它们不仅查看机器人犯下的错误,还会观察错误的形状,以此决定迈出多大的步伐。这被称为预条件(preconditioning)。

然而,本文的作者发现,这些聪明的优化器存在一个隐藏的缺陷:由于它们试图基于小样本且有噪声的数据做出决策,因此存在轻微的偏差。这就像只透过窗户看五秒钟就试图判断天气一样。

以下是问题所在及其解决方案,通过简单的类比进行解释。

两个隐藏缺陷

该论文指出了优化器在处理小批量数据时,在数学上出错的两种具体方式:

1. “自利”偏差(耦合偏差)

  • 类比:想象一个学生正在参加考试。为了给自己的作业打分,他们使用刚刚考过的那同一张试卷来计算分数。自然地,他们可能会因为问题和答案在脑海中完美匹配,而倾向于给自己打分过严或过宽。
  • 现实:在优化器中,机器人使用完全相同的小组数据来计算“移动方向”(梯度)和“步长大小”(预条件子)。由于它们来自同一来源,它们在统计上是“耦合”的。这会在更新规则中产生微妙的扭曲,导致机器人的步伐略微偏离目标。

2. “非线性”偏差(逆偏差)

  • 类比:想象你试图猜测汽车的平均速度。你知道驾驶一英里的平均时间是 1 分钟。你可能会想:“好吧,所以平均速度是 60 英里/小时。”但数学并非如此简单!如果你先对时间取平均值,然后再计算速度,得到的答案与先计算每次行程的速度然后再取平均值是不同的。这是因为“速度”是“时间”的倒数,而对倒数进行数学运算是棘手的。
  • 现实:优化器需要除以一个数字(预条件子)来确定步长。即使机器人平均而言能完美地估计预条件子,取倒数(将其翻转以进行除法)这一行为也会引入系统性误差。这就像试图通过先平均一群人的鞋码来猜测他们的平均身高;数学关系因此发生了扭曲。

解决方案:“双重检查”系统

作者提出了一种巧妙的修复方法,无需机器人重新读取数据或显著降低速度。他们称之为单批次偏差校正(Single-Batch Bias Correction)。

他们同时应用了两个主要技巧:

1. 交叉拟合(“独立裁判”)

  • 工作原理:机器人不再使用同一组数据来计算“方向”和“步长”,而是将当前的数据批次分成两个独立的组。
    • A 组计算方向。
    • B 组计算步长。
  • 结果:通过保持裁判的独立性,你消除了“自利”偏差。步长不再受该特定组数据具体方向的影响。

2. 方差校正(“噪声计”)

  • 工作原理:机器人观察“步长”估计值在数据微小子组之间的变化程度。如果估计值不稳定(高方差),机器人就知道由于上述非线性逆问题,数学计算可能存在偏差。
  • 结果:机器人使用一个统计公式(基于“Delta 方法”)来减去预期的误差。这就像一位机械师知道,在潮湿天气下,某种特定工具往往会高出 2% 的读数,因此他们会自动从读数中减去 2% 以获得真实值。

尝试后的结果如何?

该团队在三种用于训练大型语言模型(如驱动聊天机器人的模型)的“智能”优化器上测试了这一修复方案:

  1. AdamW:标准的、主力型优化器。
  2. Sophia:一种试图猜测问题“曲率”(例如判断山坡是陡峭还是平坦)的优化器。
  3. Shampoo:一种非常复杂的优化器,利用矩阵数学来处理海量数据。

结果

  • 预训练(从头学习):当从零开始训练模型时,偏差校正效果非常好。它显著降低了所有三种优化器的误差率(损失)。这就像机器人因为不再被自身有噪声的计算所误导,从而更快、更准确地学会了写诗。
  • 指令微调(对已有智能模型进行微调):当他们尝试教一个已经训练好的模型学习新任务时,结果是“中性至积极”的。校正没有造成损害,在某些情况下甚至提供了微小的提升,但收益较小。这是有道理的,因为模型已经稳定,因此“噪声”不再是主要问题。

核心结论

该论文认为,我们一直将这些优化器视为完美的数学机器,但实际上,由于它们处理的数据有限,它们正在犯下微小但一致的错误。

通过简单地拆分数据以保持方向和步长的独立性,并测量噪声以减去逆运算误差,作者创建了一个“偏差校正层”。这一层使训练过程更加高效,允许语言模型学得更好、更快,尤其是在它们从零开始的时候。这是一个微小的统计调整,却对这些 AI 模型的学习效果产生了惊人的巨大影响。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →