← 最新论文
💬 NLP

OrScale: Orthogonalised Optimization with Layer-Wise Trust-Ratio Scaling

OrScale 为正交化优化引入了一种分层信任比率缩放机制,通过测量实际的参数空间更新方向来克服现有 Muon 混合方法的局限性,从而在图像分类和大语言模型预训练任务上实现更优越的收敛保证与实证性能。

原作者: Yuxuan Lou, Yang You

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxuan Lou, Yang You

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在训练一个巨型机器人大脑(大型语言模型),让它学会说话、写作和解决问题。为此,你必须不断微调机器人内部的“权重”(即决定其思考方式的旋钮和刻度)。

本文介绍了一种名为OrScale的新工具,用于更高效地调节这些旋钮。以下是通过简单类比进行的拆解:

1. 问题:“一刀切”的错误

将机器人大脑想象成一支庞大的管弦乐队。它包含不同的声部:弦乐(注意力层)、铜管(MLP 层)和打击乐(投影层)。

  • 旧方法(Muon): 指挥家(优化器)让每位乐手演奏一个音符。音符的方向是完美的(他们确切知道该往哪个方向移动),但音量由一个全局的主音量旋钮控制。
  • 问题所在: 弦乐需要轻柔演奏,而打击乐需要重击。如果使用单一的全局音量,弦乐可能太轻而听不见,或者鼓声可能震耳欲聋。
  • 以往的修复尝试: 有人试图为每个声部设置静态音量(例如“弦乐=20%,鼓=50%"),但乐队在排练过程中是动态变化的。静态设置无法在演出过程中随着音乐变强或变弱而自适应调整。

2. 解决方案:OrScale(智能音量混音器)

作者提出了OrScale,它就像是为乐队每个声部配备的智能自动音量混音器。

  • 核心理念: OrScale 不猜测音量,而是测量机器人即将采取的实际步长。它会问:“我们此刻真正做出的改变有多大?”
  • 信任比率: 它将机器人当前“大脑”(权重)的大小与即将采取的“步长”大小进行比较。
    • 如果步长相对于大脑过大,它会调低音量(信任比率 < 1)。
    • 如果步长过小,它会调高音量(信任比率 > 1)。
  • 关键秘诀: 论文指出,要正确实现这一点,必须测量真实的步长(包含方向和权重衰减),而不仅仅是原始方向或原始动量。如果测量对象错误,音量旋钮就会卡在最大值或最小值,导致音乐分崩离析。

3. 为何其他尝试失败(“失败模式”)

论文测试了构建该混音器的其他三种方法,它们都以特定且有趣的方式失败了:

  • “形状”陷阱: 一种方法根据乐器的形状来测量音量(例如,“这是鼓,所以它声音大”)。但形状在歌曲中不会改变,因此音量从未根据实际音乐进行调整。这就像根据乐器的大小而非鼓手敲击的力度来设定音量。
  • “单位”不匹配: 另一种方法试图测量鼓槌在击打鼓面之前的“原始能量”。但这种能量是以“力”为单位测量的,而大脑是以“大小”为单位测量的。这就像试图将苹果与橙子进行比较。结果呢?音量旋钮卡在最大限制处(饱和),系统停止学习。
  • “失控”循环: 第三种方法试图调整音量,却忘记将其与权重衰减(一种防止大脑过度增长的机制)挂钩。这导致了一个反馈循环,使大脑无限膨胀,音量旋钮失控旋转。

4. 结果:更出色的表现

作者在两类任务上测试了 OrScale:

  • 视觉任务(CIFAR-10): 想象教机器人识别猫和狗的图片。OrScale 获得了最高分数(94.05%),击败了之前的最佳方法(Muon)和标准方法(AdamW)。它更稳定且学习速度更快。
  • 语言任务(FineWeb-Edu): 他们训练了不同大小的机器人(从 1.25 亿参数的小模型到 11 亿参数的大模型)来阅读和写作文本。
    • 在 4 种尺寸中的 3 种上,OrScale 击败了之前的最佳方法(Muon + Moonlight)。
    • 所有测试尺寸上,它都击败了标准方法(AdamW)。
    • 关键的是,它允许研究人员使用他们已为其他方法调整好的相同“学习率”设置,从而节省了时间和金钱。

5. 核心结论

OrScale 是一种调整 AI 模型的新方法,它修复了我们在调整大脑不同部分学习“音量”时的一个特定缺陷。

  • 它测量的是真实的步长,而非虚假或静态的步长。
  • 它防止系统陷入停滞或爆炸。
  • 无论模型是小还是大,它都能让机器人学得更快、更准确。

论文声称这是一种“即插即用”的改进:你可以将其替换到现有的训练设置中以获得更好的结果,而无需重新设计整个系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →