← 最新论文
🤖 machine learning

Unlocking Feature Learning in Gated Delta Networks at Scale

本文推导并验证了门控增量网络(Gated Delta Networks)的最大更新参数化(μ\muP)缩放规则,证明了与标准参数化不同,这些规则能够实现零样本超参数迁移以及跨模型宽度的稳定训练。

原作者: Yifeng Liu, Quanquan Gu

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifeng Liu, Quanquan Gu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨型机器人写故事。机器人变得越大(拥有更多的“脑细胞”或参数),教导它正确知识就变得越困难。通常情况下,如果你为小机器人找到了完美的教学速度(学习率),当你切换到巨型机器人时,你必须完全重新调整那个速度。这就像是寻找花园水管的最佳水压;如果你换成消防水管,同样的水压要么毫无作用,要么会把水管冲爆。

这篇论文介绍了一种新型的机器人大脑,叫做门控增量网络(Gated Delta Network)。这些大脑非常特别,因为它们能非常高效地记忆长篇故事而不会感到负担过重,这与目前主流的“Transformer”大脑不同。然而,由于它们的工作方式不同,旧的教学规则对它们不再适用。

以下是作者所做工作的拆解,使用了简单的类比:

1. 问题所在:“一刀切”的规则行不通

长期以来,科学家们一直使用一套标准的规则手册(称为标准参数化/Standard Parametrization)来教导这些机器人。这本规则手册说:“如果你将机器人的规模增加一倍,请保持教学速度不变。”

  • 结果: 这对旧的、标准的机器人效果很好。但对于这些新型的高效门控增量网络,它失败了。当人们尝试在大型机器人上使用与小型机器人相同的教学速度时,大机器人要么学不到任何东西,要么会陷入疯狂。

2. 解决方案:一个新的“规则手册”(µP)

作者创建了一个更聪明的新规则手册,叫做极大更新参数化(Maximal Update Parametrization, µP)。你可以把它想象成一个用于教学速度的“通用翻译器”。

  • 目标: 找到一套规则,使得你在微型机器人上找到的教学速度,无需任何修改就能完美适用于大规模机器人。这被称为“零样本迁移(zero-shot transfer)”。
  • 挑战: 这些新机器人有一个特殊的“记忆循环”(它们通过不断更新状态来记忆事物)。旧的数学模型无法处理这种循环,因此作者必须进行新的数学推导,以精确计算出如何为机器人的每个部分调整教学速度。

3. 发现:不同的部分需要不同的“教学速度”

作者发现,这种新型机器人大脑的不同部分并不相同。他们发现有两个特定的部分需要特殊对待,这令他们感到意外:

  • “守门员”(门控权重/Gating Weights): 想象机器人有一些小门,决定让哪些信息进入。作者发现,控制这些门的“旋钮”需要转动得更加轻柔(更慢的学习率)一些,比大脑的其他部分都要慢。如果转得太快,机器人就会忘记如何开门。
  • “音量旋钮”(标量参数/Scalar Parameters): 还有一些用来调节信号强度的微型音量旋钮。这些旋钮需要被转动得极其激进(更快的学习率)一些。

这就像是在调校一件复杂的乐器:大多数琴弦需要标准的调音,但低音弦需要转动得非常宽松,而细小的极高音弦则需要转动得非常紧凑,否则音乐听起来会很糟糕。

4. 证明:它在现实世界中有效

作者不仅在纸面上做数学推导,他们还制造了这些机器人并进行了测试。

  • 实验: 他们在海量的文本库(FineWeb-Edu)上训练了这些机器人,以观察它们的学习效果。
  • 结果:
    • 当使用旧规则时,不同规模的机器人需要完全不同的教学速度。
    • 当使用他们的新规则时,为最小的机器人找到的教学速度可以完美适用于最大的机器人。无论机器人变得多么庞大,它们都能稳定且持续地学习。

总结

这篇论文是一份针对特定高效类型 AI 的“用户手册”。作者发现,由于这类 AI 的工作方式不同,你不能直接复制粘贴训练设置。他们推导出一套新的设置,使你可以训练一个微型版本的 AI,找到完美的设置,然后立即将这些完全相同的设置应用到巨型版本的 AI 上,从而节省大量的训练时间和计算资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →