← 最新论文
🤖 machine learning

Scaling the Memory of Balanced Adam

本文提出,平衡型 Adam 中的动量参数 β\beta 应被视为记忆尺度变量而非固定常数,并引入了一种刷新规则(Rβ1000R_\beta \approx 1000),通过将优化器的统计记忆视界与有效学习视界对齐,在 11 项视觉与语言实验中显著提升了训练鲁棒性。

原作者: Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《平衡 Adam 的记忆扩展》的通俗解读,辅以日常类比。

宏观图景:调校“学习机器人”的“记忆”

想象你正在教一个机器人识别猫、写诗或解决数学问题。为此,机器人使用一种名为Adam(一种“优化器”)的工具。把 Adam 想象成机器人的内部教练。每当机器人犯错时,教练就会回顾过去的错误历史,决定如何调整机器人的“大脑”以进行下一次尝试。

长期以来,这位教练拥有两个不同的“记忆设置”(称为 β1\beta_1β2\beta_2)。一个设置用于记住错误的方向,另一个用于记住错误的幅度

这一发现:
近期研究(包括本文)表明,你实际上并不需要两个不同的设置。如果将这两个设置设为完全相同(β1=β2\beta_1 = \beta_2),机器人依然能同样高效地学习,但系统会变得更加简单。现在,教练只需要一个记忆旋钮来调节。

问题所在:
关键问题是:我们应该把这个旋钮调到什么数值?
大多数人只是选择一个标准数值(例如 0.9)并坚持使用,无论情况如何。本文作者认为,这就像用同一双鞋去走 5 英里和跑 100 英里马拉松。这是不合理的,因为训练的“距离”发生了变化。

核心思想:“刷新次数”

作者提出了一种思考该记忆旋钮的新方式。与其将其视为一个固定数值,不如将其视为一个记忆视界

  • 类比: 想象机器人正在通过阅读一本书来学习一门语言。
    • 如果机器人拥有短记忆,它只记得最后几句话。
    • 如果机器人拥有长记忆,它记得整整一章的内容。

本文引入了一个名为**刷新次数(RβR_\beta)**的概念。它回答了这样一个问题:“在整个训练过程中,机器人将其对过去的记忆完全刷新了多少次?”

作者发现,无论训练过程长短,只要这个“刷新次数”保持大致不变,机器人的学习效果最佳。

  • 短训练过程: 机器人需要短记忆(较低的数值),以便其记忆能刷新约 1,000 次。
  • 长训练过程: 机器人需要长记忆(较高的数值),以便其记忆仍然能刷新约 1,000 次。

解决方案:一条简单规则

本文在 11 项不同的任务上测试了这一想法,范围从教机器人识别图像(如猫和汽车)到教其撰写文本(如大型语言模型 LLM)。

他们发现了一条简单的“黄金法则”:
将记忆旋钮设定为:在训练的有效部分,让机器人恰好刷新其记忆 1,000 次。

  • 如果训练较短(例如 6,000 步),该规则会选择较低的数值(如 0.82)。
  • 如果训练较长(例如 40,000 步),该规则会选择较高的数值(如 0.97)。

这为何重要?(结果)

作者将他们的“刷新规则”与标准的“固定规则”(即大家都使用 0.944)进行了比较。

  1. 平均表现: 两种方法在平均成功率上非常接近。标准的固定数值实际上相当不错。
  2. “安全网”(鲁棒性): 这正是新规则大放异彩的地方。
    • 想象你在开车。“固定规则”就像是在大多数道路上都能胜任的速度,但有时你可能会撞上坑洼而发生事故。
    • “刷新规则”则像是一套智能悬挂系统。它能根据道路长度进行调整。
    • 结果: 新规则将“最坏情况”下的失败率降低了33%。换句话说,它使训练变得更加可靠。它确保了每一次实验(全部 11 次)的表现都近乎完美,而旧方法中则有几次实验表现挣扎明显。

结语

本文主张,我们不应将 AI 训练中的记忆设置视为静态不变的常数。相反,我们应该将其视为一种尺度

正如你不会用同一张地图比例尺来绘制城市和整个国家一样,你也不应为短训练过程和长训练过程使用相同的记忆设置。通过根据训练时长调整记忆(将“刷新次数”保持在 1,000),我们使 AI 训练过程更加稳健,减少了意外失败的可能性。

简而言之: 不要只是随机选个数字并寄希望于好运。根据旅程的长短调整机器人的记忆,你将获得更加平稳的旅程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →