← 最新论文
🤖 machine learning

Adaptive Memory Momentum via a Model-Based Framework for Deep Learning Optimization

本文提出了一种名为自适应记忆的新型基于模型的框架,该框架通过用两个平面近似目标函数来动态调整训练过程中的动量系数,在无需额外超参数调优的情况下,于多种任务中展现出优于 SGD 和 AdamW 等标准优化器的性能。

原作者: Kristi Topollai, Anna Choromanska

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Kristi Topollai, Anna Choromanska

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图穿越一座巨大且雾气弥漫的山脉,以找到山谷的最底部(这代表了人工智能模型的理想解决方案)。你无法看清整条路径,因此必须根据脚下当前的坡度迈出小步。这就是人工智能模型“学习”的方式。

大多数人工智能模型使用一种称为**动量(Momentum)**的方法。将动量想象成一辆从山坡上滑下的沉重雪橇。一旦雪橇开始移动,它就会积累速度。如果你遇到一个小凸起或一段轻微的上坡,雪橇的动量会帮助它直接冲过去而不停下。这通常很有帮助,但有一个问题:在当前的 AI 训练中,这辆雪橇的“重量”是固定的。你在最开始将雪橇的重量设定为一个特定数值(通常为 0.9),之后无论发生什么,都永远不会改变。

本文的作者认为,这就像驾驶一辆巡航控制被锁定在单一速度的汽车。有时你需要加速;有时你需要减速或完全停下以转过急弯。固定的设置往往不是最优的。

新想法:“智能雪橇”

本文介绍了一种名为自适应记忆动量(Adaptive Memory Momentum)的新方法。与其使用具有固定重量的沉重雪橇,不如想象一个智能雪橇,它能根据地形即时改变其重量和形状。

以下是他们构建它的方法,使用了一个简单的类比:

  1. 双平面地图:
    为了决定雪橇在任意时刻应该有多重,研究人员在你站立的位置创建了一个微小的、简化的山脉地图。他们使用两个“平面”(平坦表面)来近似地面:

    • 平面 A: 基于你此刻感受到的坡度(当前的梯度)。
    • 平面 B: 基于你刚才来的方向(你积累的动量)。
  2. 平衡行为:
    算法提出了一个简单的问题:“如果我将当前对坡度的感受与过去的动量结合起来,这会指向哪里?”

    • 如果当前的坡度与你过去的方向一致,雪橇会变得更重(高动量)。你继续加速,因为你正走在一条清晰笔直的路上。
    • 如果当前的坡度与你过去的方向相矛盾(也许你刚刚撞上了急转弯或凸起),雪橇会变得更轻(低动量)。它实际上是在说:“忘掉过去;相信此刻正在发生的事情。”这防止了人工智能因为过于固执而无法改变方向从而撞墙。
  3. 结果:
    这个“智能雪橇”在每一步都会为自己计算出一个新的重量。它不需要人类来调整它;它能即时自行确定。

他们的发现

研究人员在各种场景下测试了这个“智能雪橇”,从简单的数学问题到训练庞大的人工智能语言模型(例如那些撰写文本或进行聊天的模型)。

  • 更快: 在几乎每一项测试中,自适应雪橇都比固定重量的雪橇更快地到达了山谷底部。
  • 更稳定: 在训练早期混乱的阶段(此时人工智能感到困惑且路径崎岖不平),自适应方法减速得恰到好处以保持安全,而固定方法则经常发生碰撞或摇晃。
  • 节省设置时间: 通常,工程师必须花费大量时间手动调整“预热”(即他们逐渐增加速度的时期),以防止人工智能在开始时发生碰撞。自适应方法会自动处理这一点,从而可能消除对该手动调整的需求。

结论

该论文声称,通过让人工智能在每一步自行决定保留多少“过去记忆”,而不是强迫它永远记住相同数量的内容,我们可以更快、更可靠地训练人工智能模型,并减少人工干预。这是对数学的一个简单改变,它充当了学习过程的动态减震器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →