← 最新论文
🤖 machine learning

Understanding Dynamics of Adam in Zero-Sum Games: An ODE Approach

本文建立了一个连续时间常微分方程框架来分析零和博弈中的 Adam-DA 算法,揭示了其动量参数的作用与在最小化问题中的角色截然相反,并通过生成对抗网络实验验证了这些理论见解。

原作者: Yi Feng, Weiming Ou, Xiao Wang

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yi Feng, Weiming Ou, Xiao Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试训练两个 AI 智能体互相进行国际象棋对弈。一方玩家(“生成器”)希望创造出看起来逼真的虚假棋局,而另一方玩家(“判别器”)则希望识破这些赝品。这是一场零和博弈:一方获胜,另一方必败。

为了训练它们,我们使用一位名为Adam的聪明教练。在常规训练(即 AI 试图最小化单一误差,例如预测天气)中,Adam 是一位超级明星。它利用“动量”保持向前滚动,忽略微小的颠簸,并在下坡时加速。

然而,当这位同样的教练试图训练两个互相对抗的玩家时,情况变得奇怪起来。你提供的论文《Understanding Dynamics of Adam in Zero-Sum Games》发现,在这些博弈中,Adam 的表现与常规训练中的表现截然相反。

以下是他们研究发现的分解,使用了简单的类比:

1. 问题所在:教练感到困惑

在常规训练中,教练利用动量帮助 AI 滑过小颠簸,快速到达山谷底部。论文发现,在零和博弈(如生成对抗网络 GANs)中,如果教练使用同样的“滑行”动量,两名玩家会开始原地打转或互相远离,而不是进行学习。

作者意识到,要理解为什么会发生这种情况,他们不能仅仅观察一步步的移动。相反,他们构建了一个连续时间模型(常微分方程,ODE)。

  • 类比:想象观看一部玩家移动的电影。离散的步骤就像电影的单个帧。作者创建了一部平滑的高清视频(即 ODE),它能完美预测电影的运动。这部平滑的视频揭示了那些被单个帧所隐藏的博弈规则。

2. 发现一:“动量”开关被反转了

论文聚焦于 Adam 教练中的两个设置:

  • 一阶动量(β\beta:教练记住上一次移动方向的程度。
  • 二阶动量(ρ\rho:教练记住上一次移动速度的程度。

在常规训练(最小化)中:

  • 为了快速且稳定地行进,你需要动量。这就像一辆重型卡车;一旦它开始移动,就很难停下,这有助于它冲破崎岖的地形。

在零和博弈中(论文的发现):

  • 作者发现,动量实际上更好。
  • 类比:想象两名舞者试图同步。如果他们都有“重型卡车”般的动量,他们会互相冲过头,失控旋转并最终相撞。但如果他们以轻盈、敏捷的步伐(低动量)移动,他们就能迅速调整以适应对方的动作,找到稳定的节奏。
  • 结果:论文从数学上证明,在这些博弈中,使用较小的一阶动量允许玩家在更广泛的步长范围内收敛(学习)。如果你使用“标准”的高动量,他们往往会发散(失败)。

3. 发现二:寻找“平坦”的地面

在机器学习中,我们通常希望 AI 找到景观中的“平坦”区域,而不是尖锐的“尖峰”。

  • 尖锐尖峰:AI 完美地记住了训练数据,但在新数据上表现不佳(过拟合)。
  • 平坦山谷:AI 学习了通用模式,并在新数据上表现良好。

在常规训练中:

  • 为了找到这些平坦山谷,你通常需要动量和速度动量。

在零和博弈中:

  • 论文发现情况恰恰相反。为了找到博弈稳定的“平坦”区域,你需要一阶动量和二阶动量。
  • 类比:将损失景观想象成一片凹凸不平的田野。在常规博弈中,一辆重型卡车(高动量)能帮助你滚过颠簸找到平坦之处。而在零和博弈中,“卡车”太重了,会卡在深坑里。相反,你需要一个轻量级、有弹性的球(低动量),它可以在边缘弹跳,并自然地落入宽阔平坦的区域。

4. “双线性”陷阱

论文还考察了一种特定类型的博弈,称为“双线性博弈”(冲突的一种非常简单、线性的版本)。

  • 发现:无论你为 Adam 教练选择什么设置,它在这类特定博弈中总是失败(发散)。
  • 类比:这就像试图将铅笔立在笔尖上。无论你多么轻柔地试图稳住它,物理规律使得它不可能保持平衡。这与常规训练形成了根本性的差异,在常规训练中,Adam 几乎总能找到解决方案。

5. 实锤(实验)

作者不仅做了数学推导,还在真实的 AI 图像生成器(GANs)上进行了测试,使用了 CIFAR-10 和 STL-10 等数据集。

  • 实验:他们使用不同的动量设置训练了 AI 模型。
  • 结果:使用“反转”设置(低一阶动量,高二阶动量)的模型产生了:
    1. 更小的梯度范数(意味着它们正在探索那些更“平坦”、更稳定的区域)。
    2. 更好的图像质量(更高的 Inception 分数)。
    3. 更稳定的训练过程。

总结

这篇论文告诉我们,适合单人跑步者(最小化)的方法并不适用于拔河(零和博弈)。

  • 单人跑步者:需要一辆沉重、快速移动的卡车(高动量)来抵达终点。
  • 拔河:需要两名轻盈、敏捷的舞者(低动量)来保持同步。

作者使用数学上的“平滑视频”(ODE)证明,Adam 的标准设置实际上正在损害像 GANs 这类博弈的性能,而翻转动量设置可以解决这个问题。这解释了为什么经验丰富的从业者在 GANs 中多年来一直使用“负动量”(一种低动量的形式),尽管直到现在理论才解释了为什么它有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →