← 最新论文
🤖 machine learning

EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games

本文介绍了 EMAgnet,这是一种新颖的策略梯度自我博弈方法,它通过使用过去策略参数的指数移动平均作为自适应正则化目标,改进了均匀正则化,从而在存在支配策略的大型游戏中实现了更低的被利用率和更好的性能。

原作者: Tristan Maidment, JB Lanier, Chase McDonald, Nathan Tsang, Eugene Vinitsky, Roy Fox, Albert Wang, Wesley N. Kerr

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Tristan Maidment, JB Lanier, Chase McDonald, Nathan Tsang, Eugene Vinitsky, Roy Fox, Albert Wang, Wesley N. Kerr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人玩一款复杂的卡牌游戏,让它进行自我博弈。目标是找到完美的策略(即“纳什均衡”),让机器人变得无懈可击。

过去,研究人员使用了一种名为 PPO(一种标准的 AI 训练方法)的方法,并配合了一个特定的技巧:他们告诉机器人,“不要对某一个动作感到过于舒适;要平等地尝试所有动作。”他们通过强制机器人将每一个可能的动作都视为等概率发生的来实现这一点。这就像是一个严厉的教练在吼叫:“你必须练习每一个招式,哪怕是那些糟糕透顶的招式,也要练习得一样多!”

这篇论文介绍了一种名为 EMAgnet(指数移动平均磁铁)的新方法。它是如何工作的,我们可以用简单的类比来解释:

旧方法的问题(“均匀磁铁”)

想象机器人正在学习玩石头剪刀布,但其中隐藏着一个陷阱:其中一个动作实际上是一个“认输”按钮,按下它会让你立即输掉比赛。

  • 旧教练(均匀磁铁): 这个教练坚持要求机器人把“认输”按钮当作石头、剪刀或布一样频繁练习。起初,这很有帮助,因为这能防止机器人完全忽略“认输”这个动作。但随着机器人变得越来越聪明,意识到“认输”是一个很烂的招式时,教练仍然强迫它去练习那个糟糕的动作。这浪费了机器人的时间和精力在那些行不通的策略上。
  • 结果: 机器人变得困惑了。它要么在糟糕的动作上浪费太多时间,要么一旦教练停止强制它练习,机器人就会忘记如何正确地混合它的优秀招式,而是直接随机挑选一个动作死磕到底。

新的解决方案:EMAgnet(“自适应磁铁”)

EMAgnet 改变了教练的方法。它不再强迫机器人平等地练习所有东西,而是使用了一个移动目标

  1. 机器人的“幽灵”: 教练保留了一个机器人大脑的“幽灵”版本。这个幽灵是机器人目前所学到的一切内容的平均值。
  2. 磁铁: 教练试图让机器人的当前大脑靠近这个“幽灵”。
  3. 神奇之处:
    • 如果机器人发现“认输”是个坏主意并停止这样做,那么幽灵也会停止这样做。
    • 因为幽灵停止了那个坏动作,所以教练也停止了强迫机器人去练习它。
    • 然而,教练会保持压力,要求机器人继续混合它的优秀招式(石头、剪刀、布),以免它只固守于某一个动作。

简而言之: 旧的方法就像一个即便在你写字已经很好了,却依然让你反复练习最差字迹的老师。EMAgnet 则是一个会说:“做得好,不再犯那个坏习惯了!现在,让我们继续练习你优秀的字迹,这样你才不会变得懒散。”

论文的研究发现

研究人员在几种游戏中测试了这种新方法:

  • 标准游戏: 在普通游戏中,EMAgnet 的表现与旧方法一样出色。
  • 带有“陷阱”的游戏(严格劣势策略): 他们增加了带有陷阱的游戏,其中大部分动作都是糟糕的陷阱(比如“认输”按钮,或者在迷宫中大部分路径都通向死胡同)。
    • 旧的方法表现挣扎。它们要么在陷阱上浪费时间,要么无法找到获胜策略。
    • EMAgnet 胜出了。 它学习得更快,也找到了更好的策略,因为它能够自然地“忘记”坏动作,同时记住好的动作。

大局观

随着游戏变得更加复杂(如现实世界的策略游戏),坏动作的数量会呈爆炸式增长。旧的方法会在学习坏动作上浪费大量能量。EMAgnet 更聪明:它会根据机器人的当前水平来调整教学风格,只专注于那些真正重要的策略。

论文得出结论:通过使用“移动平均”——即利用机器人过去的自我作为引导——这一简单的微调,可以让 AI 在无需更改核心训练算法的情况下,更好地解决复杂且棘手的游戏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →