← 最新论文
🤖 machine learning

Superhuman AI for Generals.io Using Self-Play Reinforcement Learning

本文介绍了一种用于即时战略游戏 Generals.io 的超人类 AI 智能体,该智能体通过利用一个具有 10,000 倍加速的 JAX 原生模拟器,以实现通过自我博弈强化学习对视觉 Transformer 策略进行高效的端到端训练,从而在公开排行榜上取得了第 1 名的排名。

原作者: Matej Straka, Viliam Lisý, Martin Schmid

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Matej Straka, Viliam Lisý, Martin Schmid

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个名为 Generals.io 的数字战场。这是一个实时策略游戏,两名指挥官(或两支队伍)在网格地图上指挥军队。他们无法同时看到整张地图,只能看到自己拥有的土地以及部队周围的即时区域。其余部分都被隐藏在“战争迷雾”中。目标很简单:占领敌方的总部(将军),同时保护好自己的将军。

这篇论文描述了一支研究团队如何构建了一个如此强大的 AI,以至于它击败了世界上最优秀的顶尖人类玩家。以下是他们实现这一目标的背后故事,通过简单的概念进行了拆解。

1. “超高速”模拟器

在训练 AI 之前,他们需要一种练习方式。在过去,在这个游戏中训练 AI 就像是通过观察汽车每小时移动一英寸来学习开车,过程太慢了。

研究人员使用一个名为 JAX 的特殊工具构建了一个新的“模拟器”(游戏的数字版本)。你可以把它想象成从自行车升级到了超音速喷气式飞机。

  • 旧方式: 旧版本在标准计算机上每秒只能运行约 3,500 个游戏步长。
  • 新方式: 他们的新版本在单个显卡上每秒可以运行 5,000 万个步长
  • 结果: 这实现了 10,000 倍的加速。这意味着 AI 在人类玩一局游戏的时间里,可以玩数百万局游戏。这种速度消除了最大的瓶颈:AI 终于可以足够快地进行学习,从而变得非常强大。

2. “自我博弈”训练营

他们并没有通过向 AI 展示人类专家的视频来教它(这就像是通过只看国际象棋大师的比赛来教人下棋),而是让 AI 与自己对战。

  • 方法: AI 与自己的副本进行数百万场比赛。
  • 奖励: 游戏规则非常简单:要么赢(+1 分),要么输(-1 分)。这里没有“参与奖”,也没有因为消灭了几名敌军士兵而给的分数。只有当你占领敌方将军时,你才会获得奖励。
  • 挑战: 由于奖励非常稀缺(你只有在漫长的游戏结束时才会获得它),AI 很难弄清楚自己到底做对了什么。这就像是通过只品尝最终成品来学习烘焙蛋糕,却没有任何关于是否糖放多了或面粉放少了的反馈。

3. 秘诀:究竟是什么起作用了

研究人员测试了许多不同的“配方”,以观察是什么让 AI 达到了超人类水平。他们发现,一些人们认为必要的要素实际上是没用的,而一些简单的技巧却带来了巨大的差异。

  • 无需“小抄”: 他们不需要给 AI 复杂的规则或针对“好事”(如占领城堡)而手工设计的奖励。由于有了超快速模拟器,仅仅靠简单的“胜或负”信号就足够了。
  • “平均型”学生 (EMA): 在许多 AI 系统中,你会使用训练结束时的最后一个版本的 AI。研究人员发现,对 AI 大脑进行指数移动平均 (EMA) 处理效果更好。
    • 类比: 想象一个学生每天都在参加考试。“最后一次迭代”只是他在最后一天得分。而“EMA”就像是取他整个月表现的平均值。研究人员发现,“平均型学生”比他在表现最好或最差的那一天要更稳定、更聪明。
  • 过滤“优质”游戏 (Top-Advantage Filtering): AI 玩了数百万场比赛,但大多数都是无聊或随机的。研究人员意识到,他们不需要从每一场比赛中学习。他们只保留了前 25% 的、AI 具有明显优势的比赛,并从中学习。
    • 类比: 如果你在学习游泳,你不需要观看每一次你在水中挣扎扑腾的过程。你只需要研究那些你游得流畅且高效的时刻。这使得训练更加快速且高效。
  • 从小规模开始: 他们并没有一开始就在一张巨大的地图上进行。他们从将军们距离很近的情况开始,让 AI 能够快速学会如何获胜。然后,他们慢慢地将将军们拉开距离,让 AI 循序渐进地学习长期策略。

4. 结果:击败人类

在强大的计算机上进行了四天的训练后,这个被称为“Average Joe”的 AI 进入了公开排行榜。

  • 排名: 它达到了 5,000 多名人类玩家中的 第 1 名
  • 差距: 它以巨大的优势击败了排名第二的人类。事实上,该 AI 与第二名人类之间的差距,与第二名人类与第 25 名人类之间的差距一样大。
  • 正面交锋: 当它直接对阵前两名人类玩家时,它赢了 199 局,仅输了 70 局
  • 对抗旧版机器人: 它也以 100% 的胜率碾压了之前的最佳 AI 和最好的“基于规则”的机器人(后者使用数学公式而非学习)。

5. AI “看到了”什么

研究人员观察了 AI 的大脑内部,看看它的思考方式是否像人类。

  • “迷雾”探测器: 他们发现 AI 大脑中有一个特定的部分,似乎在追踪敌方将军躲藏的位置。
  • 类比: 想象你在黑暗中玩捉迷藏。起初,你认为那个人可能在任何地方。随着你听到声音或看到影子,你缩小了范围。最后,你锁定了他们。AI 的大脑也正是这样做的:它从一个猜测开始,随着收集到线索不断缩小范围,最后即使它无法直接看到,也能“锁定”敌方将军的位置。

总结

这篇论文证明了,你不需要复杂的、手工设计的规则或海量的人类数据,就能为策略游戏创造出一个超人类水平的 AI。如果你拥有一个足够快的模拟器和一个简单的“胜或负”奖励,标准的学习算法就能自行搞定一切。其关键要素在于速度、耐心(结果平均化)以及只关注最具信息量的比赛。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →