FootsiesGym: A Fighting Game Benchmark for Two-Player Zero-Sum Imperfect-Information Games
本文介绍了 FootsiesGym,这是一个基于极简主义格斗游戏 Footsies 的开源向量化基准环境,旨在促进针对双人零和非完全信息博弈的强化学习算法的高效研究与训练。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想教一个机器人如何成为一名格斗大师。你面临两个糟糕的训练选择:
- 国际象棋棋盘: 它太简单了。规则清晰,招式简短,缺乏真实的“格斗感”。这就像通过在跑步机上走路来教别人游泳。
- 真正的奥运会: 它太难了。像《街头霸王》或《Dota 2》这样的游戏规模巨大且极其复杂,你甚至需要一台超级计算机才能运行一次练习赛。这就像试图通过跳进飓风中心来学习游泳。
FootsiesGym 是一个“金发姑娘原则”(取中间值)的解决方案。它是一个基于一款名为 Footsies 的极简格斗游戏构建的新型开源训练场。它足够简单,可以在普通电脑上运行;但也足够复杂,足以教会机器人格斗中深层且诡谲的心理战。
以下是论文如何利用日常比喻来拆解其内容的:
1. 游戏:带有转折的“石头剪刀布”
在真正的格斗游戏中,有长连招和华丽的招式。在 Footsies 中,他们剥离了这一切,只专注于中段对峙(Neutral Game)。
把中段对峙想象成两名拳击手互相绕圈,等待时机的时刻。这是一个持续不断的石头剪刀布游戏:
- 如果你攻击,我可以防御。
- 如果我防御,你可以逼近。
- 如果我逼近,你可以闪避。
这里没有唯一的“最佳招式”。如果你总是出拳,会被挡住;如果你总是移动,会被击中。你必须像玩扑克牌的玩家进行诈唬一样,随机混合你的招式,让对手无法预测你。这被称为“非传递性”策略(即 A 胜 B,B 胜 C,但 C 胜 A)。
2. 训练健身房:高速模拟器
研究人员构建了一个“向量化模拟器”。想象一下,普通的视频游戏就像一个人在跑步机上跑步。FootsiesGym 则像是一个拥有 128 台跑步机同时运行的大型健身房,并由同一个大脑控制。
- 速度: 它运行得非常快,以至于一台标准电脑每秒可以模拟 52,500 个游戏步骤。这就像是在喝一杯咖啡的时间里,已经打了上百万场比赛。
- “盲区”因素: 就像现实生活中一样,你无法看到对手的想法。AI 只能看到屏幕上的内容,而看不到对手正在计划什么。这使其成为一个真正的预测性测试,而不仅仅是反应力测试。
3. “特殊招式”难题
论文中最有趣的发现之一是关于“特殊攻击”的问题。在这个游戏中,你可以通过按住一个按钮特定时间(60 帧)来蓄力一个强力招式。
- 类比: 想象尝试教一只狗按指令吠叫。如果你只是随机扔零食,狗可能会因为偶然而吠叫一次,但它不会理解其中的模式。
- 结果: 研究人员发现,标准的 AI 训练方法很难发现这种特殊招式。因为该招式需要一个非常特定的动作序列(按住 60 帧,然后释放),随机探索就像是在大海捞针。AI 大多忽略了它,转而固守简单的出拳和防御。这表明,即使是在一个“简单”的游戏中,一些聪明的策略也难以通过标准 AI 自行发现。
4. 结果:聪明但乏味?
研究人员测试了几种 AI 算法,看谁学得最好。
- 获胜者: 这些 AI 变得非常擅长击败“笨拙”的对手(比如只会原地站立的机器人)。它们学会了约 90% 的胜率。
- 问题所在: 随着 AI 变得越来越聪明,它们变得过于谨慎。它们学到,最稳妥的获胜方式就是等待并做出反应,而不是采取风险或使用酷炫的特殊招式。它们变成了“乏味”的战士,从不主动发起进攻。
- 教训: 仅仅通过“赢”来证明是最强的,并不一定意味着它是最有意思或最具参与感的对手。论文指出,我们需要新的方法来教导 AI,不仅要让它强大,还要让它具有主动性和趣味性。
为什么这很重要
论文认为,FootsiesGym 是研究人员完美的“实验实验室”。它运行速度快,足以进行数千次实验;但它又足够复杂,能向我们展示当前 AI 方法在何处失效(例如发现隐藏策略或平衡侵略性与防御性)。它填补了简单数学谜题与混乱真实的视频游戏现实之间的鸿沟。
简而言之: FootsiesGym 是一个微型、高速、开源的格斗竞技场,旨在帮助我们弄清楚如何教导 AI 像人类战士一样思考,而不仅仅是一个遵循剧本的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。