Data-Augmented Game Starts for Accelerating Self-Play Exploration in Imperfect Information Games
本文介绍了数据增强游戏开局(DAGS),这是一种通过从离线人类演示初始化强化学习来加速大规模不完美信息游戏探索的方法,从而在固定计算预算下实现更低的可被利用性,同时为潜在的均衡偏差提供解决方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人玩一种非常复杂、高风险的纸牌游戏(比如扑克),但有一个转折:机器人必须先穿过一个巨大且令人困惑的迷宫,才能到达游戏发生的牌桌。
这就是该论文要解决的问题。在《星际争霸》或《反恐精英》这类游戏中,“游戏”(即策略)往往深埋在巨大的“迷宫”(即漫长的移动、瞄准和资源收集序列)之中。如果你只是让机器人每次都从头开始,它会把所有时间都花在迷路上,永远无法真正学会策略,因为它很少能到达牌桌。
作者 JB Lanier 及其团队使用一种名为DAGS(数据增强游戏开局)的方法来解决这个问题。
问题:“无尽的行走”
将标准的训练过程想象成送学生去上学。他们必须从家出发,穿过社区,经过公园,再沿着长长的走廊走到教室。
- 问题所在:如果走廊长达 10 英里且充满死胡同,学生 99% 的时间都在走路,只有 1% 的时间真正在学习数学。在人工智能术语中,这被称为“稀疏奖励”。机器人直到最终到达游戏的策略部分(这可能需要数百万步)之前,都得不到任何反馈。
解决方案:“传送门”(DAGS)
作者们提出,与其让机器人每次都走完全程,不如说:“让我们利用熟练人类走过的路径图。”
他们使用人类玩家的记录数据集。这些人类玩家不一定是天才,但他们知道如何走过迷宫而不迷路。
- 技巧:当机器人开始新一轮训练时,系统不再让它从正门出发,而是随机将其“传送”到人类路径上的某个中间位置。也许它直接把机器人送到教室门口,或者走廊的半途中。
- 结果:机器人不再浪费时间学习如何走路;它直接从有趣的策略开始的地方起步。它可以专注于学习“如何玩纸牌游戏”,而不是“如何到达纸牌游戏”。
隐患:“虚假记忆”问题
这种传送方法存在一个隐藏的危险。
想象纸牌游戏有一条秘密规则:“如果你戴着红帽子,你就必须虚张声势。”
- 正常训练:机器人只有从家一路走到底时才能看到红帽子。它学会了这种关联:“红帽子 = 虚张声势”。
- DAGS 训练:如果机器人被直接传送到牌桌,它可能会在没有走过路径的情况下看到红帽子。它可能会开始想:“哦,这里每个人都戴着红帽子”,即使这在真实游戏中并非如此。它会形成一种有偏见的信念。它学会的策略在“传送”世界中有效,但在现实世界中却会失败。
修正方案:"ID 徽章”
为了防止机器人混淆,作者们给机器人配备了一个ID 徽章(观察标志)。
- 当机器人被传送时,徽章显示:“我处于训练区。”
- 当机器人从头开始时,徽章显示:“我处于现实世界。”
机器人同时学习两件事:
- 如何在训练区表现出色(利用传送门快速学习)。
- 如何在现实世界中正确游戏(忽略传送门的捷径)。
由于机器人在这两项任务中共享其“大脑”,在训练区学到的经验有助于它在现实世界中变得更聪明,但 ID 徽章确保它不会搞混规则。
他们的测试
作者们不仅谈论这一点,还建立了一个测试实验室。
- 游戏:他们选取了简单的纸牌游戏(Kuhn 扑克和 Goofspiel),并将它们包裹在一个“迷宫”中(一个网格,机器人必须走到特定方格才能行动)。
- 结果:
- 没有传送门时,机器人被困在迷宫中,从未学会好好玩游戏。
- 有了传送门,机器人学习得更快、更好。
- 然而,在一个专门用于测试混淆的“ trick”游戏中,传送门确实导致机器人产生了错误的信念。但是,当他们添加ID 徽章后,机器人修正了信念并学会了正确的策略。
核心结论
该论文证明,通过使用人类数据将 AI“传送”到有趣的地点,而不是每次都让它从头开始,可以加速 AI 在复杂游戏中的学习。然而,你必须小心不要让 AI 混淆它所在的位置,他们通过给 AI 一个简单的"ID 徽章”来区分训练与现实,从而解决了这一问题。
这使得 AI 能够在相同的计算资源下,解决那些以前因规模过大或时间过长而无法学习的游戏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。