GAE Falls Short in Imperfect-Information Self-Play Reinforcement Learning
本文介绍了方差缩减策略优化(VRPO),这是一种新算法,它采用-增强方差缩减优势估计器来克服标准广义优势估计在不完备信息自对弈中固有的高方差问题,从而在斗地主和单挑无限注德州扑克等竞争性多智能体游戏中实现更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一群机器人玩像扑克或《斗地主》(一种流行的中国纸牌游戏)这样复杂的卡牌游戏。难点在于:它们无法看到彼此的牌,而且对手正试图欺骗它们。为了获胜,机器人需要学会一种极其平衡且不可预测的策略,使任何对手都无法利用。这被称为寻找“均衡”。
长期以来,训练这些机器人的最佳方法是自我对弈:让机器人相互对弈数百万次。其中最流行的“教练”算法是PPO(近端策略优化)。
然而,本文作者发现,PPO 在教授机器人玩这种“暗牌”游戏时存在一个隐藏的“故障”。以下是该问题及其解决方案的拆解,辅以简单的类比说明。
问题:拥挤房间里的“嘈杂耳语”
在标准的 PPO 中,机器人通过回顾自己过去的行动路径来学习,并询问:“那步棋走得好吗?”为了回答这个问题,它使用一种名为GAE(广义优势估计)的工具。
可以将 GAE 想象成一位教练,根据游戏回放向玩家耳语建议。
- 在简单游戏(如国际象棋)中:未来是可预测的。如果教练说:“你把兵移到了这里,这导致了胜利”,玩家就能确切知道原因。
- 在暗牌游戏(如扑克)中:未来充满了随机性。教练的耳语变得含糊不清,因为机器人必须猜测其他机器人接下来可能会做什么。由于机器人为了迷惑对手而随机行动,教练的建议就变成了“嘈杂的耳语”。
类比:想象在一个所有人都在随机旋转的房间里学习舞蹈套路。
- 旧方法(GAE):教练试图告诉你:“如果你向左迈步,你就安全了。”但因为其他人都在疯狂旋转,教练的声音被混乱淹没。机器人听到的是:“向左迈……也许?或者向右?很难说!”这种“噪音”使得机器人的学习变得不稳定且缓慢。
- 本文的发现:即使教练是完美的(对游戏了如指掌),噪音也源于其他舞者随机旋转的事实。机器人无法区分这是一步坏棋,还是仅仅因为其他玩家的随机性导致的坏运气。
解决方案:"Q-Boosting"(水晶球)
作者发明了一种名为Q-Boosting的新工具来解决这种噪音问题。
与其让教练基于单次随机回放猜测接下来会发生什么,Q-Boosting 要求教练同时审视所有可能的未来并计算其平均值。
- 类比:旧教练会说:“我看到你向左迈步,那一次有人撞到了你。”而新教练会说:“我已经计算出,如果你向左迈步,50% 的情况下你会安全,30% 的情况下你会被阻挡,20% 的情况下你会被绊倒。平均而言,向左迈步是个好主意。”
通过在给出建议之前通过数学计算将随机性平均化,教练消除了“噪音”。机器人接收到的是清晰、冷静的信号:“这一步平均来看是好的”,而不是“这一步这一次很好,但那一次可能不好”。
他们将这种新的训练方法称为VRPO(方差减少策略优化)。
结果:更聪明的机器人,更快的胜利
该论文在几款游戏中测试了这种新方法(VRPO)与旧标准(PPO):
小型游戏(测试厨房):他们玩了“吹牛骰子”和“幻影井字棋”等游戏。在这些游戏中,他们可以从数学上证明机器人的强弱。
- 结果:VRPO 学到了比 PPO 强得多的策略。它更难被欺骗,意味着它更接近完美的“均衡”策略。
中型游戏(竞技场):他们玩了**《斗地主》**(一种复杂的双人三玩家卡牌游戏)。
- 结果:VRPO 在直接对决中击败了之前的最佳 AI(名为 PerfectDou),尽管两者使用的计算资源相同。它学会了更频繁地获胜。
大型游戏(锦标赛):他们尝试了单挑无限注德州扑克(一种高风险的扑克变体)。
- 结果:VRPO 在面对名为 Slumbot 的强大扑克机器人时表现非常出色。它能够在长时间的对局中赢得资金,且无需任何“作弊”手段,例如预看未来的牌或在游戏过程中进行复杂的数学计算。它仅仅通过训练就学到了更好的策略。
总结
该论文认为,在教机器人玩暗牌游戏时,旧的学习方法(GAE)会被其他玩家的随机性搞得晕头转向。而新方法(结合 Q-Boosting 的 VRPO)则像一位超级聪明的教练,在给出建议之前会平均化所有可能性。这消除了困惑,使机器人能够学得更快、表现更稳定,并且更难被击败。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。