← 最新论文
🤖 machine learning

Self-Play Reinforcement Learning under Imperfect Information in Big 2

本文针对非完美信息卡牌游戏“大贰”引入了一种自博弈强化学习框架,证明了在受控条件下 PPO 优于基于价值的方法,并强调了熵正则化与基于当前策略的自博弈在训练鲁棒多智能体方面的优势。

原作者: Aalok Patwa

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Aalok Patwa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正与三位朋友围坐在桌旁,玩一款名为“大老二”的纸牌游戏。你能看到自己手中的 13 张牌,也能看到其他人迄今为止打出的所有牌。但你无法看到朋友们手中隐藏的牌。这就是研究人员所称的“不完全信息”。你必须根据他们打出的牌、他们放弃的牌以及剩余牌的数量来猜测他们手中握着什么。

本文的目标是教导一个计算机程序(AI 智能体)如何利用强化学习(RL) 来出色地玩这款游戏。可以将 RL 想象成一名通过试错学习的学生:AI 进行成千上万次游戏,根据输赢获得“分数”(奖励),并逐渐找出最佳策略。

以下是本文发现的简要概述,辅以简单的类比:

1. 挑战:一场关于隐藏秘密的游戏

大老二之所以棘手,是因为:

  • 你无法知晓一切:你必须猜测对手手中的牌。
  • 规则每回合都在变化:有时你可以打出一张牌,有时是一对,有时则是复杂的“顺子”。合法出牌的选择列表时刻在变。
  • 短期与长期的权衡:有时立即打出你最强的牌感觉很好,但这可能会让你在之后陷入被动。AI 必须学会牺牲今天的小胜,以换取明天的整场胜利。

2. 实验:谁学得最好?

研究人员设立了一个“训练营”,用完全相同的规则、相同的计算资源和相同的时间,教导四种不同类型的 AI 学生。他们想看看哪种学习方式效果最佳。

  • 学生们
    1. PPO(“策略”学生):这名学生通过尝试不同的策略并调整其关于“该出哪张牌”的“直觉”来学习。这就像教练告诉你:“在这里打一对,感觉是对的。”
    2. Q-Learning / SARSA / 蒙特卡洛(“价值”学生):这些学生试图为每一种可能的情况 memorize 一个分数。他们会问:“如果我打出这张牌,最终能得到的确切分数是多少?”

结果PPO 学生赢得了训练营。它学得更快,并且比“价值”学生成为了更好的玩家。

  • 原因:在一个信息不透明且玩家众多的游戏中,试图计算每一步的确切未来得分,就像试图完美预测明年的天气一样——噪音太大且耗时过长。PPO 那种“根据结果调整策略”的方法效率更高。

3. 秘诀:熵(不要过于可预测)

研究人员注意到获胜的 PPO 学生有一个有趣的特点。起初,它非常自信,90% 的时间都选择同一个“最佳”出牌。但在对手看不到你牌面的游戏中,100% 的可预测性是危险的。如果你总是以同样的方式出牌,聪明的对手就会识破你。

  • 类比:想象你在玩石头剪刀布。如果你总是出“石头”,因为你觉得那是最佳选择,你的对手很快就会开始出“布”并击败你。你需要稍微混合一下出招。
  • 对策:研究人员在 AI 的训练中加入了一点“熵”(随机性)。他们告诉它:“不要 100% 确定;在你的出牌中保留一点惊喜。”
  • 结果:保持适度随机性的 AI 表现最佳。它变得更难被看穿,也更具适应性。然而,过多的随机性会导致它表现得愚蠢,因此平衡是关键。

4. 训练伙伴:你应该与谁对战?

AI 是通过自我对弈(Self-Play)来学习的。研究人员测试了三种不同的方式来安排这些练习赛:

  1. 固定对手:AI 与一个始终采用相同“聪明”策略的电脑对战。
  2. 检查点对手:AI 与训练早期保存的旧版本自身对战。
  3. 当前策略对手:AI 与当前版本的自身对战,该版本每天都在进步。

结果:与当前策略(即正在同步进步的自身版本)对战是最佳方法。

  • 类比:想象学习游泳。
    • 如果你只与一个缓慢、固定的机器人练习,你会擅长击败那个机器人,但可能学不会如何应对快速的游泳者。
    • 如果你与“过去的自己”练习,你可能是在打已经赢过的仗。
    • 如果你与现在的自己练习,难度提升的速度恰好与你技能提升的速度同步。这就像一位私人教练,根据你当前的力量精确调整杠铃的重量。这让 AI 始终保持受挑战的状态,并学习到最相关的经验。

总结

本文表明,对于像大老二这样复杂的纸牌游戏:

  1. 基于策略的学习(PPO) 比试图 memorize 确切分数更有效。
  2. 在出牌中保留一点随机性 会让你成为更难对付的对手。
  3. 与一个正在同步进步的自身版本进行练习 是学习最快的途径。

作者得出结论,大老二是一个极佳的“试验厨房”,用于教导计算机在缺乏全部事实的情况下如何做出明智决策,这种技能最终可能有助于许多信息不透明的现实世界情境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →