← 最新论文
🤖 AI

Sample-Efficient Policy Space Response Oracles with Joint Experience Best Response

本文介绍了联合经验最佳响应(Joint Experience Best Response, JBR),这是一种针对策略空间响应 way 预言机(Policy Space Response Oracles, PSRO)的样本高效型改进,它通过重用单个联合数据集来同时计算所有智能体的最佳响应,从而实现环境交互的摊销,进而实现可扩展的多智能体学习,并通过保守、增强探索或混合策略来减轻分布偏移偏差。

原作者: Ariyan Bighashdel, Thiago D. Simão, Frans A. Oliehoek

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ariyan Bighashdel, Thiago D. Simão, Frans A. Oliehoek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一群国际象棋选手正试图寻找彼此博弈的最优策略。在人工智能领域,这被称为多智能体强化学习(Multi-Agent Reinforcement Learning, MARL)。其目标是让每个“智能体”(计算机程序)都能学会一种无论面对其他对手如何行动都能奏效的策略。

本文介绍了一种通过一种名为**联合经验最佳响应(Joint Experience Best Response, JBR)**的技术,使这一学习过程变得更快、更廉价的方法。

以下是通过日常类比对问题与解决方案进行的拆解。

问题:昂贵的“单人练习”

传统上,为了学习最佳策略,每个智能体都必须针对特定的对手组合进行单独练习。这就像是一个国际象棋俱乐部:

  • 选手 A 针对特定的对手组合练习了 100 局。
  • 接着,选手 B 针对同样的对手组合练习了 100 局。
  • 然后,选手 C 又练习了 100 局。

尽管他们都在对抗同一个“平均”对手,但他们在浪费时间和精力。他们就像是在各自跑去健身房举起完全相同的重量,而实际上他们本可以一起去。在计算机术语中,这被称为策略空间响应预言机(Policy Space Response Oracles, PSRO)。这种方法效果很好,但极其昂贵,因为每个智能体都必须独自模拟数千场游戏。

解决方案:“小组学习”环节

作者提出了联合经验最佳响应(JBR)。与其分开练习,不如让所有智能体一起去健身房。

  • 他们在同一时间针对彼此进行一组游戏。
  • 他们将每一次走法、每一场胜负都记录在一个巨大的笔记本中(“联合数据集”)。
  • 环节结束后,他们回到家,共同研读这本同一本笔记本,以弄清楚如何能玩得更好。

益处: 这节省了大量的时间和计算资源。与其运行 NN 次模拟(为每个智能体运行一次),他们只需运行一次并共享结果。

陷阱:“笔记本里的幽灵”

这种小组学习方法存在风险。如果小组只玩某种特定类型的游戏(例如:只以兵开局),那么他们的笔记本里就不会有关于如何应对骑士开局的记录。当他们试图从笔记本中学习时,可能会做出错误的判断,因为他们试图学习的是他们从未真正见过的东西。在技术术语中,这被称为分布偏移(distribution shift)离线学习偏差(offline learning bias)

为了解决这个问题,论文提供了三种“补救措施”(解决方案):

  1. 保守做法(安全策略改进):

    • 类比: 如果笔记本中没有关于特定走法的笔记,学生就会拒绝改变自己的策略。他们坚持使用那些他们已知是安全的策略。
    • 结果: 这种方法非常安全,但由于过于害怕尝试新事物,进步并不大。
  2. “随机洗牌”法(增强探索):

    • 类比: 在小组学习期间,老师告诉每个人偶尔要做一些随机的、愚蠢的动作,以观察会发生什么。这会让笔记本中填充更多样化的内容。
    • 结果: 这有所帮助,但通过做随机动作并不是最有效的学习方式。
  3. “针对性”法(获胜者):

    • 类比: 这是最聪明的一个版本。在小组学习期间,老师说:“好,我们知道选手 A 正试图学习如何应对特定的攻击。那么让我们所有人做出专门测试那种攻击的动作。”他们刻意创造出能够填补笔记本空白的精确场景。
    • 结果: 这创造了一个高质量的笔记本,涵盖了所有重要的基础,而不会浪费时间在随机的废料上。论文称之为 JBR-PSRO-δT\delta T
  4. 混合法:

    • 类比: 小组一起学习 9 天,但在第 10 天,每个人都独自去健身房,以复核自己的工作。
    • 结果: 这让你既能获得小组学习的速度,又能获得单人练习的完美准确度。

结果:他们发现了什么?

作者在两种类型的游戏中测试了这些想法:

  • 扑克游戏(Kuhn 和 Leduc): 这些是带有隐藏信息的类似棋类游戏。
  • 机器人游戏(粒子环境): 这些是类似于视频游戏的场景,机器人需要在连续运动中进行推挤、碰撞或战斗。

研究发现:

  • 在简单游戏中,“小组学习”(JBR)的效果与“单人练习”(标准 PSRO)一样好。
  • 在复杂游戏中,基础的“小组学习”失败了,因为笔记本缺失了太多页面。
  • 然而,“针对性”版本(即他们刻意练习缺失的动作)的表现几乎接近昂贵的单人练习,但使用了一半的计算能力
  • 混合版本(结合小组与单人)获得了昂贵方法的准确度,且仅需极小的额外成本。

核心结论

该论文证明,并不需要每个 AI 智能体都独自练习才能学会玩游戏。如果他们共享经验并共同学习——特别是如果他们刻意练习自己不擅长的部分——他们可以学得同样好,但速度更快、成本更低。这使得在更大、更复杂的现实应用场景中使用这些强大的 AI 策略成为可能,因为在这些场景下,单独运行模拟的成本太高了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →