Expected Return Symmetries
本文引入了“期望回报对称性”(expected return symmetries),这是一类涵盖了传统环境对称性的更广泛的对称性,使去中心化多智能体环境中的智能体无需预先获知地面真值对称性,即可实现卓越的零样本协调。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:“左撇子”与“右撇子”的困境
想象有两个机器人,它们被分别训练去玩一种协作游戏,比如高难度的《Hanabi》(一种你看不见自己手牌的卡牌游戏)或者《Overcooked》(一个混乱的烹饪模拟器)。在各自单打独斗时,它们都表现得非常出色。
然而,当你第一次把机器人 A 和机器人 B 配对在一起时,它们却表现得一塌糊一糊。为什么?
因为在各自的单人训练过程中,它们不小心发明了自己的“秘密语言”。
- 机器人 A 学到的是:如果对方放下了一张牌,就意味着“我很开心”。
- 机器人 B 学到的是:同样的动作意味着“我很生气”。
用论文中的术语来说,这被称为互不兼容的对称性破缺(mutually incompatible symmetry breaking)。这些机器人找到了一个对它们各自都有效的解决方案,但由于它们对于应该使用哪种版本的解决方案并未达成共识,它们就像两个试图握手的人,其中一人伸出了左手,而另一人伸出了右手。在各自的认知里,双方都是“正确”的,但由于无法协调,导致了失败。
旧方案:“他方博弈”(Other-Play,规则书方法)
此前,研究人员尝试通过教机器人尊重**环境的对称性(environment's symmetries)**来解决这个问题。
把游戏环境想象成一个有四扇完全相同的门的房间。如果你走北门,会获得奖励;如果你走南门,也会获得完全相同的奖励。这个房间是“对称”的。
- 旧方法: 研究人员告诉机器人:“嘿,北边和南边是一样的。不要只记住‘北边是好的’,要记住‘任何看起来像北边的门都是好的’。”
- 局限性: 这对于颜色或方向等明显的特征效果很好。但当“相同性”并非关乎房间布局,而是关乎策略本身时,这种方法就会失效。这就像是告诉机器人:“戴红帽子或蓝帽子没关系”,却没意识到有时,戴上某种“特定类型”的帽子是向搭档传递“我准备好烹饪了”这一信号的唯一方式。
新方案:“期望回报对称性”(Expected Return Symmetries,“结果导向”方法)
论文作者提出了一种更聪明的方法来寻找这些隐藏的联系。他们不再仅仅观察房间的“规则”(环境),而是观察“结果”(回报)。
他们引入了一个概念:期望回报对称性(Expected Return Symmetries)。
类比:“魔镜”
想象你有一面魔镜。如果你站在镜前做一个特定的舞蹈动作,你就会得到一颗金星。
- 旧观点: 魔镜只反射看起来完全一样的东西(例如,如果你举起左手,镜中的影像会举起右手)。
- 新观点(期望回报): 魔镜变得更聪明了。它会问:“如果我把你的舞蹈动作改为完全不同的动作,你是否仍然能得到金星?”
如果答案是是,那么这两个截然不同的舞蹈动作在本文的视角下就是“对称”的。它们可能看起来完全不同,但都能带来同样的成功。
论文指出,通过训练机器人去识别这些“基于结果”的对称性,它们会变得更加灵活。它们会明白,“动作 X”和“动作 Y”是可以互换的,因为它们都能导致成功的结局,即便游戏规则并没有明确说明它们是相同的。
他们是如何实现的(“试错”机器)
论文并不只是靠猜测这些对称性,而是构建了一种能够自动发现它们的方法。
- 专家池: 他们首先训练了一群游戏专家(使用一种称为“自我博弈/Self-Play”的方法)。
- 洗牌游戏: 然后,他们拿这些专家机器人进行“行为洗牌”。他们尝试交换动作、改变观察结果以及混合不同的策略。
- 计分员: 他们会询问:“如果我们把机器人 A 的策略与机器人 B 的策略进行交换,它们的得分是否依然很高?”
- 如果得分保持高位,那么这种交换就是一个有效的“期望回报对称性”。
- 如果得分暴跌,那么这种交换就是错误的。
- 结果: 他们找到了能够保持游戏成功率的一系列“神奇交换”。随后,他们将这些交换规则教给了新的机器人,让它们在训练期间使用这些规则。
实验结果:为什么这很重要
论文在三种不同的场景下测试了该方法:
- 简单的杠杆游戏: 一个基础的协调任务。
- Overcooked V2: 一个复杂的烹饪游戏,其中时机把握和沟通至关重要。
- Hanabi: 一个信息隐藏极其困难的卡牌游戏。
研究发现:
- 使用这种新的“期望回报”方法训练的机器人,与陌生人协作时的表现,明显优于使用旧有的“环境对称性”方法的机器人。
- 在《Overcooked》游戏中,新方法极大地缩小了“与自己玩”和“与陌生人玩”之间的表现差距。
- 在《Hanabi》中——这是一个对 AI 协调能力要求极高的游戏——尽管新方法并没有像以往方法那样拥有关于游戏规则的“作弊手册”(例如知道红色和蓝色只是颜色的交换),但它依然超越了现有的最先进方法。
总结
论文声称,要让 AI 智能体在没有预先协调的情况下良好地协同工作,我们不应仅仅教它们游戏的规则。相反,我们应该教它们识别哪些不同的行为会导致相同的成功。
通过关注结果(期望回报)而非仅仅关注输入(环境布局),机器人学会了一套更广泛、更灵活的“秘密握手”方式。这使得它们能够更快、更有效地适应新的搭档,从而解决了困扰多智能体 AI 领域多年的“左手对右手”的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。