The challenge of hidden gifts in multi-agent reinforcement learning
本文研究了多智能体强化学习中“隐藏礼物”的挑战,证明了当有利动作不可观测时,标准算法无法实现集体奖励,但通过在去中心化演员-评论家智能体中引入动作历史和一种新颖的方差削减修正项,可以显著提高性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人团队正在学习如何协作的世界,但它们无法彼此交谈,也无法在不看向彼此时看到队友在做什么。这就是多智能体强化学习(Multi-Agent Reinforcement Learning, MARL)——一个迷人且混乱的计算机科学领域。在这个领域中,我们通过试错法来教人工智能智能体学习,就像教一只狗坐下以换取零食一样。但这里不仅仅只有一只狗,而是一整群狗。这里最大的挑战是**信用分配(credit assignment)**问题:当团队成功或失败时,究竟该把功劳或责任归于谁?如果团队获得了一个巨大的奖励,是因为智能体 A 做了了不起的事情,还是仅仅因为运气好?如果智能体 A 那次了不起的举动对智能体 B 来说是不可见的,那又该怎么办?这正是这篇论文试图解决的谜题:当一个智能体所做的最有帮助的事情对其他智能体完全隐藏时,你该如何教会一个团队进行协作?
这篇论文的作者 Dane Malenfant 和 Blake A. Richards 决定建立一个数字游乐场来测试这个特定的问题。他们将这个游戏称为 Manitokan 任务,其灵感来源于一种古老的原住民习俗,即人们会留下物品供他人寻找,而无需言语。在他们的游戏中,两个智能体被困在一个网格世界里。每个智能体都有一扇锁着的门和等待在门后的微小奖励。此外,如果两扇门都被打开,就会有一个巨大的、丰厚的奖励。但关键在于:两扇门共用一把钥匙。
为了赢得大奖,第一个找到钥匙的智能体必须用它打开自己的门,然后——至关重要的一点是——放下钥匙,以便第二个智能体可以捡起它并打开自己的门。但第二个智能体永远看不见第一个智能体放下钥匙的过程。他们只是突然发现钥匙就在地上。第一个智能体放下钥匙的行为是一个“隐形的礼物”。这是一个无声的、隐形的善举。
研究人员进行了一场大规模实验,让最聪明、最现代的 AI 算法在这个简单的游戏中展开对决。他们尝试了一切方法:试图猜测另一个智能体想法的复杂系统、共享价值更新的方法,甚至带有记忆能力的智能体。结果呢?几乎所有人都失败了。 这些 AI 智能体学会了抓取钥匙并打开自己的门,但它们几乎从未学会为伙伴放下钥匙。事实上,许多智能体学会了囤积钥匙或者干脆忽略它,表现甚至比随机采取行动还要差。这个“隐形的礼物”对它们来说太令人困惑了;由于看不见另一个智能体放下钥匙的过程,它们无法理解放下钥匙才是正确的举动。
然而,故事并未止步于失败。作者发现,如果他们给智能体提供一点点更多的信息——具体来说,是关于自身上一次动作的记忆——基础的学习算法(称为策略梯度智能体,Policy Gradient agents)终于能解开这个谜题。它们学会了放下钥匙!但问题在于:它们的表现极其不稳定。一会儿是完美的队友,一会儿又变成了囤积钥匙的自私鬼。这简直是一场协作的过山车。
为了解决这种不稳定性,团队进行了一些复杂的数学运算。他们意识到,这些智能体标准的学习方式缺失了一块拼图。因为另一个智能体也在学习并改变其想法,所以放下钥匙的价值并不是静态的,而是会发生偏移。作者推导出了一个新的数学“修正项”来添加到学习过程中。这就像教练在向球员耳语一个秘密策略:“记住,你的队友也在学习,所以你放下钥匙的行为有助于他们学习,进而有助于你。”
当他们在智能体中加入这种自我学习意识修正(self-learning-awareness correction)时,结果令人惊叹。这些智能体不仅学会了放下钥匙,还学会了可靠且一致地这样做。它们不再在英雄与自私之间剧烈摆动。有趣的是,这种新方法比其他试图窥探另一个智能体大脑的著名“学习感知型”技术效果更好,因为这种新方法只需要智能体理解自身的学习过程即可。
简而言之,这篇论文表明,当协作依赖于隐形的善举时,标准的 AI 算法会迷失方向。但是,通过赋予智能体一种理解自身学习如何影响团队未来的能力,我们可以教会它们成为可靠、无私的队友——即使在没有人注视它们给予礼物的时候。对于机器人来说,这只是迈出了一小步,但对于理解如何构建能够真正信任并与彼此协作的 AI 而言,这是一次巨大的飞跃。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。