← 最新论文
🤖 AI

Embodiment-Induced Coordination Regimes in Tabular Multi-Agent Q-Learning

本文证明了在具有具身约束的全表格式多智能体强化学习中,完全独立的 Q 学习通过避免“时间同步锁”——即一种由于共享价值函数导致能力出众的智能体在伙伴受限时被迫进行次优等待的协调病理现象——从而优于中心化方法。

原作者: Muhammad Ahmed Atif, Nehal Naeem Haji, Mohammad Shahid Shaikh, Muhammad Ebad Atif

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Ahmed Atif, Nehal Naeem Haji, Mohammad Shahid Shaikh, Muhammad Ebad Atif

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机通过玩游戏、通过试错来学习的世界,就像孩子学习骑自行车一样。这个领域被称为强化学习。在这个世界里,有两种主要的方式让一组计算机(智能体)学习如何协同工作。第一种方式是“孤狼”模式:每个智能体都有自己的大脑,学习自己的教训,并尝试独立弄清楚该做什么。第二种方式是“团队集结”模式:所有的智能体共享一个巨大的大脑,这个大脑能看到一切,并同时告诉每个人该做什么。长期以来,科学家们一直假设“团队集结”总是更好的,因为,嗯,更多的脑子应该意味着更好的团队协作,对吧?但如果团队是由会疲劳或速度不同的跑步者组成的呢?如果“团队集结”实际上让他们互相绊倒呢?这就是研究人员正在提出的重大问题:共享一个大脑总是会有帮助吗,还是有时会让团队变得笨拙?

这篇论文通过在一个 8x8 的小网格上设置一场数字版的捉迷藏游戏,深入探讨了这个问题。玩家是两个试图抓住两个猎物的捕食者。但这里有一个转折:玩家拥有“耐力”。每当他们移动时,他们就会感到疲劳。如果他们耗尽了能量,就必须停下来休息。研究人员测试了四种不同的团队学习方式:两支队伍都使用“孤狼”大脑,两支都使用“团队集结”大脑,或者两者混合使用。他们运行了这些游戏数千次,并改变了规则,使得有时捕食者更快,有时猎物更快,有时两者速度相等。

结果令人惊讶。在几乎所有的场景中,“孤狼”队伍(即每个智能体独立学习的队伍)捕捉猎物的速度更快,得分也更高。论文指出,当智能体拥有像耐力这样的物理限制时,共享一个大脑实际上可能是一种诅咒。研究人员将这个问题称为“时间同步锁死”。想象一场接力赛,队长(共享的大脑)非常担心跑得最慢的那位选手,以至于他强迫跑得最快的选手也停下来等待,尽管那些快的选手本可以继续跑下去。在模拟实验中,当一个捕食者累了时,共享大脑会强迫另一个精力充沛的捕食者也停下来等待,从而毁掉了这场追逐。独立的学习者没有这个问题;当一个累了时,另一个会继续奔跑,并且他们仍然抓住了猎物。

研究还发现,混合这两种风格(一支队伍使用“孤狼”,另一支使用“团队集结”)是三种情况中最糟糕的一种,会导致完全的混乱,并让猎物逃脱得最频繁。然而,作者谨慎地指出,虽然“孤狼”队伍在训练期间表现最好,但它们还没有完全掌握完美的策略。当他们测试“孤狼”捕食者对阵一支全新的、新鲜的猎物队伍时,猎物能够比训练期间更好地学会逃脱。这意味着“孤狼”队伍很优秀,但并非无敌。

最终,这篇论文认为,我们不应该仅仅假设给机器人一个共享的大脑总是正确的做法。在现实世界的场景中,当机器人拥有像电池寿命或速度这样的物理限制时,试图强迫它们进行完美的同步运动,实际上可能会让它们变得更慢且效率更低。最佳策略在很大程度上取决于游戏的具体规则和参与者的物理限制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →