When to Communicate: Belief Distributions and KL Divergence for Principled Gating in Multi-Agent RL
本文提出了一种用于多智能体强化学习的有原则的通信门控机制,其中智能体仅在它们信念分布之间的 KL 散度超过阈值时才交换信息,证明了该方法在具有挑战性的捕食者-猎物基准测试中提高了成功率并降低了方差,同时即使在没有主动门控的情况下也能增强用于协调的潜在表示。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界的广袤而寂静的空间里,人工智能智能体群体经常面临一个困扰现实世界团队的问题:它们无法看到全貌。每个智能体,就像迷雾中的士兵或鸟群中的飞鸟,只能感知到周围环境中极小的一块局部区域。为了完成一项共同任务,例如追踪移动目标或覆盖广阔区域,它们必须分享所知。然而,不断的喋喋不休是昂贵的,且往往会适得其反。如果每个智能体都在每一时刻广播自己的想法,系统就会被噪声堵塞。更糟糕的是,在竞争环境下,分享过多信息可能很危险;猎物不应该向捕食者宣布自己的位置。研究人员面临的核心挑战不仅是教会这些智能体如何交谈,而是教会它们准确知道何时该开口说话。
这种关于时机的探讨是 Teoman Kaman 一项新研究的焦点,该研究调查了如何让人工智能智能体之间的通信变得更加智能和高效。这项研究建立在现有的方法之上,即智能体学习决定是否发送消息,但它挑战了目前做出这些决策的方式。以往的方法通常依赖于一种试错过程,其中智能体是否交谈是一个隐藏的、不可预测的选择,仅由最终奖励驱动。这项新研究提出了一个不同的、更符合逻辑的触发机制:智能体只有在意识到自己对世界的看法产生分歧时才应该进行交流。通过衡量一个智能体的信念与另一个智能体的信念之间的差距,系统可以判断一次对话是否真的有必要。
研究人员在名为“捕食者-猎物”(Predator-Prey)的模拟环境中测试了这一想法,在该环境中,一组猎手智能体必须协作捕捉一个静止的目标。在这种情景下,猎手们的视野有限,必须通过协作来围堵猎物。团队将他们的新方法与既有系统进行了对比,这些既有系统要么持续交谈,要么使用旧有的试错法来决定何时说话。结果表明,最佳效果在很大程度上取决于环境的难度。在一个较小的、较简单的网格中,旧有的试错法表现仍然略好。然而,在一个更大的、更复杂的网格中——即智能体需要覆盖更多区域并应对更大程度的不确定性时——通过衡量信念差异的新方法证明了其优越性。
当研究人员调整新系统的敏感度时,他们发现了一个清晰的“黄金平衡点”。如果智能体说话太快,它们会浪费能量;如果说话太慢,则会错过关键的协作时机。在最佳设置下,使用这种基于信念触发机制的智能体比之前的最优系统更快地到达猎物处,且成功率更高。具体而言,在较大的网格中,新方法将捕捉猎物所需的平均步数减少了近一步半,并将成功率提高了11个百分点。或许更重要的一点是,新系统更加稳定。虽然旧方法的通信模式在训练期间波动剧烈,但新系统却形成了一种稳定的节奏,这表明它正在做出更可靠的决策。
研究还揭示了一个超越“决定何时说话”之外的次要益处。即使在另一种测试环境下——即智能体由于过于困惑而无法停止交谈时——新系统仍然优于旧系统。这表明,构建关于世界的“信念”(即关于事物位置的心智模型)这一行为本身,无论是否实际发送了消息,都能提升智能体的整体理解能力。研究人员发现,为这些信念设定特定数量的类别效果最好,这在细节需求与快速学习能力之间取得了平衡。
最终,这项工作表明,为了进行有效的协作,人工智能智能体需要一个原则性的理由去说话,而不仅仅是随机的猜测。通过将通信的决策建立在智能体对世界理解的实际分歧之上,系统变得更加稳定和高效。研究结果表明,随着环境变得更加复杂以及智能体的世界观变得更加碎片化,这种基于逻辑和信念的通信方式将变得越来越有价值。它为构建更稳健的多智能体系统提供了一条路径,使这些系统能够处理现实世界任务中的不确定性,而不至于迷失在无意义的噪声海洋之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。