← 最新论文
🤖 machine learning

Focusing Influence Mechanism for Multi-Agent Reinforcement Learning

本文提出了聚焦影响机制(FIM),这是一个通过采用基于熵的判据和资格迹来引导智能体探索未充分访问的状态区域并维持协调的联合行为,从而在稀疏奖励条件下增强多智能体强化学习协作性的框架。

原作者: Yisak Park, Sunwoo Lee, Seungyul Han

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yisak Park, Sunwoo Lee, Seungyul Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一群朋友在黑暗的房间里试图共同解开一个巨大而复杂的拼图。他们只能看到面前的一小块拼图,而且直到整幅画面完成时,才会收到“做得好”或“再试一次”的反馈信号。这就是在稀疏奖励环境中**合作多智能体强化学习(MARL)**所面临的挑战。

在这些场景中,朋友们(智能体)常常漫无目的地四处游荡,各自单独地碰撞拼图块。由于缺乏频繁的反馈,他们难以意识到需要协同合作来移动某块特定的沉重拼图。最终,他们分散开来,各自朝不同方向推挤,导致拼图永远无法完成。

本文提出了一种名为**FIM(聚焦影响机制)**的新策略,帮助这些朋友停止游荡,开始作为同步的团队协同工作。以下是其工作原理,使用简单的类比说明:

问题:“散乱的人群”

在没有 FIM 的情况下,智能体就像在音乐会现场试图推动一个沉重舞台道具的一群人。每个人都在推,但他们在不同时间推动道具的不同部位。道具几乎纹丝不动。他们虽然在“影响”环境,但由于没有聚焦于同一位置,这种影响被稀释且无效。

解决方案:FIM 拥有两种特殊工具

作者设计了 FIM,包含两个主要“工具”来解决这一问题:

1. “团队围聚”工具(智能体聚焦影响 - AFI)

想象朋友们意识到他们需要在同一时间推动道具上的同一位置

  • 工作原理:FIM 使用一种称为**资格迹(eligibility trace)**的记忆技巧。可以将其想象为一张“便利贴”,当有人触碰拼图的某个特定部分后,这张便利贴会在那里停留一段时间。
  • 神奇之处:如果智能体 A 推动了一个箱子,而智能体 B 稍后也推动了同一个箱子,那么这张“便利贴”就会变得更牢固。系统会表示:“嘿,你们两个正在这个特定目标上协同工作!”它会给予他们奖励(内在奖励),以鼓励他们坚持这个共同目标。
  • 结果:智能体不再各自推动随机物体,而是学会“围聚”在一起,持续对同一目标施加努力,直到目标被移动。

2. “手电筒”工具(状态聚焦影响 - SFI)

现在,想象朋友们已经围聚在一起,但他们围聚的对象是错误的。也许他们都在推一堵不需要移动的墙,而真正的拼图块(箱子)却无人问津。

  • 问题:他们如何知道应该聚焦于什么
  • 解决方案:FIM 使用一种基于熵的手电筒。简单来说,熵衡量的是“惊喜”或“多样性”。
    • 如果拼图的某一部分(如一个箱子)从未移动,它具有低熵(即无聊/稳定)。
    • 如果拼图的某一部分(如玩家的位置)频繁移动,它具有高熵(即繁忙)。
  • 神奇之处:系统会将明亮的光束照向那些“无聊”的部分(低熵),因为这意味着尚未有人去探索它们。它会告诉智能体:“停止关注那些繁忙的东西;去调查那些安静、未被触及的部分吧!”
  • 结果:智能体被引导至那些最需要他们帮助的拼图部分。

整合应用:“聚焦的团队”

当你结合**团队围聚(AFI)手电筒(SFI)**时,智能体就变成了一个超高效的团队:

  1. 手电筒告诉他们:“去看看那边那个沉重的箱子;还没有人碰过它。”
  2. 团队围聚确保他们一旦找到目标,就不会只推一次就离开。相反,他们会保持聚焦,持续共同推动,直到箱子滑入正确位置。

现实世界测试(“证明”)

作者在三个不同的“游戏”中测试了这一想法:

  • Push-2-Box:一个简单的游戏,两个机器人必须将箱子推到墙边。没有 FIM 时,他们失败;有了 FIM,他们成功,因为他们学会了共同推动同一个箱子。
  • 星际争霸(SMAC):一款策略游戏,单位必须攻击敌人。FIM 帮助单位将攻击聚焦于特定敌人(如敌方生命值),而不是分散攻击,从而赢得了更多胜利。
  • 谷歌足球(GRF):一款足球模拟游戏。FIM 帮助球员聚焦于守门员的位置(游戏中难以改变的部分),从而创造得分机会。

核心结论

该论文声称,通过教导智能体聚焦其影响于正确的目标(使用手电筒),并坚持这些目标(使用团队围聚),他们能够更快地解决困难的合作任务,即使他们很少因努力而获得“奖励”或“奖品”。这将一个散乱、困惑的群体转变为一个协调、持久的团队。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →