← 最新论文
🤖 AI

Retaining Suboptimal Actions to Follow Shifting Optima in Multi-Agent Reinforcement Learning

本文提出了一种名为连续子值 Q 学习(S2Q)的新型多智能体强化学习方法,该方法通过多个子值函数保留备选的高价值动作,以在训练过程中最优策略发生转变时增强适应性与性能。

原作者: Yonghyeon Jo, Sunwoo Lee, Seungyul Han

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yonghyeon Jo, Sunwoo Lee, Seungyul Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《在多智能体强化学习中保留次优动作以跟随动态最优解》(S2Q)的解读,将其拆解为简单概念和日常类比。

核心难题:AI 团队的“单线思维”

想象一群朋友试图共同解决一个复杂的拼图。在多智能体强化学习(MARL)的世界中,这些朋友就是协同工作的 AI 智能体。

目前,训练这些团队的最佳方法(例如一种流行的方法叫QMIX)就像一位严格的教练,他会说:“现在只有一个完美的动作。所有人,忽略其他一切,100% 专注于这唯一的动作。”

当拼图保持不变时,这非常有效。但如果拼图规则在 halfway 发生了变化呢?也许那个“完美动作”突然变成了陷阱,而你之前忽略的一个动作(一个“次优”动作)现在变成了最佳选择。

因为 AI 团队如此痴迷于那个单一的“完美”动作,他们忘记了其他动作。当规则改变时,他们陷入了困境。他们无法快速适应,因为他们已经抛弃了备用方案。他们继续试图强行执行旧的“完美”动作,即使它已不再有效,从而导致失败。

解决方案:S2Q(连续子值 Q 学习)

作者提出了一个名为S2Q的新框架。S2Q 不是训练团队只关注一个最佳动作,而是训练他们保留一份前 3 或 4 个最佳动作的心理清单,即使这些动作在当下那一刻并非绝对的#1 选择。

这就像一份音乐播放列表

  • 旧方法(QMIX): DJ 只播放排名第 1 的热门歌曲。如果观众的口味发生变化,DJ 就会陷入困境,继续播放一首没人再想听的歌。
  • S2Q 方法: DJ 保留一份前 5 首歌曲的播放列表。即使歌曲#1 是当前的最爱,歌曲#2、#3 和#4 仍在背景中播放。如果观众突然开始喜爱歌曲#3,DJ 可以立即切换到它,因为它已经预热并准备就绪。

工作原理:“抑制”技巧

AI 如何学会这份清单?论文使用了一个巧妙的技巧,称为连续子值学习

  1. 第一个网络(领导者): AI 首先学习绝对最佳的动作(即第 1 首热门歌曲)。
  2. 第二个网络(亚军): 然后 AI 尝试学习下一个最佳动作。但这里的技巧是:它被指示忽略第 1 个动作。这就像一场“抢椅子”游戏,第 1 把椅子被移除了。AI 被迫寻找最佳的剩余选项。
  3. 第三个网络(季军): 该网络忽略第 1 和第 2 个动作,迫使它寻找第 3 个最佳选项。

通过这样做,AI 建立了一个包含“计划 A"、“计划 B"和“计划 C"的库。

“软”切换:智能探索

过去,AI 团队会随机探索新想法(就像掷骰子)。这效率低下。S2Q 使用Softmax 策略(一种 fancy 的说法,即“加权概率”)。

想象一位经理给团队分配任务:

  • 旧方式: 抛硬币决定谁做什么。
  • S2Q 方式: 经理查看每个计划的“价值”。如果计划 B 看起来非常有希望,经理会让团队更频繁地尝试计划 B,但并非总是如此。这保持了团队的灵活性。

如果环境发生变化,计划 B 变成了新的“计划 A”,团队已经对它很熟悉,可以立即切换。他们无需从头开始。

“秘密握手”(通信)

在一些复杂的游戏中,智能体需要就使用哪个计划达成一致。如果智能体 A 决定尝试“计划 B",而智能体 B 仍在尝试“计划 A",他们就会失败。

S2Q 在训练期间使用通信系统(就像秘密握手或共享的心理笔记)。智能体们短暂地共享一个“潜在表示”(它们所见内容的压缩摘要),以达成一致:“好的,今天我们都专注于计划 B。”

关键在于,一旦训练完成,AI 开始进行实际游戏时,他们不需要交谈。他们已经学习得足够多,可以本能地选择正确的计划而无需发送消息。这使得该系统非常适合实际应用。

结果:更快、更智能

作者在两个非常困难的“电子游戏”基准测试中测试了这种方法:

  1. 《星际争霸 II》: 一款实时策略游戏,你需要控制一支单位军队。
  2. 谷歌研究足球: 一款足球模拟游戏。

在这些游戏中,“最佳策略”往往随着游戏进程而变化(例如,游戏早期你需要防守;游戏后期你需要进攻)。

  • 结果: S2Q consistently 击败了其他顶级 AI 方法。
  • 原因: 当游戏局势发生转变时,S2Q 没有惊慌失措。它只是切换到其预先学习的“计划 B"或“计划 C",这些计划已经过优化。而其他方法仍被困在试图强行执行旧的“计划 A",导致他们失败。

总结

该论文认为,要构建真正具有适应性的 AI 团队,我们不应只教他们单一的最佳答案。我们应该教给他们一份高质量答案的菜单。通过让这些“次优”选项保持活跃并准备就绪,AI 可以在世界发生变化时立即转向,避免陷入固守一种曾经很好但现在很糟糕的策略的陷阱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →