← 最新论文
🤖 machine learning

Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings

本文通过在稀疏奖励多智能体强化学习中的零样本协调挑战提出一种带有随机奖励塑形机制的集成训练方法,该方法在 Overcooked 环境中显著提升了智能体与采用不同奖励塑形策略的伙伴之间的协作能力。

原作者: Keenan Powell, Peihong Yu, Pratap Tokekar

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Keenan Powell, Peihong Yu, Pratap Tokekar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一群机器人在一个繁忙的厨房里共同烹饪。目标很简单:在时间耗尽之前尽可能多地制作汤品。然而,这里有个陷阱。你并不是在训练它们与某个你熟悉的特定伙伴合作;你是在训练它们与任何未来可能遇到的机器人合作,即使那个机器人是由不同的公司、在不同的计算机上、或遵循一套略有不同的规则训练出来的。

这就是**零样本协调(Zero-Shot Coordination, ZSC)**问题。这就像试图与一个陌生人共舞,却从未一起练习过。如果你们都学会了完全相同的舞步,你们就会完美配合。但如果你的伙伴学会了略有不同的舞蹈版本,你们可能会踩到彼此的脚。

问题:“目标相同,动机不同”

过去,研究人员试图通过给所有机器人完全相同的“记分卡”(奖励函数)来解决这个问题。如果一个机器人把洋葱放进锅里,它就获得一分;如果它拿起一个盘子,它也获得一分。

但在现实世界中,机器人(或自动驾驶汽车、无人机)可能共享同一个大目标(到达目的地或煮好汤),但它们对步骤的重视程度可能不同。

  • 机器人 A 可能认为:“速度就是一切!我会因为快速移动而得分。”
  • 机器人 B 可能认为:“安全就是一切!我会因为谨慎行事而得分。”

如果你只训练你的机器人与其他“速度型”机器人合作,那么当它与“安全型”机器人配对时,它将彻底失败。该论文指出,现有方法并未考虑到这一点。它们假设每个人内部都拥有相同的“记分卡”。

解决方案:“多样化训练营”

作者提出了一种训练这些机器人的新方法。他们不是用相同的记分卡训练所有机器人,而是创建一个多样化的训练营

他们使用四种不同的方法来创建各种各样的“记分卡”(称为奖励塑形),供机器人学习:

  1. “基于大语言模型(LLM)”的教练:他们要求一个超级智能的人工智能(大语言模型)查看成功与失败的示例,然后编写一份全新的规则列表,以创造出混合不同类型的机器人。
  2. “代理网络”教练:他们训练一个小型、简单的人工智能来预测哪些规则能带来最佳的烹饪结果。然后,它从庞大的可能性列表中挑选出表现最佳的规则。
  3. “分层网格”教练:这就像一位一丝不苟的组织者。他们取遍所有可能的规则(例如“对速度的重视程度”或“对安全的重视程度”),将范围划分为相等的切片。他们从每个切片中挑选一条规则,以确保覆盖整个可能性谱系,不遗漏任何内容。
  4. “随机”教练:他们完全随机地挑选规则。(这相当于对照组,就像掷骰子一样)。

集成:“全明星团队”

一旦他们利用这些不同的规则手册训练了许多不同的机器人,他们并不会只挑选其中一个投入使用。相反,他们构建了一个集成(Ensemble)

把这想象成一个超级团队。当机器人进入厨房与陌生人合作时,它不仅仅表现为“机器人 A"或“机器人 B"。它作为一个委员会行动。它会询问所有不同版本的自己(那些基于不同规则训练出来的版本)会怎么做,然后采纳最普遍的答案。

这使得机器人具有极强的适应性。它见识过思考该问题的所有可能方式,因此无论那个陌生人如何思考,它都能弄清楚如何与其合作。

结果:烹饪出成功

研究人员在Overcooked游戏(一款关于合作烹饪的热门电子游戏)中测试了这种方法。他们将他们的“全明星团队”与基于完全未知规则训练的机器人进行对抗。

  • 结果:他们的方法取得了巨大成功。与旧方法相比,他们的机器人性能提升了62% 到 119%
  • 获胜者:“分层网格”(那位一丝不苟的组织者)和“代理网络”(那位预测者)是最好的教练。它们创建了最能有效应对陌生人的团队。
  • 意外发现:即使是“随机”教练(仅通过掷骰子挑选规则)的表现也优于旧的标准方法,这证明了只要拥有一些多样性,就比完全没有多样性要好。

核心启示

该论文表明,要教会机器人与陌生人合作,你不应该只教它们一种思维方式。你应该在训练期间通过赋予它们不同的“记分卡”,教会它们多种思维方式。然后,通过将所有这些不同的视角融合成一个智能团队,它们就能适应遇到的任何伙伴,即使那个伙伴遵循的是一套完全不同的规则。

简而言之:如果你想成为任何人的好舞伴,不要只学一种舞蹈。要学习一点点各种各样的舞蹈,然后当你踏上舞池时,让你内心的委员会决定最佳的舞步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →