← 最新论文
💻 computer science

Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algorithms to Implementation Details

本文引入了一种跨实现、跨博弈的评估方案,旨在系统地评估零样本协调算法对实现细节的鲁棒性,并发现对于流行的 Other-Play 算法而言,标准的单实现评估可以作为这种更严格测试的合理代理。

原作者: Maksymilian Wolski, Nicholas Hoernle, Johannes Forkel, Jakob Foerster

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Maksymilian Wolski, Nicholas Hoernle, Johannes Forkel, Jakob Foerster

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人、自动驾驶汽车和智能家居助手不仅要独自工作,还必须与陌生人组队协作的世界。也许一个机器人需要协助人类烹饪晚餐,或者两个不同的人工智能系统需要协同修复电网。难点在于?它们从未谋面。它们没有一起练习过,也没有建立起在训练过程中可能形成的那些关于习惯的“秘密语言”。在人工智能领域,这被称为零样本协调(Zero-Shot Coordination)。这是一种走进一个充满陌生人的房间,且无需任何排练就能立即知道如何与他们共舞的能力。

为了教会人工智能这项技能,科学家们使用特殊的训练规则。但问题在于,当科学家写下这些规则时,它们就像是一份食谱。如果两位不同的厨师遵循同一份食谱,他们可能会使用略有不同的刀具,切洋葱的方式可能稍有不同,或者烤箱加热的时间会多出几秒钟。过去,研究人员担心这些在构建人工智能“厨房”(代码和硬件细节)时的微小差异可能会破坏协调性。如果食谱过于敏感,一个机器人的动作可能在与自己团队成员共舞时完美无缺,但在与来自另一个“厨房”的伙伴共舞时却会绊倒。这篇论文提出了一个至关重要的问题:我们目前测试这些机器人的标准方式是否足够好,还是我们需要针对每一种可能的“食谱版本”进行测试,才能确保它们真正具备鲁棒性(稳健性)?

这篇论文的作者们——来自剑桥大学和牛津大学的一个团队——决定使用一种他们称为**跨实现跨对弈(Cross-Implementation Cross-Play)*的方法来测试这个想法。把它想象成一场大规模、混乱的舞蹈大赛。通常,为了观察一套舞蹈动作是否能与陌生人配合,你会训练一组舞者,然后让他们与由同一*团队训练、但随机起始位置(称为“种子/seeds”)不同的其他小组共舞。这是标准的测试方法。但作者们想知道:如果我们用完全不同的蓝图来构建这些舞蹈队呢?如果一支队伍使用了不同类型的鞋子、不同的音乐播放器或不同的计步方式呢?

为了找出答案,他们采用了名为 Other-Play 的流行协调算法,并构建了 22 个不同的版本。他们不仅仅是改变了随机起始数字,还调整了实际的代码级细节,例如人工智能如何从错误中学习、如何处理记忆以及如何初始化其“大脑”权重。他们将这些变体视为不同的独立工程师团队,试图根据相同的指令构建同一个机器人。然后,他们让这 22 个不同的版本在一个名为 Yokai 的游戏(一种旨在测试团队协作的新型复杂益智游戏)中进行对抗。

结果令人倍感欣慰。在训练了 176 个不同的 AI 策略(即机器人学到的“舞步”)后,他们发现,当机器人与来自完全不同代码版本的机器人配对时,其表现与与来自自身代码版本的机器人配对时一样出色。不存在性能上的“差距”。作者认为,标准的测试方法——即我们仅改变随机种子而非代码细节——实际上是一个可靠的捷径。对于 Other-Play 算法而言,构建代码的具体方式似乎并不如你所遵循的高层规则那样重要。

然而,作者们谨慎地表示,不要将此视为适用于所有人工智能的普遍定律。他们指出,他们的发现是基于在一个特定游戏中使用一种特定类型学习算法(IPPO)的模拟实验。他们建议,虽然这在 Other-Play 上看起来很有前景,但我们尚不知道这是否也适用于其他类型的人工智能或不同的环境。但就目前而言,这项研究提供了一个令人宽慰的想法:如果你遵循正确的高层规则来教授人工智能如何协作,那么你就不必担心代码中的微小差异会导致你的机器人在遇到陌生人时绊倒对方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →