Benchmarking Open-Ended Multi-Agent Coordination in Language Agents
本文介绍了 alem,一个基于 JAX 的基准测试,用于评估长程生存任务中的开放式多智能体协作,研究表明,尽管前沿大语言模型在执行单个任务方面表现出色,但在协作方面却面临显著困难——这是一个通信至关重要的独特瓶颈,且不同模型的性能表现差异巨大。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一群探险家试图在一个广袤且瞬息万变的荒野中生存。他们需要砍伐木材、开采石头、建造避难所,还要对抗怪物。但问题在于,他们不能仅仅独自行动。有时,他们需要在完全相同的时刻砍伐一棵树,才能让它倒下。还有时候,一个人必须开始挖洞,而另一个人必须在几秒钟内完成,否则洞穴就会坍塌。
这篇论文介绍了一个新的“训练场”,名为 ALEM(在阿姆哈拉语中意为“世界”),旨在测试 AI 智能体在这种充满挑战的长周期生存游戏中协作的能力。
问题所在:独行侠 vs. 团队成员
直到现在,大多数针对 AI 的测试都像是单机游戏。它们会问:“这个 AI 能解开谜题吗?”或者“它能走出迷宫吗?”但现实世界中,AI 需要进行团队协作。作者注意到,现有的团队协作测试过于简单:它们要么时间太短,要么规则是固定的,或者团队成员之间不需要进行太多交流。
他们想看看现代 AI(大语言模型,即 LLM)能否处理长期协调。它们能记住 50 步之前制定的计划吗?它们能通过对话告诉队友说“我会往左走,你往右走”吗?当情况发生变化时,它们能适应吗?
解决方案:ALEM(生存模拟器)
作者构建了 ALEM,这是一个基于名为 Craftax 的游戏开发的数字世界。你可以把它想象成高科技版的《我的世界》(Minecraft)或《泰拉瑞亚》(Terraria),但有一个特别之处:
- 程序化生成: 每次游戏开始时,地图和特定的团队协作挑战都是随机生成的。这防止了 AI 通过“死记硬背”来获取答案。
- “协调光谱”: 游戏有一个控制团队协作难度的旋钮。
- 简单: 你大多可以独自工作。
- 中等: 你需要互相传递工具(比如把锤子递给正在筑墙的人)。
- 困难: 你必须像花样游泳队那样实现完美的同步动作,否则任务就会失败。
- 软专业化: 在这个世界里,任何人都可以从事任何工作,但如果你不是该项工作的“专家”,你可能会失败。这迫使团队必须在实战中摸索谁该负责什么。
实验:13 个 AI 智能体对抗世界
研究人员将 13 种不同的现代 AI 模型放入了这个世界。他们并没有教它们如何玩游戏,而是直接将它们投放进去(这被称为“零样本学习”)。他们还训练了一些“机器人”智能体(使用标准的强化学习)作为基准,以展示人类能力的上限。
结果令人惊讶:
- AI 表现挣扎: 平均而言,AI 智能体仅达到了可能得分的 6% 左右。它们离解决游戏还差得很远。
- 单打独斗的聪明并不代表团队协作的聪明: 一些 AI 模型非常擅长执行单人任务(如收集木材),但在协调方面表现极差。其中一个模型 GPT-5.4 非常擅长基础任务,但在需要与队友同步时却彻底失败了。另一个模型 Gemini-3.1 则在团队协作方面表现得更好,甚至在最难的场景中击败了一些经过训练的机器人智能体。
- 规模并非决定因素: 更大的 AI 模型(拥有更强的“脑力”)并不一定在团队协作中表现得更好。有时,较小的模型比庞然大物协调得更好。
“为什么”:是什么让团队协作变得困难?
研究人员对 AI 智能体进行了拆解,以观察导致失败的原因。他们发现了三个主要要素:
- 沟通是核心: 当他们关闭智能体之间的对话能力时,它们的团队协作得分大幅下降。AI 智能体会利用聊天来表达诸如“我要去砍树了,你在那等我”或“给我点木头”之类的话。如果没有这个,它们就是在盲目猜测。
- 记忆用于规划: AI 有一个“便签本”(私有笔记本)。表现最好的模型会利用这个便签记录未来的计划(例如:“第一步:采矿。第二步:造熔炉”)。而较弱的模型只是用便签重复它们当前看到的东西,这对提前规划毫无帮助。
- 推理有助于行动: 当 AI 被要求在行动前进行“思考”时,它们在单人任务和团队协作方面的表现都有所提升。
“混合团队”的意外发现
研究人员还尝试将不同的 AI 模型组合在同一个团队中(例如,让一个 Gemini 智能体与一个 GPT 智能体协作)。他们原以为团队的表现会向最聪明的那个成员看齐。然而,团队的表现实际上只是两个模型的平均水平。事实证明,如果队友无法理解计划或沟通风格,那么即使有一个超级聪明的队友也无济于事。
总结
这篇论文表明,协调是一种独特的技能,目前的 AI 尚未掌握这种技能。仅仅因为一个 AI 擅长回答问题或独立解决谜题,并不意味着它能在团队中开展工作。
ALEM 提供了一种受控的方式来衡量这种特定的“团队协作瓶颈”。它表明,要构建能在现实世界中真正与人类或其他 AI 协作的 AI,我们不应仅仅专注于提升它们处理单人任务的能力,而应更多地教授它们如何沟通、共同规划并建立信任。
这个“生存模拟器”的代码现已开源,供其他研究人员使用和改进。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。