← 最新论文
💻 computer science

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

本文介绍了 CoCoBench,这是一个包含 897 个经过专家验证的家庭任务的新基准,它通过细粒度的构建级指标(任务分配、顺序排序、互斥性和交接)而非仅仅是整体成功率来评估具身多智能体协作,揭示了当前多模态大语言模型在不同协作类型中表现出高度特定的优劣势。

原作者: Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在不久的将来,我们在家中所见的机器人可能不再是孤立的个体,而是团队。正如人类通过协作来搬动家具、准备餐食或清洁大型房屋一样,未来的人工智能系统需要协调其行动以实现共同目标。这一领域被称为具身多智能体规划(embodied multi-agent planning),它提出了一个根本性的问题:我们如何教机器学会协作,而不至于互相干扰?虽然近期的进展已让单个机器人能够理解图像并执行简单任务,但转向一组在同一物理空间内运行的机器人则引入了新的复杂性。仅仅让每个机器人知道该做什么是不够的;它们还必须知道何时去做、由谁去做,以及如何在不发生碰撞或造成延迟的情况下完成物体的交接。

长期以来,研究人员一直难以衡量这种协作能力。现有的测试通常侧重于团队最终是否完成了工作,将最终结果视为唯一的衡量标准。然而,这种方法掩盖了工作过程中的混乱现实。一个团队可能会通过偶然实现成功,或者在浪费时间、重复相同动作或忽视环境规则后才达到目标。为了解决这个问题,来自南京大学、AgiBot 和清华大学的一组科学家引入了一个名为 CoCoBench 的新测试场。CoCoBench 不仅仅询问团队是否完成了任务,而是剖析了机器人必须进行协作的具体方式,逐步衡量其团队协作的质量。

研究人员在复杂的家庭计算机模拟中构建了这一测试环境,这是一个数字环境,其中的虚拟机器人可以打开抽屉、拿起物体并四处移动。他们创建了近九百个不同的场景,每个场景都旨在迫使机器人依赖四种特定类型的协作。第一种类型是任务分配,即一组机器人必须决定如何分担独立的任务,例如一个机器人负责分类杯子,而另一个负责分类盘子。第二种是顺序排列,要求机器人遵循严格的时间线,例如在放入物品之前先打开柜子,并在所有物品放置完毕后再关闭柜子。第三种是互斥,即多个机器人需要使用同一个共享工具(如一把刀),从而被迫轮流使用。第四种是交接协调,即一个机器人必须通过一个中间点(如桌子)将物体传递给另一个机器人,这要求它们协调好动作时机,确保接收者在物品到达时已经准备就绪。

对于每一个此类场景,研究人员不仅记录了机器人是否成功,还测量了它们的协调程度。他们追踪了团队是否因重复做同一项工作而浪费时间,是否违反了必要的步骤顺序,是否为争夺共享工具而发生冲突,或者是否让彼此处于等待状态。这使他们能够将成功的结局与高质量的协作过程区分开来。一个团队即使完成了任务,但如果通过忽视规则或低效工作来完成,仍会获得较低的分数。

当研究人员测试了当今最先进的十一类人工智能模型时,结果揭示了一个关于机器团队协作的惊人事实。表现整体最好的模型并不一定在每种类型的协作中都表现出色。有些模型擅长分配任务,但在使用共享工具轮流操作方面表现糟糕。另一些模型擅长遵循步骤序列,但在需要向伙伴传递物体时却失败了。这表明,协调能力并不是一种机器人要么拥有或不拥有的单一通用技能;相反,它是一系列必须分别开发的独特能力。

研究还检查了机器人的通信方式。当研究人员为机器人提供一个能够观察全局并指挥团队的中央规划器时,结果明显优于机器人仅根据自身所见进行决策的情况。增加一个简单的通信频道有助于独立运行的机器人,但并不能完全缩小与中央规划器之间的差距。这表明,这些系统的主要困难不在于感知世界,而在于逻辑化地规划团队行动。事实上,当研究人员移除视觉图像并仅向机器人提供情况的文本描述时,它们的表现并没有下降多少。这表明瓶ing颈不在于识别物体,而在于管理团队的高层逻辑。

随着研究人员将团队中的机器人数量从两个增加到三个再到四个,任务的难度也随之增加。随着更多智能体的加入,团队的成功率下降了,对于规模较小、能力较弱的模型而言尤其如此。这表明,增加工人并不一定会让工作变得更容易;它增加了协调所需的复杂性。研究人员发现,虽然最先进的模型保持相对稳定,但较弱的模型随着团队规模的扩大而表现出明显的挣脱困境,经常无法在允许的时间内完成规划或违反模拟规则。

或许最关键的发现是,仅看任务是否完成是具有误导性的。研究人员发现,一些模型通过采取违反协调规则的捷径(例如在另一个机器人还在使用工具时抢夺工具,或在容器打开前放置物体)来实现高成功率。这些团队虽然达到了目标,但其行为是混乱且违规的。通过引入一个衡量协调合法性和质量的分数,研究人员展示了一个团队可以在玩得并不好的情况下依然“赢得”比赛。这种区分对于开发能在真实家庭中安全高效工作的机器人至关重要,因为在这些环境中,遵循交互规则与完成家务同样重要。

本论文所呈现的工作并不声称已经解决了机器人团队协作的问题。相反,它提供了一种更清晰的方式,让我们能看到现有系统在何处成功以及在何处失败。通过将协调分解为具体的、可衡量的部分,研究人员表明,构建机器人团队不仅仅是让单个智能体变得更聪明。它还需要设计能够处理共享空间、时间及工具等特定需求的系统。随着我们迈向机器与我们并肩工作的未来,理解这些协作的细微差别,对于确保它们在工作时不会产生混乱或冲突至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →