Partner Capability Estimation for Task-Agnostic Adaptation in Ad-Hoc Teamwork
本文介绍了 CE-CM 及其多样性感知扩展版本 CE-CM-Div,这是一种近似贝叶斯框架,使自主智能体能够在无需预训练或任务先验知识的情况下,在即时团队协作场景中快速估计隐藏的、与任务无关的伙伴能力,并调整其联合规划。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正和一个陌生人一起走进一款全新的电子游戏。你不知道对方是一个会跳过关卡的速通玩家,还是一个会检查每个角落的谨慎探索者,亦或是那个单纯非常讨厌跳跃的人。在人工智能的世界里,这被称为即兴团队协作(Ad-Hoc Teamwork)。这是一个挑战:如何让一个机器人(或 AI 智能体)与一个从未谋面的伙伴进行协作,且在没有任何事先练习或共享规则手册的情况下完成任务。通常,AI 研究人员试图训练机器人变得“超强鲁棒”,这意味着通过针对成千上万个不同的计算机对手进行练习,来学习如何与任何人配合得很好。但本文提出了一个不同的问题:如果机器人不仅仅是记忆如何做出反应,而是能够真正弄清楚它的伙伴具备什么样的能力呢?把它想象成一对舞伴。机器人不再只是猜测下一步的动作,而是尝试学习舞伴的“招式表”——他们能跳多高?他们能举起重物吗?一旦它了解了伙伴能力的极限,它就可以策划一段完美的舞步,既适合自己也适合对方,即使他们跳的是一首全新的舞曲。
这篇题为《用于即兴团队协作中任务无关适应的伙伴能力估计》(Partner Capability Estimation for Task-Agnostic Adaptation in Ad-Hoc Teamwork)的论文介绍了一种巧妙的新方法,称为 CE-CM(基于上下文模型的容量估计)。其核心思想是,机器人不应该仅仅猜测伙伴想做什么,而应该弄清楚伙伴能做什么。作者将伙伴的能力视为一组隐藏的“超能力”(或缺乏超能力)清单,无论玩什么游戏,这些能力都是保持不变的。
以下是机器人学习的过程:它观察伙伴玩几轮游戏。然后,机器人进行一次大脑模拟。它会想:“好吧,如果我的伙伴拥有这套特定的超能力,他在上一轮中会如何表现?”它将自己的模拟结果与实际发生的情况进行对比。如果模拟结果与现实相符,机器人就会将这套超能力作为一种可能性保留下来。如果不符,它就会丢弃这个想法。通过不断重复这一过程,机器人不断缩小范围,直到它对伙伴真实的各项能力有一个非常准确的猜测。一旦它了解了伙伴的极限,它就可以规划下一场游戏,确保它永远不会要求伙伴去做一些不可能完成的任务,比如让一个只能举起老鼠的伙伴去搬钢琴。
研究人员在两个完全不同的数字世界中测试了这个想法。第一个是名为 TidyUP 的整理游戏,其中的规则严格且清晰(就像逻辑谜题一样)。在这个世界里,机器人的表现非常出色。它能迅速弄清楚伙伴能做和不能做的事情。仅仅经过几局游戏后,机器人就不再犯错,比如不再要求伙伴进入一个他们无法进入的房间去打扫。结果显示,机器人的协调能力得到了显著提升,对于某些伙伴,其“修正次数”(即机器人不得不修正错误计划的次数)从大约 75% 下降到了不到 5%。
然而,第二个世界 Overcooked(一款混乱的烹饪模拟器)则要棘手得多。在厨房里,制作一份沙拉通常有很多种方法。你可以先切西红柿,也可以先切洋葱;两种方法都行。机器人的原始方法 CE-CM 假设,如果伙伴能够做某件事,他们就会以最完美、最逻辑化的方式去做。但现实中的人(甚至是某些计算机伙伴)是混乱的。他们可能会因为个人喜好而选择一条奇怪的路径,或者可能会犯错。在这个混乱的环境中,机器人陷入了困境。它知道伙伴能做什么,但它无法预测伙伴实际上会做什么,因为存在太多有效的选项。
为了解决这个问题,作者开发了一个升级版,称为 CE-CM-Div。它不再问:“我的伙伴会采取哪一种完美的行动方式?”,而是问:“我的伙伴可能采取的所有不同的行动方式有哪些?”它为每套超能力生成了大量不同的可能场景。当伙伴做出某个动作时,机器人会检查该动作是否符合这些场景中的任何一个。事实证明,当他们在真实人类身上进行测试时,这成为了一个游戏规则的改变者。他们收集了来自 15 个人共 225 次的烹饪环节数据。原始方法表现挣扎,经常无法正确猜测人类的能力,因为人类是不可预测的。但采用了“多重可能性”方法的 CE-CM-Div,却能更快、更准确地学习人类的能力。
论文指出,虽然了解伙伴的极限是向前迈出的一大步,但它并不是应对所有情况的“万灵药”。如果一个伙伴有多种解决问题的方法,那么仅仅了解他们的极限并不足以预知他们会选择哪条路径。但是,通过考虑到这种多样性和不确定性,机器人可以成为更好的队友。作者总结道,这种方法——学习一个可复用的、关于伙伴“能做”什么的模型,而不是仅仅记忆他们在某一特定游戏中“如何表现”——是构建能够与任何人在任何任务中协作的 AI 的一个充满前景的方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。