Adaptive Human-AI Coordination via Hierarchical Action Disentanglement
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在狭小且混乱的厨房里与一位搭档共同烹饪一顿复杂的饭菜。有时,你的搭档是个急先锋,动作飞快;有时,他们则谨慎而有条理。有时他们喜欢顺时针绕着操作台工作,有时则逆时针。如果你试图用完全相同的烹饪风格应对所有人,你很可能会互相碰撞、打翻食材,或者把厨房弄得一团糟。
本文介绍了一种新方法,让 AI(即机器人厨师)学会与任何人类搭档共同烹饪,无论他们的行为模式如何。作者将这种方法称为IAD(内在动作解耦)。
以下是其工作原理,使用简单的类比来说明:
问题:“一刀切”的失败
以往的 AI 方法就像一个只学会一种舞步的机器人。如果你让它与慢节奏的搭档共舞,它会尝试跳慢舞;如果你让它与快节奏的搭档共舞,它会尝试跳快舞。但由于它脑海中只有一种“舞步”,它常常感到困惑、动作迟缓,或者直接陷入无所作为的状态。它无法足够快地切换节奏以适应不同的人。
解决方案:一套“瑞士军刀”式的技能
作者提出,AI 不应学习一种庞大而混乱的行为模式,而应学习一系列 distinct 的技能。这就像一把瑞士军刀:你有螺丝刀、刀片、开瓶器和剪刀。你不会用开瓶器去拧螺丝;你会为工作挑选合适的工具。
IAD 系统由两个协同工作的主要部分组成:
- 管理者(大脑): 这是 AI 的高层部分。它会观察人类搭档几秒钟,以判断其“风格”。人类是在匆忙吗?他们是否谨慎?他们是否在绕圈移动?基于这些观察,管理者会从技能菜单中挑选一个特定的“技能”(例如“快速通道技能”或“谨慎步骤技能”)。
- 执行者(双手): 这是 AI 的低层部分。一旦管理者选定了一个技能,执行者就会执行专为该技能设计的一系列特定动作。
秘诀:“解耦”
这篇论文的真正的魔力在于他们如何教导 AI 将这些技能保持分离。这被称为内在动作解耦。
想象你在教狗做把戏。如果你没有仔细训练,狗可能会认为“坐下”和“保持不动”是同一回事,或者将它们混淆。
- 旧方法通常让 AI 学到的技能本质上都是相同的,只是略有不同。这就像拥有一个工具箱,但里面的每件工具看起来都像锤子。
- IAD 使用一种特殊的“奖励系统”(虚拟奖励),它规定:“如果你使用技能 A,你必须做出与使用技能 B 完全不同的动作。”
这迫使 AI 创造出清晰、 distinct 的模式。
- 技能 1 可能意味着:“我总是从左边把番茄递给你。”
- 技能 2 可能意味着:“我总是等你先拿起盘子,然后我再移动。”
因为这些技能如此 distinct(解耦),管理者可以观察人类,说:“啊,他们正从左边快速移动”,然后立即选择技能 1。AI 无需猜测;它只需切换到预先编程好的、适合该特定人类风格的行为模式。
他们如何测试
研究人员在一个名为Overcooked的数字游戏中测试了这种方法,游戏中两个智能体需要共同制作汤。
- 测试: 他们将他们的 AI 与许多不同的“搭档”配对。有些搭档是不同技能水平的其他 AI,有些是基于真实人类数据训练的计算模型,还有一些是真实人类在玩这个游戏。
- 结果: IAD AI 的表现始终优于其他方法。当与快速的人类配对时,它会加快速度;当与缓慢、谨慎的人类配对时,它会放慢速度并等待。它不会感到困惑,也不会“崩溃”而无所作为。
- 证明: 他们甚至通过可视化数据观察到,AI 的行为形成了整齐、分离的簇。这不是一团模糊的混乱,而是一套清晰的不同工具被正确使用的集合。
结论
这篇论文表明,为了让 AI 能很好地与人类协作,它不应仅仅试图在任务上表现得“好”。它需要学习一系列 distinct 的行为库,并拥有一种智能方式,根据与其合作的人来挑选正确的行为。通过迫使这些行为彼此明显不同,AI 无论搭档是机器人、计算机模拟还是真人,都能成为一个更具适应性和可靠性的伙伴。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。