Partner-Aware Hierarchical Skill Discovery for Robust Human-AI Collaboration
本文提出了伙伴感知技能发现(PASD),这是一种利用对比内在奖励来学习基于伙伴行为条件的技能的分层强化学习框架,从而克服捷径学习,实现跨多样及新颖伙伴的稳健、自适应人机协作。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图与一位新搭档共同烹饪一顿复杂的餐食。你从未与他们合作过。他们可能动作快、慢、杂乱无章,或者井井有条。如果你只专注于自己的烹饪风格而不顾及对方,你很可能会与对方碰撞、打翻食材,或者做出两锅不同的汤,而不是同一锅。
本文介绍了一种训练 AI“烹饪搭档”(或任何协作机器人)的新方法,使其能够与任何人类顺畅合作,无论其行为方式如何。该方法被称为PASD(伙伴感知技能发现)。
以下是其工作原理的简单分解,使用日常类比:
1. 问题:以“自我为中心”的厨师
大多数现有的 AI 训练方法就像一位只关心自己刀工的厨师。他们学习尽可能快地切菜,因为这会给他们带来“奖励”。
- 缺陷:如果搭档动作慢,这位快厨师只会越切越快,无视搭档跟不上节奏。AI 学会了“捷径”——它发现了环境中一些看似有效但实际上无助于团队的奇怪模式。这就像一位舞者疯狂旋转,因为他们觉得这样看起来很酷,尽管他们的搭档正静止不动。
- 结果:当你将这种 AI 与具有不同风格的真实人类配对时,AI 会感到困惑,无法协调配合。
2. 解决方案:“镜像”厨师(PASD)
作者创建了 PASD,教导 AI 成为其搭档的“镜像”。AI 不再仅仅学习“如何切菜”,而是学习“当我的搭档在做 X 时,该如何切菜”。
这就像学习跳舞。
- 旧方法:AI 学习包含 100 种不同舞蹈动作(技能)的列表,并试图独自完美地完成所有动作。
- PASD 方法:AI 学习观察搭档。如果搭档做一个缓慢、优雅的动作,AI 就知道选择“慢舞”技能。如果搭档做一个快速、充满活力的跳跃,AI 就选择“快舞”技能。
3. 如何学习:“集体照”技巧
AI 如何知道哪种技能匹配哪种搭档?本文使用了一种巧妙的技巧,称为对比学习。
想象你正在拍摄一群朋友进行不同活动的照片:
- 设置:你拍摄了 10 张相同的“慢舞”技能照片,但每次都将 AI 与不同的搭档配对(一个高,一个矮,一个快,一个慢)。
- 目标:AI 被告知:“尽管这些搭档看起来不同,但‘慢舞’的结果在照片中应该看起来是一样的。”
- 对比:然后,你向 AI 展示“快跳”技能的照片。AI 学习到:“这些照片看起来与‘慢舞’照片完全不同。”
通过这样做,AI 学会了忽略随机噪声(如搭档的身高),并专注于他们共同移动的模式。它学会了说:“啊,这种特定的搭档风格总是导致这种特定的团队结果。”
4. “内在奖励”:秘密分数
在电子游戏中,你通过击杀敌人或收集金币获得分数(外在奖励)。但在这里,AI 仅因识别模式而获得一种秘密的、内部的分数(内在奖励)。
- 如果 AI 看到一位搭档并正确预测:“哦,这位搭档喜欢顺时针移动,所以我应该使用‘顺时针技能’",它就会获得一个奖励分。
- 如果它猜错了并使用了“逆时针技能”,它就会受到惩罚。
- 这个奖励分鼓励 AI 停止随机猜测,开始密切关注搭档的行为。
5. 结果:成功共同烹饪
研究人员在名为Overcooked-AI的游戏中测试了这种方法,在该游戏中,两个智能体必须在一个狭小的厨房里共同烹饪汤。
- 测试:他们将 AI 与许多不同的“搭档”配对(有些是其他 AI,有些是基于真实人类数据训练的计算机模型,有些是真实人类)。
- 结果:
- 旧方法(如 FCP 或 DIAYN)经常感到困惑或撞墙,因为它们适应不良。
- PASD 获胜。它持续获得更高的分数。
- 当真实人类与 PASD AI 一起玩耍时,他们煮出的汤更多,事故更少,比与其他 AI 玩耍时表现更好。
结语
本文并不声称 AI 明天就能为你做晚饭。它仅仅证明,如果你教导 AI 根据与其合作的人来学习技能(而不仅仅是根据它正在做什么),它就会成为一个更好的队友。它不再是一个“独狼”,而是开始成为一个真正的伙伴,能够适应任何人的风格。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。