Jointly Learning Predicates and Actions Enables Zero-Shot Skill Composition
本文介绍了谓词动作技能(PACTS),这是一种闭环视觉运动策略,它联合建模动作轨迹与符号谓词结果,以通过规划实现所学技能的鲁棒性零样本组合。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人烹饪一顿复杂的饭菜,比如先制作三明治,然后清理现场。
旧方法:“盲眼”厨师
传统上,当我们教机器人新技能(例如“拿起面包”)时,我们使用一种称为“从演示中学习”的方法。我们向机器人展示一段人类执行该动作的视频,机器人则学习模仿手部动作。
然而,这种方法存在一个问题。机器人完美地学会了动作,但它并没有真正理解结果。它知道如何移动手臂去抓取面包,但它缺乏一个清晰的内部检查机制来确认:“好的,我已经成功抓到了面包。”
正因为如此,如果你要求机器人执行它从未见过的技能新组合(例如“抓取面包,但仅当黄油已经打开时”),它就会感到困惑。这就像一位知道如何切洋葱的厨师,却不知道“切好的洋葱”长什么样,因此无法决定何时停止切洋葱或下一步该做什么。为了解决这个问题,我们通常必须为每一种新的组合从头重新训练机器人。
新方法:PACTS(“有觉知”的厨师)
本文介绍了一种名为PACTS(谓词 - 动作技能)的新系统。将 PACTS 想象成教机器人成为一位“有觉知”的厨师,它同时学习两件事:
- 动作:物理运动(如何移动手臂)。
- 结果:关于刚刚发生之事的符号化“信念”(例如,“面包现在在我手中”或“门现在打开了”)。
创意类比:“双轨”磁带
想象机器人的学习过程就像在一种特殊的双轨磁带上录制电影:
- 轨道 A 记录机器人手部移动的视频。
- 轨道 B 记录随着电影播放而变得为真的“事实”的实时解说(例如,“物体被握住”、“物体被释放”、“门已打开”)。
在旧系统中,这两条轨道由互不交流的不同的人录制。有时视频显示机器人掉下了杯子,但解说轨道仍然显示“杯子被握住”。这种不匹配在尝试规划复杂任务时会导致混乱。
通过PACTS,机器人通过单一、统一的流程同时录制这两条轨道。当它学习动作时,它也学习世界中相应的变化。因为它们是一起学习的,所以它们完美同步。如果机器人的手移动去拿起杯子,其内部的“信念”会自动更新为“我正握着杯子”。
为何这很重要:零样本组合
PACTS 最大的超能力是零样本组合。
因为机器人现在拥有了这种清晰、符号化的“解说轨道”(谓词信念),并且能够实时更新,我们可以使用标准的、现成的“规划器”(如 GPS 或食谱书)来混合搭配机器人从未见过的技能组合。
- 场景:你教过机器人“开门”,也单独教过它“推手推车”。你从未展示过“先开门然后推手推车”。
- 结果:规划器查看机器人内部的“信念轨道”。它看到机器人成功“打开了门”(信念从假变为真)。规划器接着说:“太好了!既然门已经打开,现在执行‘推手推车’技能。”
机器人无需任何新训练即可做到这一点。这就像一位厨师知道如何烧水和如何煎鸡蛋。即使他们从未做过“水煮蛋煎三明治”,他们也可以查看内部清单,看到水已烧开,然后立即切换到煎鸡蛋。
现实世界测试
作者通过三种方式对此进行了测试:
- 2D 游戏:机器人推方块。与仅学习动作的机器人相比,PACTS 在正确移动方块以及正确识别方块何时到达正确位置方面表现更佳。
- 3D 模拟:制作咖啡或在厨房烹饪等复杂任务。PACTS 在保持高性能的同时,为规划器提供了清晰的当前状况视图。
- 现实生活:一台真实机器人将彩色立方体装入盒子。团队分别教它装填红色立方体和绿色立方体。使用 PACTS,他们随后可以要求机器人“只装填红色和黄色立方体”(一种它从未见过的组合),机器人能够根据内部信念遵循规划器的指令,成功完成了任务。
总结
PACTS 教导机器人将动作和结果作为一个整体包一起学习。这赋予了机器人关于其成就的清晰、实时的“状态报告”。该状态报告允许简单的规划器即时混合搭配技能,让机器人无需从头重新训练即可解决新的复杂问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。