Consistent Zero-Shot Imitation with Contrastive Goal Inference
本文介绍了对比式逆强化学习(Contrastive Inverse Reinforcement Learning, CIRL),这是一种自监督预训练框架,它将多任务逆强化学习转化为一个可处理的目标推理问题,从而使智能体能够在无需奖励或测试时更新的情况下,在零样本模仿场景中一致地复现专家行为。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人完成一项新任务,比如堆叠积木或在房间里行走。通常情况下,你必须向机器人展示每一步具体该怎么做(模仿),或者给它一套严格的规则和得分标准(奖励)。但如果我想让机器人在没有任何演示、也没有任何评分卡的情况下自主学习,然后在稍后仅仅通过观看一段人类完成任务的视频,就能完美地掌握这项任务呢?
这正是这篇论文所解决的挑战。来自普林斯顿大学的研究人员引入了一种名为 CIRL(对比逆强化学习,Contrastive Inverse Reinforcement Learning)的新方法。以下是其工作原理的拆解,通过简单的概念和类比来呈现。
核心思想:“目标”是秘密语言
这篇论文的核心洞察是:几乎任何复杂的任务都可以由一个单一的目标状态(goal state)来概括。
- 类比: 想想烹饪节目。你不需要记住厨师每一个切菜、搅拌或翻炒的动作。你只需要知道最终的成品(目标)。如果你知道目标是“一份完美的欧姆蛋”,你就能推导出实现它的步骤。
- 问题: 大多数人工智能试图直接猜测“食谱”(奖励函数),这就像是在试图猜测厨师脑海中精确的想法。这非常混乱且往往是错误的。
- CIRL 的解决方案: CIRL 不去猜测食谱,而是猜测最终的成品(目标)。一旦机器人知道了目标,它就会利用预训练的技能来达到那个目标。
CIRL 如何学习(“游乐场”阶段)
在机器人见到人类之前,它会经历一个“预训练”阶段,在这个阶段,它完全自主学习,没有人类帮助,没有奖励,也没有演示。
好奇的探索者 (GoalKDE):
想象一个在巨大游乐场里的孩子。为了学习如何移动,这个孩子并不只是随机游荡;他们会专门寻找尚未造访过的地方。CIRL 有一个名为 GoalKDE 的机制,就像这个孩子一样。它观察机器人去过的所有地方,然后说:“你来这里已经一百万次了,但你从未去过那里。”它会挑选一个新的、未被探索过的点作为“目标”,并告诉机器人尝试到达那里。这迫使机器人探索整个环境,并学习如何在所有方向上移动。“如果……会怎样”的训练器 (Contrastive RL):
在机器人进行探索时,它在学习一种特殊的地图。它学习的不是“这个动作给了我 10 分”,而是学习一种距离感。它学习到:“如果我在这里,而我想去那个目标,有多难?”它学会了区分“容易到达”的状态和“难以到达”的状态。这至关重要,因为它帮助机器人理解某些目标天生就比其他目标更难实现。记忆库:
机器人将所有这些前往不同目标的“旅程”保存在一个记忆库中。它学习到一种通用的策略:“这是我到达可能给出的任何目标的方法。”
测试:单次模仿
现在,真正的测试开始了。你向机器人展示一段专家执行任务的单段视频(例如,人类走向特定椅子的过程)。机器人从未见过这项任务,也无法寻求帮助。
- 侦探 (Goal Inference):
机器人观察视频并询问:“专家试图到达哪里?”它使用一个统计模型(一种类似于智能捷径的“平均场”模型)来推测目标。
- 聪明的小技巧: 论文证明,仅仅观察专家最终停留的位置是不够的。机器人还必须考虑到达那里的难度。如果专家为了到达某个点而走了一条非常艰难的路径,那么这是一个强烈的信号,表明这个点才是预期的目标。如果他们走的是一条容易的路径,那么他们可能只是在闲逛。CIRL 考虑到了这种难度,这使得它比以往的方法是更出色的侦探。
- 执行:
一旦机器人猜到了目标(例如,“专家想坐在那把椅子上”),它就会激活其预训练的“游乐场技能”来到达那个特定的位置。它不需要重新学习如何行走;它只需将现有的技能应用于这个新目标。
为什么这比旧方法更好
论文将 CIRL 与其他方法(如“前向-后向”或 FB 表示法)进行了比较。
- 旧方法的缺陷: 想象一张地图写着:“人们访问最多的地方是最重要的。”如果机器人走进一个房间并因为门被卡住了而困在那里,它会在那个房间里频繁出没。旧方法可能会认为:“噢,他们一定很想待在这个卡住的房间里!”
- CIRL 的优势: CIRL 知道那个卡住的房间是难以到达且难以停留的。它意识到:“他们并不是想待在那儿,他们只是被困住了。”通过考虑到达一个状态的难度,CIRL 能正确推断出真实的目标,即使专家在到达那里时遇到了困难。
结果
作者在各种机器人任务上测试了它,从移动机械臂到推动物体再到行走。
- 结果: CIRL 一致地击败了其他“零样本”(即尝试在不经过重新训练的情况下从单个示例中学习的方法)方法。
- 证明: 他们在数学上证明了该方法是“一致的”,这意味着它能可靠地找到正确的目标,而其他类似的方法则容易被任务的难度所误导。
总结
简而言之,CIRL 是一种教机器人成为自给自足的探索者的方法。它在沙盒中度过时间,学习如何独自到达房间的每个角落。然后,当它看到人类做某件事一次时,它并不试图复制人类的精确动作。相反,它通过弄清楚人类试图前往何处,并利用其沙盒技能到达那里。它之所以奏效,是因为它明白:仅仅因为一个地方被频繁访问,并不意味着那是目标——有时候,目标是那个最难到达的地方。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。