Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations
该论文提出了 DR-LfD,这是一个通过将演示分解为原子技能,从而将视觉运动策略与任务和运动规划(TAMP)相结合的框架,进而实现了鲁棒且数据高效的长程机器人操控,克服了传统规划的脆弱性以及纯模仿学习的泛化限制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图教一个机器人完成一个复杂的魔术技巧,比如一边走钢丝一边玩杂耍。长期以来,科学家们一直尝试用两种主要方式来教机器人。第一种方式就像是给机器人一份由人类编写的严格、循序渐进的食谱。这种方式非常适合逻辑处理,但如果机器人掉落了一把勺子,或者桌子稍微移动了一下,食谱就会失效,导致机器人陷入僵局。第二种方式则像是向机器人展示一段人类表演该技巧的视频,并寄希望于机器人通过观察来学习。这种方式非常擅长模仿动作,但如果机器人看到的勺子位置与视频中的位置稍有偏差,它就会感到困惑并失败。机器人学的核心问题在于:我们如何兼顾两者的优点?如何让机器人既足够聪明能够提前规划,又足够灵活能够应对现实世界的混乱,而不需要为了学习每一种可能性而去观看数百万个视频?
这篇论文介绍了一种名为 DR-LfD(从演示中分解并重组技能)的新系统,试图解决这个难题。可以将它想象成一位大师级厨师,他不仅仅是死记硬背一道七道菜大餐的完整食谱,而是将这顿饭分解成一个个微小且完美的“技能”,比如切洋葱、煎牛排或搅拌鸡蛋。厨师会多次练习这些细小的技能,直到它们变得完美无缺。那么,当顾客订购了一道新的、奇怪的菜肴时,厨师并不会惊慌失措。他只需查看订单,从自己的脑海清单中挑选出预先练习过的正确技能,然后按照新的顺序重新排列它们,即可烹饪出新菜。
论文指出,通过将漫长且复杂的任务分解为这些细小、可重用的“技能”,机器人可以学得更快,并能更好地应对新情况。机器人不需要学习一个包含 20 个步骤的任务的所有可能组合(那将耗费极长时间),它只需要将这 20 个独立的步骤各学习一次。然后,一个聪明的“规划器”(即厨师的大脑)会负责思考如何将这些步骤组合起来以完成任何新工作。
以下是 DR-Lfd 的工作原理,我们用机器人学习复杂电子游戏的类比来进行说明:
1. 将游戏分解为关卡(分解)
当人类向机器人展示如何完成一项任务(例如打包螺丝刀或递给朋友一个杯子)时,系统并不会仅仅将整个过程记录为一段长视频。它使用一种特殊的“接触检测器”来观察机器人的手何时接触或离开物体。它根据这些接触点将视频切割成一个个微小的片段。
- “简单动作”: 对于简单的部分,如拿起杯子或放下杯子,机器人会学习一种“原语”(primitive)。这就像是一种预设的肌肉记忆,知道无论物体在桌子的什么位置,都要如何移动手臂去抓取物体。
- “困难动作”: 对于复杂的环节,如擦拭杯子或在双手之间传递物体,机器人会学习一种“视觉运动策略”(visuomotor policy)。这就像是一种反射动作,通过观察摄像头并实时调整双手,以保持物体的稳定。
- “过渡动作”: 对于在空旷空间中移动的部分,机器人则直接使用标准的数学方法来规划路径。
2. 智能规划器(重组)
一旦机器人拥有了这样一个“工具箱”,它并不会盲目地按顺序执行。它使用了一个任务与运动规划器(TAMP)。你可以把这个规划器想象成机器人大脑中的 GPS。
- 如果机器人需要把杯子递给一个人,规划器会检查:“杯子是否可触及?人的手是否在正确的位置?是否有椅子挡住了路?”
- 如果杯子太远,规划器不会只说“失败”,它会说:“好吧,先移动椅子,然后拿起杯子,最后再递过去。”
- 如果机器人尝试抓取杯子却因为杯子移动而没抓稳,规划器会察觉到这一点,停止当前动作,并重新计算一条新路径。这就像 GPS 在遇到交通拥堵时为你重新规划路线一样。
3. 系统测试
作者在计算机模拟和真实机器人(使用名为 ALOHA 的双臂机器人)上测试了该系统。他们只给了机器人少量的训练数据——每个技能仅 20 次演示。
- 结果: 当他们在物体处于从未见过的奇特位置进行测试时,传统方法(如单纯观看视频)经常失败,但 DR-LfD 却能保持成功。例如,在“插孔”任务中,当孔的位置发生移动时,其他方法大约有一半时间会失败,而 DR-LfD 在标准测试中成功率为 100%,在难度极大的随机测试中也达到了 88%。
- 处理障碍物: 在一次测试中,他们放置了一根杆子挡住了机器人的手臂。机器人意识到无法直接到达目标,于是规划器指示它先移动杆子,然后再伸手拿目标。它成功清除了障碍并完成了任务。
- 长任务: 他们甚至让机器人完成长期的多步骤任务,比如将三种不同的胶带依次递入篮子,或者在擦拭杯子的同时打包螺丝刀。在这些特定实验中,机器人成功地将 19 到 21 个步骤串联了起来,而这类任务通常会导致机器人产生混乱并失败。不过,论文也提到,这种成功是在规划器的计算极限范围内,并且是针对特定任务的。
论文中提到的局限性(目前还做不到的事)
作者谨慎地指出,这并非魔法。系统仍然需要人类来指定目标或提供偏好;在没有这些输入的情况下,它无法自主“弄明白需要做什么”。此外,由于机器人依赖 3D 深度摄像头来观察物体,如果摄像头脏了或者光照条件不好,机器人可能会产生困惑。论文还提到,如果任务变得过于复杂,涉及过多的物体,规划部分所需的思考时间就会变长,就像人类面对太多选择时会感到不知所措一样。
总结
论文表明,通过教机器人学习细小且可重用的技能,并使用智能规划器进行组合,我们可以构建出更加灵活且对训练数据需求量更小的机器人。这是迈向未来的一步:机器人可以走进一个凌乱的房间,在人类告知目标后,自行搞清楚需要做什么,并高效完成任务,而无需为每一种可能的场景都去观看数百万个练习视频。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。