Tri-Manual Visuomotor Imitation Learning of Robot Policies
本文介绍了 TriManPolicy,这是一种具有依赖感知三臂调度(DATS)机制的模仿学习系统,该系统通过在保持任务约束的同时对独立的机械臂运动进行离线重定时,使单个人类操作员能够有效地演示并训练三臂机器人的同步策略,从而克服了传统双臂遥操作的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人不再通过试错,而是通过观察人类完成家务来学习任务的世界。这个领域被称为“模仿学习”(imitation learning),就像是通过让机器人看着你切菜和搅拌锅里的东西,从而教会它做饭一样。通常情况下,当机器人和人类拥有相同数量的手时,这种方法效果最好。如果人类用两只手折叠一件衬衫,一个双臂机器人可以完美地复制这个动作。但如果机器人拥有超能力,长了三只手臂,而人类老师却只有两只手,情况会发生什么呢?这就是科学家们试图解决的谜题。他们想知道,仅仅通过观察只能同时控制两只手臂的人类,机器人是否能学会使用第三只“辅助”手臂。如果机器人试图完全模仿人类的时序,它可能会陷入等待人类切换手部动作的困境,即便机器人本可以同时做三件事。核心问题在于:我们能否教会机器人忽略人类的“切换延迟”,并弄明白如何同时使用所有三只手臂?
于是有了 TriManPolicy,这是一个巧妙的新系统,旨在利用只有两只手的真人教师来训练三臂机器人。研究人员发现,当人类控制三臂机器人时,他们必须轮流操作:先控制其中两只手臂,然后切换到另一对组合,导致第三只手臂处于冻结状态。如果机器人只是单纯地模仿这段视频,它也会学会这种停顿,等待人类进行模式切换。为了解决这个问题,团队创建了一个名为 DATS(依赖感知三臂调度系统)的数字“时空旅行”工具。把 DATS 想象成一个电影剪辑师,它观察人类的录像并重新编辑时间线。它保留了所有的实际动作——比如人类用一只手撑开袋子,同时另外两只手折叠毛巾——但它去除了人类因切换控制权而产生的尴尬停顿。DATS 能够识别哪些动作必须按特定顺序发生(例如在放下盒子之前先盖上盖子),以及哪些动作可以同时发生(例如在擦拭盒子的同时稳住盒子)。通过重新排列视频,展示这些动作同步进行的场景,它训练机器人成为真正的三臂超级英雄。
结果令人印象深刻。团队在六种不同的现实任务中测试了该系统,例如折叠毛巾、粘贴袋子和将橡皮擦放入盒中。他们为每个任务进行了 25 次试验。使用经过“时空旅行”处理后的 DATS 方法训练的机器人速度明显更快。事实上,在每一项任务中,经过 DATS 训练的机器人完成工作所需的时间都比直接使用原始未编辑视频训练的机器人要短。例如,在涉及放置橡皮擦的任务中,经过 DATS 训练的机器人速度提升了近 50%。它们的成功率也与其它机器人持平,甚至更高。数据表明,通过教会机器人忽略人类的切换延迟,并专注于任务的逻辑流程,机器人学会了如何协调所有三只手臂,将笨拙、断断续续的表现转变为流畅、同步的舞蹈。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。