WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation
本文介绍了 WARP-RM,这是一种全自监督奖励模型,它通过从时间扭曲的成功演示中生成稠密相对进度信号,从而实现 WARP-BC,一种通过对混合质量数据中的动作块进行过滤和重加权,显著提升机器人在长程任务上表现的行为克隆方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直在努力学习如何通过观察人类来学习。虽然人类只需瞥一眼任务就能理解动作的流程,但基于视频数据训练的机器人往往会将错误与成功一并学习。如果人类操作者在思考时停顿、在处理物体时手忙脚乱,或者在成功之前尝试了一种笨拙的抓握方式,机器人会将这些犹豫视为正确路径的一部分。对于像折叠衣物或组装物体这样长而复杂的任务,这尤其是一个问题,因为一个瞬间的困惑就可能导致整个序列脱轨。多年来,研究人员一直试图教机器人忽略这些糟糕的时刻,但大多数方法需要昂贵的人工标注来精确标记错误发生的地点,或者如果视频片段中包含任何错误,他们就会丢弃整个视频片段,从而浪费了隐藏在不完美演示中的宝贵恢复动作。
加州大学伯克利分校和斯坦福大学的研究团队开发了一种新方法,可以教机器人区分生产性动作与浪费时间,且无需任何人工标签。他们创建了一个名为 WARP 的系统,全称为“扭曲增强相对进度”(Warp-Augmented Relative Progress)。研究人员并没有要求人类观看数小时的视频并在好坏时刻画框,而是教会计算机通过以不同的速度甚至反向播放视频来理解进度和方向。通过训练机器人识别与“向后”或停滞运动相比,“向前”进度是什么样子的,该系统学会了为视频中的每一帧分配一个分数。这个分数告诉机器人任务进展得有多快、是否处于停滞状态,或者是否实际上正在倒退。
研究人员在一个拥有两个手臂的物理机器人上测试了这个想法,要求它折叠装在箱子里的皱巴巴的 T 恤。他们创建了质量各异的训练数据集。在最好的数据集中,人类的演示是快速且高效的。在最差的数据集中,人类的演示充满了停顿、重试和长时间的笨拙操作。当他们用这些杂乱、低质量的视频训练标准的机器人学习系统时,机器人几乎完全失败了。它会陷入微小且无意义的调整循环中,无法完成任务。然而,当他们使用新的 WARP 系统来过滤数据时,结果发生了戏剧性的变化。该系统自动识别了视频中缓慢、犹豫的部分并降低了它们的重要性,同时保留了快速、果断的时刻。在标准机器人二十次中失败二十次的那些杂乱数据集中,经过 WARP 训练的机器人二十次中成功了十九次。此外,在面对同样质量较差的数据时,它折叠衬衫的速度比标准机器人快了近十八倍。
团队并未止步于 T 恤。他们还在一个机器人需要将塑料瓶放入箱子的任务上测试了该方法。在现实世界中,新系统将八十个瓶子中的七十四个放入了箱中,而标准系统仅成功放入了五十九个。新机器人的放置速度更快,也更具一致性。为了确保这些结果不仅仅是特定机器人硬件的偶然现象,研究人员进行了包含五百一十二种不同场景的大规模模拟。在这次虚拟测试中,新系统每小时放置 290 个瓶子,明显优于每小时只能放置 237 个瓶子的标准系统。即使与其他尝试清理数据的先进方法相比,这种新方法也始终产生了最快且最可靠的结果。
该系统之所以奏效,一个关键部分在于它如何识别进度。研究人员并没有告诉计算机“折叠好的衬衫”看起来是什么样的。相反,他们提取了人类折叠衬衫的成功视频,并以随机速度回放,有时将其减慢到极慢的速度,有时则加速。他们还播放了一些倒放视频。随后,计算机被要求猜测从片段开始到当前时刻过去了多少时间。通过学习在这些扭曲、被扰乱的视频版本中预测流逝的时间,计算机学会了理解任务的自然节奏。它学会了快速、流畅的动作通常意味着任务正在向前推进,而缓慢、颠簸的动作或向后的运动则意味着任务处于停滞或失败状态。这使得系统能够为视频的每一帧生成一个连续的分数,告诉机器人哪些部分是值得关注的,哪些应该忽略。
研究人员发现,仅仅丢弃糟糕的视频是不够的。最有效的策略是保留这些杂乱的视频,但改变机器人学习的方式。系统会提取视频中的一段动作,并查看该段末尾的进度分数。如果分数很高,意味着任务正在快速向前推进,机器人就会全力以赴地学习该段内容。如果分数很低或为负值,意味着机器人在犹豫或向后移动,系统要么完全忽略该段,要么进行极轻微的学习。这种方法让机器人能够从人类掉落衬衫又重新捡起的恢复动作中学习,而不会学到导致掉落的恐慌和犹豫。
这项工作表明,机器人不需要完美的演示也能学习复杂的技能。如果它们有一种理解数据中时间和进度流向的方法,它们就可以从杂乱的现实世界数据中学习。研究人员指出,他们的方法依赖于一种特定的数据增强类型,即视频被倒着播放,这对于真实的机器人来说在物理上是不可能的。然而,系统仍然从这种人工训练中学习到了有用的模式。虽然该方法并非适用于所有可能任务的神奇解决方案,但它提供了一个强大的新工具,让机器人能够忽略人类错误的噪声,并专注于成功行动的信号。该团队已公开了他们的代码和数据,以便其他研究人员可以在自己的机器人和任务上测试这些想法,这可能引领新一代机器人能够从不完美的日常世界中快速学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。