From Pretraining to Proficiency: Real-World Subtask RL for Long-Horizon Manipulation with Minimal Human Intervention
本文介绍了 PARTS,这是一个真实的强化学习框架,它通过仅将人类干预集中在关键的子任务瓶颈上,来微调预训练的机器人策略,从而与现有方法相比,以极少的人力投入显著提高了长程操控任务的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直在努力应对需要一系列精确步骤的任务,例如打开盒子、拿起物体并将其放入其中。多年来,工程师们试图通过向机器人展示成千上万个完成整个工作的示例来教导它们,希望机器能一次性学会整个流程。最近,新一代的机器人“大脑”出现了。这些大脑通过海量的视频和数据进行训练,使其能够理解语言并执行许多不同的动作,而无需针对每种动作进行专门训练。它们在基础任务方面表现得相当出色:它们可以拿起杯子,将杯子移过桌面,或者打开一扇门。然而,当面对需要高精度的长而复杂的任务时,这些通用型机器人经常会在几个特定的困难时刻出错。它们可能成功抓住了物体,但抓取的方式不对,导致下一步骤失败。科学家面临的挑战在于,如何在不浪费时间重新教授机器人已经掌握良好的知识的情况下,修复这些特定的薄弱环节。
一个研究小组开发了一种名为 PARTS 的新方法来解决这个问题。与其尝试让机器人从头到尾重新训练整个任务,他们的做法是专门针对机器人失败的时刻。想象一下,一个机器人可以打开充电盒并将其拿稳,但却反复无法将一只耳机滑入微小的插槽中。研究人员将这个特定的失败点识别为一个“瓶颈”。他们并没有让机器人一遍又一遍地练习整个流程,而是冻结了机器人的通用知识,并为其添加了一个仅针对那一个困难步骤的小型专业化插件。这个插件学习如何在需要的时候对机器人的动作进行微小的、精确的修正。该系统使用一个计算机程序来观察机器人,判断它何时进入困难阶段,并切换到专门的辅助程序。一旦困难步骤完成,控制权便交还给机器人原有的、可靠的大脑。这个循环让机器人能够反复练习难点,而无需人类每次都去重置场景或纠正其错误。
研究人员在真实机器人执行复杂任务(如将耳机插入充电盒、对小型乐高积木进行分类以及将电缆插入路由器)的过程中测试了这种方法。在一项关于双臂机器人的实验中,原始版本完成整个耳机任务的成功率仅为 32% 左右。在使用这种针对性训练方法后,成功率跃升至 61%。在另一个单臂机器人插电缆的测试中,成功率从 50% 飙升至 95%。这些进步是在每个任务仅进行了几十分钟的现实世界练习中实现的。团队将他们的方法与其他训练方式进行了对比,在其他方式中,机器人需要从头开始练习整个任务。那些方法使用了相同数量的机器人运行时间,但结果的成功率要低得多,通常甚至无法提升机器人的性能。研究人员发现,通过将学习集中在机器人挣扎的特定步骤上,他们可以用更少的精力实现更好的效果,并减少人工监督。
这一成功的关键在于系统如何处理失败。在传统的训练中,如果机器人在长任务的最后一步失败了,它无法从前面已经做对的许多步骤中获得任何奖励,这使得学习变得困难。新系统将任务分解,并在机器人成功完成仅仅一个困难的子步骤后立即给予奖励。如果机器人成功将耳机插入,它会立即收到一个积极信号,即使充电盒还没有被完美地关上。这种频繁的反馈有助于机器人更快地学习。此外,该系统包含一种智能的练习数据组织方式。当机器人最终成功完成一个困难步骤时,那次成功的尝试会被保存下来,并用于更彻底地重新训练专门的辅助程序,以确保它不会忘记成功的经验。这个过程是自动进行的,机器人只有在绝对必要时(例如物体掉落在地板上时)才会进行自我重置或请求人类重置。
这项研究表明,机器人不需要为了变得更擅长复杂工作而从头开始重新训练。通过识别它们挣扎的几个特定时刻,并针对这些时刻进行专注、有针对性的练习,工程师可以显著提升机器人完成长而难任务的能力。这种方法尊重了机器人现有的能力,保持了运作良好的部分原封不动,同时强化了薄弱环节。研究结果表明,这为在现实世界环境中部署机器人提供了一条切实可行的路径,因为现实中的任务通常很长,且需要结合通用技能与精确执行。研究人员得出结论,这种将精力集中在瓶颈上的方法使机器人学习效率更高,所需的干预更少,且可靠性比以往的方法更高。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。