Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning
本文介绍了 Max-Q 选择性模仿(Max-Q Selective Imitation),这是一种人机回环在线强化学习方法,它将 MC Q-chunk 评论家与硬性胜者全得式策略更新相结合,以快速整合人类干预并加速自主自我提升,与现有基准相比,在现实世界和模拟机器人任务中实现了显著更快的收敛速度和更高的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
通过实践进行学习的机器人长期面临着一个困难的悖论:它们需要尝试各种尝试才能变得更好,但尝试往往会导致代价高昂或危险的错误。在现实世界中,比如机器人可能正在组装精密的电子元件或在杂乱的房间中穿行,一次失误就可能损坏零件或损坏机器。为了解决这个问题,工程师们开发了一种被称为“人类在环”(human-in-the-loop)学习的安全网。在这种方法中,机器人会自主尝试执行任务,但人类会密切观察,并在机器人偏离轨道时介入进行纠正。随后,机器人会将这些被纠正的时刻连同其自身的成功尝试一起保存下来,以便日后研究。其目标是让机器人能从人类的帮助中快速学习,并最终变得足够熟练,从而不再需要这种帮助。然而,教导机器人如何在平衡这两个需求——既吸收人类的建议,又不产生依赖;又在提升自身技能的同时超越人类自身的水平——方面,一直是一个顽固的挑战。
来自研究人员 Zihang Wang 和 Yishan Wang 的一项新研究为处理这种平衡提供了一种全新的方式。他们开发了一种训练方法,使机器人能够比以往的系统更快地从人类纠正中学习,同时确保机器人在具备能力后能继续精进自己的技能。他们方法的核心在于对机器人处理经验方式的两项特定改进。首先,研究人员并没有让机器人根据对下一步可能发生情况的猜测来预测动作的未来价值,而是让机器人回顾已完成任务的实际结果。他们将动作划分为小的、有意义的序列(或称为“块”),并根据实际发生的情况计算这些序列的真实成功率。这给了机器人一个清晰、真实的图景,让它了解哪些人类纠正是真正有帮助的,而不是让这些信息被不确定的预测所稀释。
第二点,也是他们方法中更为巧妙的部分,在于机器人如何决定下一步学习什么。在许多系统中,机器人可能会尝试取人类建议与其当前行为的平均值,这有时会导致混乱或失去焦点。相反,研究人员编写程序让机器人扮演一名严格的法官。对于遇到的每种情况,机器人都会比较两个选项:它现在自主采取的动作,以及它从人类或过去的尝试中学习到的特定动作。然后它会问一个简单的问题:“这两个动作中哪一个更好?”如果人类的纠正更好,机器人就模仿它;如果机器人当前的动作更好,它就坚持自己的计划。这创造了一个自然的切换机制:当机器人还在学习阶段时,它跟随人类的引导;但一旦机器人变得比人类过去的纠正更出色,它就会停止查看人类数据,转而完全专注于提升自身的表现。这防止了机器人在已经超越人类建议后,仍试图模仿过时建议的情况。
研究人员通过两种方式测试了这种方法:首先是在计算机模拟中进行诸如将销钉插入孔中和画正方形之类的任务,然后在真实的物理机器人手臂上执行任务,任务是将一个 USB 驱动器捡起并插入电脑。在模拟实验中,新方法在大约半小时的训练内就能让机器人达到 96% 至 99% 的成功率。相比之下,一种名为 HIL-SERL 的领先的前代方法需要大约三到四个小时才能达到类似的成功水平。在现实世界的测试中,差异更为显著。在物理机器人上,新方法仅用 30 分钟就实现了 99% 的成功率。而旧方法则需要大约五小时的训练才能达到其巅峰性能。这代表了将机器人训练到高可靠性水平所需时间减少了十倍。
该研究还将他们的方法与几种现有的技术进行了对比,发现大多数技术在相同的时间范围内都难以达到高成功率。一些方法由于无法有效地从人类和机器人数据的混合中学习,从而停滞在较低的成功率;而另一些方法则需要更长的时间才能收敛。研究人员指出,他们的方法之所以奏效,是因为避免了一个常见的陷阱,即机器人试图从与其当前技能水平不再相关的资料中学习。通过使用“胜者全得”的规则来在人类建议和自身不断增长的专业知识之间做出选择,机器人避免了常使学习过程变慢的混乱。结果表明,这种结合了“回顾真实结果”与“在人类行为与自身行为间做出果断抉择”的具体策略,是训练执行复杂物理任务的机器人的高效方式。虽然研究人员承认该方法依赖于机器人内部评估的质量,且特定动作序列的长度需要针对每个任务进行调整,但其在模拟和真实硬件上的性能提升是巨大的。这项工作表明,只要拥有正确的学习策略,机器人就可以迅速吸收人类指导,然后独立掌握任务,从而显著加速了通往具备能力的自主机器体的进程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。