← 最新论文
💻 computer science

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

该论文介绍了 AutoSERL,这是一个通过集成滑动窗口引导、安全恢复和自动终止机制,利用单次演示来自动化实现现实世界机器人强化学习的框架,从而在多种接触密集型任务中,与现有基准相比实现了更优越的性能和鲁棒性。

原作者: Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

教导机器人执行现实世界中精细的物理任务是一项极其困难的任务。与运行在完美数字真空中的计算机程序不同,物理机器必须在一个混乱的环境中导航,在那里,一个错误的动作就可能损坏零件、损坏机器,或者仅仅是让机器卡住。为了学习如何避免这些陷阱,机器人传统上依赖于强化学习,这是一个试错过程,即机器尝试一个动作,观察结果,并根据奖励信号调整其行为。然而,在物理世界中,这个过程既缓慢又危险。如果机器人尝试将插头插入插座却失败了,它可能会卡住机构或刮伤表面。此外,成功的“奖励”通常很罕见;机器人可能要尝试数千次,才会偶然地将插头插进去,这使得学习过程效率极低。为了加速这一过程,研究人员此前曾转向人类教师,向机器人展示如何完成任务,或者在它卡住时进行物理引导。但这种方法有一个重大缺陷:它要求人类在每一次训练过程中都必须全程在场并保持警惕,这既令人疲惫、昂贵,又无法规模化。

一组研究人员开发了一种名为 AutoSERL 的新系统,该系统通过仅使用一次演示来教导机器人,而不需要人类在之后进行监督。该系统的工作原理是提取一段记录的人类成功完成任务的示例,并将该记录转化为一套自动规则,用以引导机器人的学习。研究人员在六种不同的困难任务上测试了该系统,例如插入插头、将物体挂在钩子上以及拉开抽屉。在所有案例中,机器人仅通过那一个初始示例就学会了完美地执行任务,最终表现优于那些经过二十个示例训练的系统,也优于那些依赖持续人类监督的系统。其核心创新在于,机器人学会了识别自己何时偏离轨道或陷入困境,并能通过参考那次单一演示来进行自我纠正,从而有效地取代了对人类教师的需求。

研究人员解决的核心挑战是如何在无需人类时刻观察的情况下,保持机器人的安全并使其保持在正确路径上。在以往的方法中,每当机器人出错时,人类就会介入,将其物理移动回安全位置或引导其走向目标。这种“人机协同(human-in-the-loop)”的方法效果良好,但并不适用于长期训练。新系统 AutoSERL 将这种干预过程自动化了。它从一个演示轨迹开始,这仅仅是一个记录了机器人手部从任务开始移动到结束的轨迹。通过这一个记录,系统提取了三种特定的机制来引导机器人的学习。

第一个机制是一个类似于移动导轨的滑动窗口。在机器人尝试任务的过程中,系统会不断将机器人的当前位置与单次演示中显示的路径进行比较。如果机器人偏离正确路径太远,系统会轻轻地将其推回演示线上的最近点。至关重要的是,这个引导只将机器人向前拉向路径,绝不会将其向后拉回到已经访问过的地点。这防止了机器人在尝试自主学习困难任务时常见的失败模式——在同一个地方循环往复或来回震荡。由于原始演示是在安全状态下记录的,遵循其路径也能确保机器人避免撞击环境中的障碍物。

第二个机制处理机器人发生物理卡顿的情况,例如零件卡住或机器人持握物体角度不当。系统会监测机器人的进度,并能检测出机器人是否停止移动或在与物体交互时遇到困难。一旦发生这种情况,系统会自动引导机器人回到原始演示中定义的特定安全恢复点。从那里开始,系统会重放演示中展示如何从该安全点成功移动到下一阶段任务的部分。这使得机器人能够立即从僵局中恢复,而无需等待人类注意到问题并进行干预。

第三个机制是关于何时停止帮助的规则。训练的目标是让机器人最终能够独立完成任务,因此系统被设计为一旦机器人学得足够好,就关闭自动引导。系统会统计在一次训练期间需要干预多少次。如果机器人在完成任务时干预次数非常少,系统则认为机器人已经掌握了这项技能,并禁用所有进一步的引导。这使得机器人可以在不受演示约束的情况下探索并优化自己的动作,确保其发展出鲁棒且独立的策略。

研究人员在两个不同的机械臂上测试了该框架,执行了六项不同的任务。选择这些任务是因为它们需要精确的物理接触,且容错空间极小。这些任务包括将插头插入插座、插入 USB 驱动器、将修正带、衣架和勺子分别挂在钩子上,以及用钩子拉开抽屉。在插入任务中,使用 AutoSERL 进行训练且仅使用一次演示的机器人达到了 100% 的成功率。与其他方法相比,结果非常明确:使用二十次演示进行训练的系统在相同时间内无法达到同样的成功水平;仅仅模仿人类动作而不进行学习的系统无法适应位置的小幅变化;甚至是一个依赖人类在机器人卡住时进行干预的系统,其学习任务所需的时间也比自动化系统长,或者需要相等的时间才能达到相当的结果。

研究还观察了机器人处理环境变化的能力。在一次测试中,研究人员将机器人需要插进去的物体起始位置移动了几厘米。即使存在这种变化,使用 AutoSERL 训练的机器人也比没有自动引导的机器人学得更快且更成功。这表明该系统不仅仅是死记硬背人类采取的确切路径,它学习的是任务的底层逻辑,并能够适应新的起始点。研究人员还发现,该系统在不同的随机起始条件下具有鲁棒性,无论如何初始化训练,都能始终保持高成功率。

尽管结果令人印象深刻,但研究人员也承认该系统存在局限性。恢复机制依赖于那次单一演示中所包含的信息。如果机器人遇到了原始记录中从未展示过的失败模式,系统可能不知道如何恢复。例如,如果机器人的卡顿方式与原始任务完全不同,自动引导可能无法提供解决方案。研究人员建议,未来的工作可以涉及使用多次演示来创建一个更强大的恢复系统,以应对更多样化的错误。此外,目前的系统是为机器手在六个自由度内移动的任务设计的,目前尚不清楚它在处理涉及许多运动部件的更复杂动作时表现如何。

尽管存在这些局限性,这些发现仍代表了使机器人学习变得实用的重要一步。通过用智能自动化系统取代人类教师,并利用单次示例进行学习,研究人员证明了可以高效且安全地教导机器人完成困难的物理任务。该系统成功地在人类引导的安全性和机器人自主学习所需的独立性之间架起了桥梁。在测试的六项任务中,这种自动化方法不仅达到了人类监督训练的性能,而且往往超过了其他自动化基准,证明了单次结构良好的演示足以开启现实世界机器人学习的潜力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →