← 最新论文
🤖 AI

ORPA: Online Residual Policy Adaptation for Robot Manipulation Control with Human Feedback

本文介绍了 ORPA,这是一个通过添加一个轻量级的、以反馈为条件的模块来增强预训练机器人操控策略的框架,该模块能够预测实时的关节空间残差调整,从而在无需进行全策略重训练的情况下,实现即时的误差修正和对分布偏移的适应。

原作者: Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

能够拿起杯子、开门或对一堆物体进行分类的机器人,长期以来一直是工程师们的梦想。多年来,教机器掌握这些技能最有效的方法一直是模仿学习。在这种方法中,人类演示一项任务(例如通过用自己的手移动机器人的手臂),计算机程序则密切观察以学习其中的模式。随后,机器人会尝试独立模仿该模式。最近,强大的新计算机模型使这些机器人能够胜任复杂的任务,使它们能够以令人印象深刻的流畅度将长序列的动作串联起来。然而,这些数字学习者有一个显著的弱点:它们非常脆弱。如果物体移动了仅几英寸,超出了机器人的预期位置,或者机器人在执行任务时手臂轻微滑动,整个计划就会崩溃。由于机器人记忆的是特定的路径,它通常不知道如何恢复。修复这通常需要收集数千个新示例并重新训练整个系统,这个过程缓慢、昂贵,且无法在机器人实际工作时进行。

日本先进工业技术研究开发机构的一个研究小组提出了一种处理这些错误的不同方法。他们开发了一个名为“在线残差策略自适应”(Online Residual Policy Adaptation,简称 ORPA)的系统,该系统允许机器人根据简单的反馈实时纠正自己的动作,而无需重新学习整个任务。ORPA 并不是教机器人一种全新的移动方式,而是像一个微妙的向导,当情况出现轻微偏差时,它会微调机器人现有的计划。研究人员在名为 ALOHA 的双臂机器人平台上测试了该系统,该平台旨在模拟人类的双向操作。他们发现,当机器人遇到小错误(例如物体位置略有偏移)时,该系统可以立即调整其动作以取得成功,而标准的机器人则会失败。

这项工作的核心思想是将机器人的通用知识与其即时修正区分开来。机器人从一个预训练的“大脑”开始,这个大脑知道如何在理想条件下执行任务,且该大脑保持不变。当机器人开始移动时,一个独立的轻量级模块会监测情况。如果人类操作员发出信号表明情况有误——例如说物体“太靠左”或“太高”——该模块就会计算出一个微小的调整量。它并不会告诉机器人重新开始,而是为机器人当前的运动增加一个微小的修正。这种修正学习自那些研究人员特意引入微小误差并教授系统如何修复这些误差的数据。结果是,机器人既保持了原有的流畅行为,又获得了即时适应的能力,就像人类在感觉到杯子打滑时可以调整握力,而不需要重新学习如何拿杯子一样。

为了证明这一概念,研究人员在计算机模拟和现实世界中都进行了广泛测试。他们设置了需要高精度的挑战性任务,例如将方块从一只手转移到另一只手、将销钉插入紧密的孔洞中、打开瓶盖以及对各种物体进行分类。在模拟中,他们故意将目标物体移动到远离预期位置的地方,以模拟现实世界的混乱情况。依赖于原始训练的标准机器人,在这些困难试验中的成功率仅为 60%。当研究人员加入新的修正系统后,简单转移任务的成功率跃升至 90% 以上,而在更复杂的插入任务中也达到了 80% 以上。该系统还优于那些使用固定几何规则来修复错误的老方法。那些旧方法假设“太左”的信号总是意味着相同的移动量,无论上下文环境如何。而新系统则学习到,修正的大小取决于任务的具体时刻和机器人手臂的位置。

研究人员还将他们的方法与其他近期使用大语言模型来解释人类反馈的方法进行了比较。虽然那些系统展现出了潜力,但它们速度较慢,且需要在语言与物理运动之间进行复杂的转换。而新系统直接作用于机器人的关节运动,因此更加快速且高效。在物理机器人的现实测试中,改进是明显且细微的。对于移动零食盒或分类物品等任务,机器人本身已经做得相当不错,成功率约为 80%。有了新系统后,这个数字略有上升,但更重要的是,机器人变得更擅长从特定失败中恢复。例如,在需要精确接触和时机的困难任务——打开瓶盖中,该系统帮助机器人稳定了动作并更可靠地完成了任务。研究人员观察到,该系统并不需要每次都介入;它只在错误大到足以导致失败时才会介入,从而保留了机器人原始动作的自然流向。

这项工作为使机器人在非结构化环境中更加稳健提供了一条切实可行的路径。通过避免在每次出现新错误时都重新训练整个系统,研究人员创造了一种计算量轻且可用于实时使用的方案。该系统并非取代机器人已习得的技能,而是为其增加了一个灵活的修正层。在实验中,机器人通过根据收到的反馈调整其动作,学会了处理包括时间偏差和接触不完美在内的多种失效模式。研究结果表明,这种方法可以使机器人更可靠地处理复杂任务,即使在条件永远无法完全预测的环境中,也能在无需持续监督或重新编程的情况下,更有效地与人类协同工作。在模拟和物理硬件上的成功证明,微小的、习得性的调整可以显著提升复杂机器人任务的可靠性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →