Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks
本文通过提出一个集成具有钝感意识训练、基于能量的约束以及用于部署的钝感滤波器的框架,旨在解决传统强化学习在富接触机器人任务中的安全性和稳定性限制,从而保证控制稳定性并提高能量效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一只机械臂正伸出触碰墙壁,不是为了推开它,而是为了在黑暗、蜿蜒的迷宫中摸索前进。这就是“富接触机器人技术”(contact-rich robotics)的世界——在这种环境下,机器必须通过与周围环境发生物理交互来解决问题。多年来,科学家们一直使用一种被称为“强化学习”的强大工具来教会机器人如何做到这一点。你可以将其想象为一个数字化的试错过程:机器人尝试一次动作,如果成功则获得奖励,并从错误中学习。虽然这种方法在计算机模拟中取得了令人瞩目的成果,但在将这些机器人投入现实世界时,仍面临着一个重大障碍。这些算法非常擅长寻找通往目标的路径,但它们往往忽略了一个基本的物理规则:能量。如果机器人学会了一种需要向其关节或环境注入过多能量的策略,它可能会变得不稳定、剧烈震动,甚至损坏自身或它所接触的物体。确保机器人的运动既安全又稳定,不仅是一个理论上的考量,更是任何未来要与人类协同工作的机器必须具备的实际需求。
意大利热那亚的技术研究院(Istituto Italiano di Tecnologia)的研究人员致力于解决这一特定问题。他们提出了一个简单但至关重要的问题:我们能否教会机器人不仅要擅长完成任务,还要在能量使用方面天生具有安全性?他们的工作聚焦于一个被称为“钝性”(passivity)的概念。简单来说,钝性意味着一个系统不能凭空创造能量;它只能存储接收到的能量或将其耗散掉。一个具有钝性的机器人就像一个阻尼良好的弹簧,它吸收冲击而非放大冲击。研究团队发现,标准的强化学习策略(旨在最大化任务成功率)往往无法遵守这一规则。在实验中,这些标准策略学会了快速完成任务,但它们生成的控制指令违反了能量限制,导致在部署到现实世界时出现不稳定现象。
为了解决这个问题,研究人员开发了一种新方法,将人工智能的学习能力与严格的能量规则相结合。他们创建了一个由两个截然不同的部分协同工作的系统。第一部分发生在训练阶段。在这里,他们教会机器人具备“钝性感知”能力。他们不再仅仅奖励机器人到达迷宫出口,而是加入了隐形的约束条件,惩罚那些使用过多能量或改变刚度过快的行为。这迫使机器人学会一种更经济的运动方式,从而发现更温和、更稳定的运动策略。第二部分发生在机器人实际工作时。即便有了更好的训练,研究人员也知道计算机程序仍可能出错。因此,他们添加了一个安全过滤器——一个位于机器人的“大脑”与“肌肉”之间的最后一道保护层。这个过滤器会不断监测能量流。如果机器人试图做出一个会向系统注入过多能量的动作,过滤器会自动将其规模缩小,确保机器人保持在安全限度内。
团队在一个极具挑战性的场景中测试了这种方法:一个机械臂必须通过盲摸墙壁来寻找出口的迷宫探索任务。他们对比了四种不同类型的机器人:一种完全忽略能量规则,一种经过能量感知训练但没有安全过滤器,一种拥有安全过滤器但未经过能量规则训练,以及最后一种——即他们结合了能量感知训练与安全过滤器的全新方法。结果显而易见。不考虑能量规则的机器人在模拟中可以完成迷宫,但当他们尝试在真实的物理机器人上运行时,它失败了。它的动作过于激进,在转弯处施加了过大的力量,导致失去控制。相比之下,经过能量约束训练的机器人学会了更加保守地运动。它们在训练阶段的学习过程稍长,但一旦部署,表现得更加可靠。
当研究人员将表现最好的模型投入现实世界测试时,差异非常显著。使用他们组合方法的机器人每次试验都能成功完成迷宫,从未违反力量限制或耗尽能量预算。即使有安全过滤器保护,标准机器人依然表现挣扎,因为它从一开始就没学会如何高效管理能量。仅靠安全过滤器只能阻止灾难,但不能让机器人变得高效;仅靠能量感知训练能让机器人变得高效,但如果机器人做出突然且不可预测的错误,它无法保证绝对安全。只有将两者结合,才能实现一个既安全又高效的系统。研究人员发现,使用严格能量限制训练的机器人,其能量消耗更加缓慢且均匀,使其能够处理复杂的转弯和障碍物,而不会精疲力竭。
这项工作凸显了构建智能机器方式的一个关键转变。它表明,为了让机器人在物理世界中安全工作,它们不能仅仅被教导要“聪明”,还必须被教导要具备“物理责任感”。通过将能量守恒定律直接嵌入学习过程,并辅以实时安全过滤器,研究人员展示了一条通往不仅功能强大而且值得信赖的机器人之路。他们在七轴机械臂上进行的实验证明,通过引导机器人通过经验学习其自身的能量极限,并遵循使其立足于物理现实的规则,可以让机器人在处理复杂的、充满接触的任务时,既不冒着自身稳定性或周围环境安全的风险,又能顺利完成任务。该方法并不依赖于可能出错的复杂世界数学模型,而是依靠机器人通过经验学习能量限制,并在规则的引导下回归物理现实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。