Safe Execution of RL Policies Via Acceleration-Based CBF-QP Constraint Enforcement for Real-World Robotic Deployments
本文介绍了 Acc-CBF-QP,这是一种基于加速度的二次规划安全过滤器,它能够在不修改训练的情况下,在 Unitree H1 和 Kinova Gen3 等真实机器人部署中,对强化学习策略实施关节位置、速度、转矩及碰撞约束,从而在显著减少安全违规的同时保持任务性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:机器人不再是通过死板的规则进行编程,而是通过像蹒跚学步的幼儿那样通过试错游戏来学习如何运动。这就是**强化学习(Reinforcement Learning, RL)**的领域。在这个数字游乐场中,机器人尝试数百万次动作,通过成功获得“积分”,通过失败受到“罚款”,最终学会如何以惊人的灵活性奔跑、跳跃或抓取物体。然而,这里有一个陷阱:虽然这些 AI 大脑非常擅长学习新技巧,但它们完全不知道自己的极限在哪里。如果你要求一个正在学习的机器人跑得太快或伸手够得太远,它可能会试图扭断自己的手臂或撞上墙壁,因为它还没有学会畏惧后果。
为了让这些机器人保持安全,工程师经常使用控制障碍函数(Control Barrier Functions, CBFs)。把它们想象成隐形的、不可打破的力场,或者是一个不断检查机器人是否即将做出危险行为的“守护天使”算法。如果机器人试图越界,守护者就会介入,温柔地(或不那么温柔地)将其推回安全区域。长久以来的大挑战在于,如何在保留学习机器人狂野创造力的同时,兼顾安全守护者的严格规则,且不降低机器人的速度或损坏其大脑。
这篇论文介绍了一种被称为 Acc-CBF-QP 的聪明解决方案,它是一个作为机器人学习实时裁判的安全过滤器。研究人员构建了一个位于机器人的“大脑”(RL 策略)与“肌肉”(电机)之间的系统。当机器人的大脑发送一个看起来可能违反规则的指令——例如关节转动过快或撞墙时——该安全过滤器会立即重新计算指令。它并不会停止机器人;相反,它会寻找一个最接近机器人原意、且依然安全的运动方案。
团队在两种截然不同的机器人上测试了该方法:一个拥有 7 个机械臂的机械臂(Kinova Gen3)和一个拥有 19 个关节的人形机器人(Unitree H1)。他们发现,如果没有这个过滤器,机器人会不断违反安全规则。在真实的人形机器人上,未经过滤的 AI 每秒钟会发生大约 10 次安全违规。但当他们加入了 Acc-CBF-QP 过滤器后,这些违规行为减少了 92%,降至每秒不到一次。在机械臂上,该过滤器非常有效,甚至完全消除了所有违规行为。
至关重要的是,研究人员发现这个安全网并没有让机器人变得笨拙。当机器人在没有触及危险区域时进行正常任务时,过滤器会让它们完全按照 AI 的意图运动,没有任何性能损失。即使当机器人被极端的快速指令推向极限时,过滤器也能防止它们崩溃或停机,使其比在没有保护的情况下生存时间更长。论文表明,由于一个特殊的“扰动观测器”可以猜测外部力量是如何推动机器人的,该方法即使在机器人的自身身体模型并不完美的情况下依然有效。
作者还比较了过滤器解释机器人指令的两种不同方式:一种侧重于匹配机器人想要使用的精确力量(转矩),另一种则侧重于匹配精确的运动速度(加速度)。他们发现,“力量匹配”版本在机器人物理模型有偏差时更加稳健,而“速度匹配”版本在模型完美时表现略好。然而,在模型永远不完美的现实世界中,“力量匹配”方法被证明是更可靠的选择。
简而言之,这篇论文并不声称已经解决了所有的机器人安全问题,也不认为从一开始就训练机器人具备安全性是一个坏主意。相反,它提供了一个实用的、即插即用的工具,可以包裹在任何现有的机器人 AI 之外,使得在无需从头开始重新训练 AI 的情况下,就能将机器人安全地部署到真实的硬件上。它架起了学习机器人的狂野、灵活的世界与严苛、无情的物理现实之间的桥梁,证明了你可以在实现高性能的同时,也拥有严格的安全保障。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。