想象一下,你正在教一个机械臂将一个沉重的箱子从A点移动到B点。你有两种方法可以做到这一点:
- “教科书”式方法:你给机器人一本完美的物理教科书(即Slotine–Li控制器)。它确切地知道箱子有多重,以及机械臂如何运动。它工作得很好,但如果箱子比预期稍重,或者关节变得粘滞,机器人就会感到困惑,动作变得笨拙。
- “赌徒”式方法:你让机器人通过试错来学习(标准的强化学习)。它最终可能会学会完美地移动箱子,但也可能因为尚未掌握物理规则而撞墙或掉落箱子。
本文提出了一种第三种方法:一位“智能教练”,它结合了两者之优。它采用可靠的“教科书”机器人,并添加一个“学习助手”来修正错误,同时在系统周围设置一张安全网,确保机器人永远不会做出危险举动。
以下是本文“智能教练”的工作原理,分解为简单部分:
1. 安全网(“Lyapunov证书”)
在机器人领域,Lyapunov函数就像一把“稳定性温度计”。它测量机器人有多“不稳定”。如果温度升高,机器人就陷入困境。
- 问题:通常,证明机器人是安全的需要复杂的数学推导,难以在实时中完成。
- 本文的妙招:他们创建了一种特殊的、结构化的“温度计”(即学习型Lyapunov证书),其设计本身就能保证它始终为正值(即始终测量真实量)。
- 结果:由于这种特殊设计,计算机可以即时计算出一个“安全过滤器”。这就像一位站在机器人面前的交通警察。如果机器人试图做出一个会导致“温度计”飙升(即危险)的动作,交通警察会立即阻止该动作,并将机器人推回安全路径。本文证明,这位交通警察总是有可行的动作可做;它永远不会卡住并说“我无法阻止你!”
2. 学习助手(“残差策略”)
教科书机器人(Slotine–Li)表现良好,但它不了解粘滞关节或异常摩擦。
- 解决方案:他们添加了一个Soft Actor–Critic(SAC)策略。这就像一个学生,观察教科书机器人并说:“嘿,教科书说向左移动,但我感觉到关节很粘,所以让我们向右多加一点推力。”
- 限制:这个学生被允许提出建议,但只有在安全网(交通警察)说可以时才行。这使得机器人能够从经验中学习,同时永远不会违反安全规则。
3. 物理侦探(“PINN”)
有时机器人不知道它为什么会打滑。
- 解决方案:他们添加了一个物理信息神经网络(PINN)。这就像一名侦探,观察机器人的运动,试图找出教科书未考虑的“隐藏力”(如未建模的摩擦或沉重负载)。
- 如何帮助:侦探将这些信息反馈给安全网。安全网随即意识到:“啊,机器人打滑是因为摩擦,而不是因为失控”,并相应地调整安全规则。
他们发现了什么?(结果)
团队在一个两关节(2-DOF)机械臂上测试了该系统,随后在一个更复杂的七关节机械臂(类似人类手臂的Franka Panda)上进行了测试。
- “甜蜜点”增益:当机器人携带训练期间见过的重量(即“质心”)时,新系统在跟踪目标路径方面比旧教科书方法提高了41%。“学习助手”与“安全网”协同工作,使运动更加平滑。
- “专业化”问题:该系统在练习过的重量上表现惊人,但如果给它一个从未见过的重量(太轻或太重),其表现有时甚至不如旧教科书方法。这就像一个为特定考试刻苦学习的学生,当问题稍有变化时却难以应对。
- “热启动”陷阱:他们发现了一个奇怪的漏洞。如果你对一个已训练的机器人进行微调以适应新任务,而不从头开始,它可能会陷入不良习惯。这就像一个学生将去年考试的答案背得滚瓜烂熟,以至于无法学习新材料。本文指出,在更换任务时,必须从头开始(从零重新训练),以避免此问题。
- 可扩展性:他们证明,该系统不仅在小型双关节机器人上有效,在大型复杂七关节机器人上同样有效。
核心结论
本文提出了一种使机器人同时更安全、更智能的方法。
- 它使用数学上保证的安全过滤器(交通警察),确保机器人永远不会撞毁。
- 它利用学习来修正传统物理模型的错误。
- 它证明这种组合是稳定的,并在现实世界中有效,前提是你不要在不重新训练的情况下,试图对已训练的机器人进行“微调”以应对全新任务。
简而言之:这是一个从经验中学习,但受到数学上完美的安全卫士严格监督的机器人控制器。
技术摘要:用于欧拉 - 拉格朗日系统安全残差强化学习的习得李雅普诺夫证书
问题陈述
欧拉 - 拉格朗日系统的自适应控制器(如经典的 Slotine–Li 控制器)依赖于刚体动力学的线性参数化特性,以及对质量、科里奥利力和重力项的先验知识。然而,实际机器人系统常表现出未建模的非线性(例如摩擦滞后、关节弹性、软体效应),这些难以进行清晰的参数化。虽然强化学习(RL)提供了一条学习这些残差的途径,但标准 RL 缺乏形式化的稳定性保证,且在应用于安全关键控制任务时往往无法收敛。现有的习得李雅普诺夫函数方法通常依赖通用神经网络架构(例如带有 tanh 激活函数的多层感知机),需要事后验证或复杂的优化来确保正定性,这往往导致部署期间安全过滤器不可行。
方法论
作者提出了一种框架,将三个习得组件增强到 Slotine–Li 自适应控制器中,并集成到受约束的软演员 - 评论家(SAC)策略中:
- 结构化二次李雅普诺夫函数(Vψ): 不同于通用神经网络,李雅普诺夫候选函数被参数化为 Vψ(x)=x⊤Pψ(x)x,其中 Pψ(x)=Lψ(x)Lψ(x)⊤+ϵI。此处 Lψ 是一个下三角多层感知机。这种乔列斯基参数化从构造上保证了正定性。
- 残差 SAC 策略: 软演员 - 评论家智能体学习一个有界的残差扭矩 Δτ 以校正解析的 Slotine–Li 基线。该策略的训练旨在最大化奖励(跟踪性能),同时受限于李雅普诺夫递减违反的约束。
- 物理信息神经网络(PINN): 网络 fθ 估计未建模动力学(残差),并通过强制欧拉 - 拉格朗日方程结构的物理损失进行训练。该模型用于估计安全过滤器的漂移场。
安全过滤器与稳定性机制
核心创新在于一个闭式安全过滤器,它源自单仿射约束 V˙ψ+αVψ≤0。由于系统动力学在控制上是仿射的(x˙=h(x)+g(x)τ)且 Vψ 是二次的,该约束在 τ 上变为线性的(b(x)⊤τ≤c(x))。
- 闭式投影: 该过滤器通过简单的欧几里得投影,将任何原始策略输出 τraw 投影到安全半空间,从而避免了对在线二次规划(QP)求解器的需求。
- 可行性条件: 论文证明,如果在控制能力消失(b(x)=0)的集合 Z 上满足“漂移衰减条件”,则该过滤器是全局可行的。具体而言,在该集合上,自然漂移动力学必须已经是李雅普诺夫递减的。
- 鲁棒性: 过滤器的鲁棒版本结合了 PINN 近似误差(δ)和 Vψ 的梯度界(LV),以确保即使在学习的动力学模型不完美时也能保持稳定性。
主要贡献
本文确立了五项理论和实证贡献:
- 闭式可行性: 结构化二次参数化产生了一个具有闭式解的单约束二次规划。作者证明了在可验证的漂移衰减条件下(定理 4)的全局可行性。
- 稳定性保证: 在精确屏蔽下证明了指数稳定性。提供了一个鲁棒扩展,其稳定裕度显式依赖于 PINN 近似误差(定理 13)。
- 收敛性: 使用三时间尺度随机逼近方案,证明了策略、李雅普诺夫证书和拉格朗日乘子的联合更新几乎必然收敛到 KKT 点(定理 10)。
- 泛化性: 推导了一个 PAC(可能近似正确)泛化界,基于有限样本在紧集上认证习得的李雅普诺夫函数(命题 14)。
- 实证验证: 在 2 自由度机械臂和 7 自由度 Franka Emika Panda 机器人上的广泛实验证明了该框架的有效性和可扩展性。
实验结果
- 2 自由度机械臂: 在具有非线性摩擦和可变负载的系统中,习得的李雅普诺夫证书被确定为性能提升的主要来源。与解析的 Slotine–Li 基线相比,所提出的方法在标称摩擦下将跟踪误差降低了41%,在训练分布质心处的激进摩擦下降低了24%。消融研究证实,习得的证书(Vψ)提供的增益显著高于单独的 PINN 或 SAC 策略。
- 7 自由度可扩展性: 对 7 自由度 Franka Panda(35 维状态空间)的研究证实,完整流水线(基于 Transformer 的 PINN、结构化 Vψ、闭式屏蔽)在工业规模上能够干净地收敛。与具有真实动力学访问权限的精确计算扭矩基线相比,该框架实现了在基线**1.7%**以内的跟踪,确认当基线已经最优时,它充当的是认证安全过滤器而非性能助推器。
- 失效模式: 研究识别出一种“热启动病理”,即针对特定奖励结构训练的证书对新奖励目标具有对抗性,因此需要重新初始化。此外,还注意到在 ∇Vψ≈0 的状态附近存在数值不稳定性,需要门控机制以防止扭矩放大。
意义与主张
论文主张,结构化二次参数化是使整个框架成为可能的核心设计选择。通过从构造上确保正定性,它允许使用计算高效、闭式的安全过滤器,从而无需在线优化即可保证可行性。这项工作表明,习得组件可以集成到经典自适应控制中以处理未建模动力学,同时保留严格的稳定性保证。作者强调,该框架的价值在于策略、证书和动力学残差在形式化安全约束下的联合学习,而非任何单一组件的孤立作用。结果表明,只要解析基线并非完美且训练分布覆盖操作范围,此类框架在实际应用中可跨越机械臂规模使用。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。