← 最新论文
🤖 machine learning

Learned Lyapunov Shielding for Adaptive Control

本文提出了一种学习型李雅普诺夫屏蔽框架,该框架通过引入结构化二次型李雅普诺夫函数、残差软演员 - 评论家策略以及物理信息神经网络来增强 Slotine–Li 自适应控制器,从而确保欧拉 - 拉格朗日系统在存在未建模动态的情况下实现闭式安全滤波与指数稳定性,同时显著提升跟踪性能。

原作者: Giansalvo Cirrincione, Adriano Fagiolini

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Giansalvo Cirrincione, Adriano Fagiolini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机械臂将一个沉重的箱子从A点移动到B点。你有两种方法可以做到这一点:

  1. “教科书”式方法:你给机器人一本完美的物理教科书(即Slotine–Li控制器)。它确切地知道箱子有多重,以及机械臂如何运动。它工作得很好,但如果箱子比预期稍重,或者关节变得粘滞,机器人就会感到困惑,动作变得笨拙。
  2. “赌徒”式方法:你让机器人通过试错来学习(标准的强化学习)。它最终可能会学会完美地移动箱子,但也可能因为尚未掌握物理规则而撞墙或掉落箱子。

本文提出了一种第三种方法:一位“智能教练”,它结合了两者之优。它采用可靠的“教科书”机器人,并添加一个“学习助手”来修正错误,同时在系统周围设置一张安全网,确保机器人永远不会做出危险举动。

以下是本文“智能教练”的工作原理,分解为简单部分:

1. 安全网(“Lyapunov证书”)

在机器人领域,Lyapunov函数就像一把“稳定性温度计”。它测量机器人有多“不稳定”。如果温度升高,机器人就陷入困境。

  • 问题:通常,证明机器人是安全的需要复杂的数学推导,难以在实时中完成。
  • 本文的妙招:他们创建了一种特殊的、结构化的“温度计”(即学习型Lyapunov证书),其设计本身就能保证它始终为正值(即始终测量真实量)。
  • 结果:由于这种特殊设计,计算机可以即时计算出一个“安全过滤器”。这就像一位站在机器人面前的交通警察。如果机器人试图做出一个会导致“温度计”飙升(即危险)的动作,交通警察会立即阻止该动作,并将机器人推回安全路径。本文证明,这位交通警察总是有可行的动作可做;它永远不会卡住并说“我无法阻止你!”

2. 学习助手(“残差策略”)

教科书机器人(Slotine–Li)表现良好,但它不了解粘滞关节或异常摩擦。

  • 解决方案:他们添加了一个Soft Actor–Critic(SAC)策略。这就像一个学生,观察教科书机器人并说:“嘿,教科书说向左移动,但我感觉到关节很粘,所以让我们向右多加一点推力。”
  • 限制:这个学生被允许提出建议,但只有在安全网(交通警察)说可以时才行。这使得机器人能够从经验中学习,同时永远不会违反安全规则。

3. 物理侦探(“PINN”)

有时机器人不知道它为什么会打滑。

  • 解决方案:他们添加了一个物理信息神经网络(PINN)。这就像一名侦探,观察机器人的运动,试图找出教科书未考虑的“隐藏力”(如未建模的摩擦或沉重负载)。
  • 如何帮助:侦探将这些信息反馈给安全网。安全网随即意识到:“啊,机器人打滑是因为摩擦,而不是因为失控”,并相应地调整安全规则。

他们发现了什么?(结果)

团队在一个两关节(2-DOF)机械臂上测试了该系统,随后在一个更复杂的七关节机械臂(类似人类手臂的Franka Panda)上进行了测试。

  • “甜蜜点”增益:当机器人携带训练期间见过的重量(即“质心”)时,新系统在跟踪目标路径方面比旧教科书方法提高了41%。“学习助手”与“安全网”协同工作,使运动更加平滑。
  • “专业化”问题:该系统在练习过的重量上表现惊人,但如果给它一个从未见过的重量(太轻或太重),其表现有时甚至不如旧教科书方法。这就像一个为特定考试刻苦学习的学生,当问题稍有变化时却难以应对。
  • “热启动”陷阱:他们发现了一个奇怪的漏洞。如果你对一个已训练的机器人进行微调以适应新任务,而不从头开始,它可能会陷入不良习惯。这就像一个学生将去年考试的答案背得滚瓜烂熟,以至于无法学习新材料。本文指出,在更换任务时,必须从头开始(从零重新训练),以避免此问题。
  • 可扩展性:他们证明,该系统不仅在小型双关节机器人上有效,在大型复杂七关节机器人上同样有效。

核心结论

本文提出了一种使机器人同时更安全、更智能的方法。

  • 它使用数学上保证的安全过滤器(交通警察),确保机器人永远不会撞毁。
  • 它利用学习来修正传统物理模型的错误。
  • 它证明这种组合是稳定的,并在现实世界中有效,前提是你不要在不重新训练的情况下,试图对已训练的机器人进行“微调”以应对全新任务。

简而言之:这是一个从经验中学习,但受到数学上完美的安全卫士严格监督的机器人控制器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →