← 最新论文
📊 statistics

Learning to control switching nonlinear systems with Koopman operator regression

本文提出了一种针对具有有限动作空间的非线性系统的控制框架,该框架利用再生核希尔伯特空间中的 Koopman 算子回归来学习线性切换预测模型,并将其应用于具有学习率和次优性理论保证的模型预测控制中。

原作者: Edoardo Caldarelli, Oleksii Kachaiev, Cesare Molinari, Lorenzo Rosasco

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Edoardo Caldarelli, Oleksii Kachaiev, Cesare Molinari, Lorenzo Rosasco

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人用手指平衡一根摇晃且难以捉摸的木棒。这根木棒不仅仅是会倒下,它还会根据机器人的推力产生扭转、旋转和各种怪异的非线性反应。这就是科学家所说的“非线性系统”,由于其数学处理起来极其复杂,控制起来非常困难。

这篇论文介绍了一个巧妙的技巧来驯服这种混沌。作者建议不要直接尝试解决那些混乱、扭曲的数学问题,而是将问题“提升”(lifting)到一个不同的世界——一个高维空间,在那里规则突然变得简单且笔直。这就像是将一团乱麻神奇地拉伸开,直到它变成一条完美的直线。在这个新世界里,那根混沌的木棒表现得就像一个可预测的、直线移动的物体。

神奇的阶梯:Koopman 算子
他们用来进行这种“拉伸”的工具被称为 Kopperan 算子。在现实世界中,木棒的运动是一条复杂的曲线。但在这种“提升”后的世界里,运动只是一个简单的开关。如果机器人向左推,木棒就向一个方向移动;如果向右推,则向另一个方向移动。这就像一列火车只能在几条既定的轨道上选择运行。作者证明,即使原始系统是一个狂野的非线性怪兽,只要机器人拥有一组有限的选择动作,我们就能找到描述其行为的一系列“铁轨”(线性算子)。

从少量快照中学习
问题在于:机器人还不知道这些轨道在哪里。它必须通过学习来掌握它们。作者通过向机器人展示大量关于木棒运动的“快照”来对其进行教学。他们使用了一种称为 Koopman 算子回归(一种通过数据学习模式的高级说法)的方法,来确定这些轨道的具体形态。

他们从数学上证明,如果你给机器人足够的快照,它就能以极高的精度学习这些轨道。你喂给机器人的数据越多,学到的轨道就越接近真实的轨道。他们不仅仅是在猜测,而是推导出了特定的速率,显示出误差是如何随着数据点数量的增加而缩小的。例如,在最快的情况下,预测下一步的误差以特定速率(随 n1/6n^{-1/6} 缩放)下降,这意味着模型变得越来越精准。

“向前看”策略:模型预测控制 (MPC)
一旦机器人知道了轨道,它仍然需要决定在每一时刻该走哪条路。这篇论文使用了一种名为 模型预测控制 (MPC) 的策略。想象一下,机器人就像一名棋手,它不仅看眼下的棋步,还在脑海中模拟接下来的 10 或 15 步,以观察哪条路径能带来最好的结果。

作者证明,即使机器人的“预见距离”(预测时界)很短,它依然能做得很好。他们证明,如果机器人看得足够远(具体来说,如果时界 TT 相对于由系统代价函数导出的常数 CC 足够大),该策略的表现将几乎等同于完美的无限时界计划。随着机器人向前看的步数增加,“次优性”(即与完美计划相比的差距)会呈指数级下降。

关于错误的处理
由于机器人是从数据中学习这些轨道的,它可能会犯一些小错误。论文正面应对了这个问题。他们表明,即使使用这些学到的、略有偏差的轨道,机器人的性能也不会崩溃。相反,最终的代价(即平衡木棒的效果)会保持在一个可预测的范围内。学习误差越大,最终结果就稍差一些,但这种关系是平滑且受控的。他们不仅说这种情况会发生,还写下了展示学习误差如何转化为控制误差的具体公式。

实测演练:达芬公式(Duffing 振荡器)
为了证明这不仅仅是理论,作者在一个著名的摇摆系统——Duffing 振荡器上测试了它。他们模拟了机器人控制该系统的过程,并使用了两组不同的动作:一组是对称集合(以相等的力向左或向右推),另一组是非对称集合(增加了更强的“推力”选项)。

在模拟中,他们发现:

  • 数据越多越好: 当他们将训练快照的数量从少量增加到 10610^6 时,机器人的性能显著提升。
  • 看得越远越好: 当他们将“向前看”的时界 TT 从 1 步增加到 15 步时,机器人对系统的稳定效果也更好。在短时界(T=1T=1)下,系统会在多个吸引子之间徘徊(无法决定停留在哪里);而在长时界(T=15T=15)下,它能平滑地稳定在中心位置。
  • 代价函数很重要: 他们使用了一个包含折扣因子 λ=0.9999\lambda = 0.9999 的特定代价函数,以确保机器人关注长期未来,而不会陷入无限循环。

他们并未声称的内容
需要注意的是,这篇论文并没有声称该方法适用于任何具有无限控制选项的系统;他们明确要求必须是一个有限的动作集(例如具有几个位置的开关)。他们也并未声称在控制集有限的情况下,系统在极限状态下会变得完美稳定;相反,他们使用了一个随时间变化的代价函数,以处理系统可能只是保持有界而非完美收敛于零的情况。他们避免了假设系统是“遍历的”(一种关于时间平均值的特定统计特性),这使得他们的方法比以往的方法更具灵活性。

核心结论
作者在混乱的现实世界非线性混沌与简洁的线性数学之间架起了一座桥梁。他们证明了通过“提升”问题、从数据中学习规则并使用智能的“向前看”策略,可以有效地控制复杂系统。他们通过数学证明了这一点,并通过在经典摇摆系统上的模拟验证了其有效性。虽然他们尚未在真实的物理机器人上进行测试(这是未来的步骤),但数学逻辑和计算机模拟表明,这是一个可靠且稳健的方法,可以教机器如何应对不可预测的情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →