← 最新论文
⚡ electrical engineering

Learning-Based Stochastic Optimal Control with Infinite-Horizon Probabilistic Constraints

本文提出了一种基于学习的双上升算法,该算法通过状态增广,将带有联合机会约束的无限时界随机最优控制问题重新表述为无约束马尔可夫决策过程,从而实现对连续状态-输入空间下最优且可行确定性策略的高效计算。

原作者: Francesco Cordiano, Kanghui He, Bart De Schutter

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Francesco Cordiano, Kanghui He, Bart De Schutter

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在穿越密集小行星带的飞船舰长。你的任务是到达一颗遥远的恒星,同时尽可能节省燃料。但有一个难点:你不能仅仅避开现在能看到的小行星;你必须保证你的整个航程——从发射到着陆——都能以极高的概率保持安全。这就是**随机最优控制(stochastic optimal control)**这一领域的核心。它是关于如何在未来充满模糊性和意外的情况下,做出最佳决策的科学。

为了理解这个挑战,请思考两种处理危险的方式。第一种就像每秒钟都检查一次后视镜,然后说:“好吧,我现在很安全。”这被称为“逐阶段(stagewise)”检查。第二种更难的方法,就像是在地图上查看你的整个飞行路径,然后说:“我保证这条线上的每一个点都是安全的。”这是一个联合机会约束(joint chance constraint)。这是一个“全任务周期”的承诺。问题在于,让计算机实现这个承诺极其困难,因为未来的路径取决于之前发生的每一次颠簸和转向,这使得数学复杂度呈爆炸式增长。通常,为了让数学计算变得可行,工程师不得不采取过度谨慎的做法,即绕远路且缓慢行驶,或者假设宇宙在某个时间点之后就不再危险了。

这篇由 Francesco Cordiano、Kanghui He 和 Bart De Schutter 撰写的论文,探讨了如何在不表现得过度谨慎或不假设危险消失的前提下,驾驭那条无限且危险的路径。他们提出了一种巧妙的新方法,教计算机如何为那些运行时间无限的系统(如电网或高速公路上的自动驾驶汽车)做出完美、安全且高效的决策。

魔术技巧:将记忆问题转化为状态问题

对于“全任务周期”的安全承诺来说,最大的难题在于它是**非马尔可夫(non-Markovian)*的。用通俗的话说,这意味着计算机需要记住自时间开始以来发生的一切,才能知道自己是否仍然安全。如果你从未撞到过小行星,你是安全的;如果你昨天撞到了,你就已经“失败”了。标准的计算机大脑(马尔可夫策略)通常只观察你现在*所处的位置来决定下一步该做什么。它没有长期记忆。

作者的第一个突破是名为**状态增广(state augmentation)**的“魔术技巧”。他们发明了一套新的“虚拟传感器”来安装在飞船上:

  1. “全清”指示灯(状态 ξ\xi): 这是一个二进制开关,只要飞船从未撞到小行星,它就保持“开启”(1)状态。一旦撞到,开关就会跳变为“关闭”(0)并永远保持在那里。
  2. “首次碰撞”警报(状态 ψ\psi): 这是一个特殊的警报,仅在飞船撞到第一颗小行星的精确时刻响起。如果警报响起,系统就知道:“啊,这就是我们失败的时刻。”
  3. “时间刻度盘”(状态 ϕ\phi): 由于飞船试图在无限的未来中最小化燃料消耗,未来燃料使用的重要性会随时间而变化。这个刻度盘用于追踪这种变化的重要性。

通过将这三个虚拟传感器添加到飞船的实际位置中,计算机不再需要记住整个历史。它只需要观察这些传感器的当前状态。如果“全清”指示灯是“开启”的,它就知道目前是安全的;如果指示灯是“关闭”的,它就知道已经失败了。这把一个复杂的、依赖记忆的问题变成了一个标准的、易于处理的步骤化问题。

平衡艺术:安全的代价

现在问题变得可以处理了,接下来的挑战是“无限时界(infinite horizon)”部分。飞船需要永远保持安全,而不仅仅是接下来的 10 分钟。作者使用了一个名为**拉格朗日对偶性(Lagrange duality)**的数学概念来解决这个问题。

想象一下,你正在雇佣一个机器人来开车。你告诉它:“尽可能快地驾驶,但不要撞车。”机器人并不知道如何平衡速度与安全。于是,你引入了“安全的代价”。你说:“每当你接近撞车时,你都必须支付一笔罚款。”

  • 如果罚款太低,机器人会鲁莽驾驶并导致撞车。
  • 如果罚款太高,机器人会开得太慢,导致永远无法到达目的地。

该论文提出了一种算法,其作用就像一个聪明的谈判者。它从低罚款开始并让机器人驾驶。如果机器人经常撞车,算法就会提高罚款;如果机器人驾驶得过于缓慢和安全,算法就会降低罚款。目标是找到那个“金发姑娘原则(Goldilocks)”下的罚款金额(称为对偶变量 λ\lambda),在这个金额下,机器人的“最佳速度”策略同时也恰好是“最安全”的策略。

作者证明了这种谈判是完美的。他们表明,存在一个特定的价格,使得机器人的“最佳速度”策略也是其“最安全”的策略。这使他们能够将困难的“安全约束”问题转化为一个更简单的“最小化成本加罚款”问题。

用神经网络教导机器人

拼图的最后一块是,现实世界的系统(如机器人或电网)拥有无限的可能性,即它们可能处于的位置以及它们可以采取的行为。你无法为每一种可能性都写下一条规则。为了处理这一点,作者使用了机器学习

他们训练了一个神经网络(一种受人类大脑启发的计算机大脑)来学习处于任何情况下的“价值”。

  • 首先,他们教导网络如果安全规则已经被打破会发生什么。在这种情况下,机器人只需尽可能快地到达目标,忽略安全性。
  • 然后,他们教导网络“全清”情况。在这里,网络学习如何平衡速度与“安全的代价”罚款。

训练过程是**离线(offline)**进行的,这意味着计算机在机器人开始移动之前就完成了所有的繁重思考。一旦训练完成,机器人只需观察其当前状态和神经网络的建议,即可在瞬间(测试中为 0.01 秒)做出决策。

结果:更快、更安全、更聪明

作者在模拟一个“独轮车”机器人(在单轮上保持平衡的机器人)尝试穿越带有中心危险障碍物的迷宫的过程中测试了他们的方法。他们将该方法与一种流行的技术——**模型预测控制(MPC)**进行了对比。MPC 就像是一个会规划接下来几步、检查是否安全、然后重新规划的机器人。

结果令人印象深刻:

  • 安全性: 新方法保持了机器人的安全,违规率约为 4.5%,远低于允许的 10% 上限。传统的 MPC 方法即使经过大量调整,违规率仍有 17%,未能通过安全测试。
  • 性能: 新方法在到达目标时使用的“燃料”(成本)显著减少。新方法的成本为 528.3,而 MPC 方法的成本为 672.0。新方法在冒险方面更聪明:如果它确实撞到了障碍物(在极少数情况下),它会立即切换到最快的路径前往目标,而 MPC 方法则会陷入保守的循环中。
  • 速度: 这是最大的胜利。传统的 MPC 方法在每一步决策时平均需要 2.94 秒,有时甚至达到 10 秒的限制,从而导致延迟。而新方法仅需 0.01 秒。它比前者快了近 300 倍。

为什么这很重要

这篇论文不仅仅是在说“我们做到了”,它还为他们的方法提供了严密的数学证明,证明其有效且收敛于最优解。它表明,你不需要在安全与高效之间做选择。通过使用巧妙的状态增广和智能学习算法,你可以构建出既极其快速又在无限未来中保持严格安全的系统。

作者承认,他们的方法依赖于模拟,且学习过程需要足够的数据才能保证准确性,尤其是在危险区域边缘。然而,他们证明了对于复杂的连续系统,这种方法是一个巨大的飞跃。它将一个此前难以解决的问题,变成了计算机可以在眨眼间解决的问题,为现实世界中更安全、更高效的自主系统打开了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →