← 最新论文
⚡ electrical engineering

Neural Backward Reach-Avoid Tubes with MPC Supervision for High-Dimensional Systems: An Application to Safe Spacecraft Docking

本文提出了一种基于学习的反向可达 - 避障管框架,该框架将哈密顿 - 雅可比结构与模型预测控制监督相结合,通过离线训练神经价值函数并在线部署基于梯度和终端的模型预测控制器,实现了安全的高维航天器对接,其成功率和效率均优于现有方法。

原作者: Santiago Thorup, Luca Castelletto, Zeyuan Feng, Somil Bansal

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Santiago Thorup, Luca Castelletto, Zeyuan Feng, Somil Bansal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图引导一架微小而精致的无人机(“追逐者”)进入一个巨大空间站(“目标”)上正在移动并旋转的对接端口。你必须完美地完成这一操作:你必须靠近到足以锁定,但如果靠得近或角度不对,就会发生碰撞。

问题在于空间物理极其复杂。无人机同时向前、向后、向左、向右移动,同时还在旋转和倾斜。这构成了一个“13 维”的难题。试图用传统数学来解决这个难题,就像试图绘制海滩上每一粒沙子的地图以寻找路径;计算机在完成任务之前就会耗尽内存和时间。

本文介绍了一种新方法,教导计算机如何安全且快速地解决这一难题。以下是其工作原理的简明解释:

问题:“维数灾难”

将目标周围的空间想象成一个巨大的、多层的迷宫。

  • 旧方法(网格求解器): 想象试图通过在地板的每一英寸上绘制网格来绘制这个迷宫。在小房间(低维)中,这很有效。但在 13 维空间中,网格点的数量变得如此巨大(超过宇宙中的原子数量),以至于没有任何计算机能够处理。
  • 学习方法(神经网络): 作者没有绘制网格,而是训练了一个“神经网络”(一种 AI 大脑)来学习安全路径的形状。然而,教导这个 AI 同时避免碰撞并到达目标是很棘手的。AI 经常感到困惑,误以为自己安全而实际上即将撞毁,或者因为数学过于平坦而缺乏转向线索而陷入停滞。

解决方案:"MPC 监督器”

为了解决困惑的 AI,作者在训练过程中添加了一个“监督器”。

  1. 教师(MPC): 他们使用一种强大但缓慢的计算机算法,称为模型预测控制(MPC),充当教师。这位教师可以完美地解决难题,但速度太慢,无法用于实时操作。
  2. 学生(神经网络): AI 学生尝试学习路径。
  3. 课程表: 他们没有要求学生在第一天就解决整个 13 维迷宫,而是使用了“课程表”。
    • 首先,他们让学生练习短而简单的路径。
    • 教师(MPC)检查学生的作业。如果学生表现良好,教师会说:“好的,现在尝试一条稍长的路径。”
    • 如果学生犯错,教师不会只说“错了”。它会为那个确切的位置生成一条具体、正确的路径,向学生展示该怎么做。
    • 这创造了一个反馈循环:随着学生变得更聪明,教师的示例变得更加精确,帮助学生更快、更准确地学习。

结果:“安全管”

一旦 AI 训练完成,它就会创建一个反向可达 - 避障管(BRAT)

  • 比喻: 想象一个围绕目标的发光、无形的隧道。
    • 隧道内部: 你保证能安全到达对接端口而不会撞毁。
    • 隧道外部: 你处于危险之中。
  • AI 不仅知道隧道在哪里;它还知道确切该朝哪个方向转向以进入隧道并保持在其中。

实时工作原理(在线阶段)

当实际航天器飞行时,它使用两种模式:

  1. “进入隧道”模式: 如果飞船很远(在隧道外),AI 会将其 steering 向发光的隧道入口。
  2. “对接”模式: 一旦进入隧道,AI 切换到精确模式,轻柔地将飞船引导至端口。
  3. 安全网: 即使 AI 犯错或飞船偏离到太靠近边缘,一个“安全过滤器”也会像紧急刹车一样,在飞船过于靠近目标本体时立即覆盖 AI 指令,将飞船推离碰撞。

为什么这很重要

作者在两种场景下测试了这种方法:

  1. 6 维测试: 他们将他们的 AI 与“完美”的基于网格的解决方案进行了比较。他们的 AI 同样安全,但对接更快,因为它没有受到网格方法“像素化”错误的影响。
  2. 完整的 13 维测试: 这是真正的考验。网格方法甚至无法运行。他们的 AI 在**98.88%**的情况下成功对接,碰撞率几乎为零。
    • 速度: AI 在16 毫秒内做出决策。
    • 对比: 旧的“完美”优化方法需要12 秒才能做出决策(对于实时操作来说太慢了)。其他学习方法几乎 100% 失败。

总结

本文提出了一种方法,通过利用缓慢、完美的“教师”来训练快速、聪明的“学生”,从而教导 AI 在高维空间中对接航天器。其结果是一个安全、快速且能够解决以前计算机无法处理的问题的系统。它确保航天器能够在不撞毁的情况下找到进入微小移动目标的路径,即使在复杂的轨道物理环境中也是如此。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →