想象一下,你正试图引导一架微小而精致的无人机(“追逐者”)进入一个巨大空间站(“目标”)上正在移动并旋转的对接端口。你必须完美地完成这一操作:你必须靠近到足以锁定,但如果靠得太近或角度不对,就会发生碰撞。
问题在于空间物理极其复杂。无人机同时向前、向后、向左、向右移动,同时还在旋转和倾斜。这构成了一个“13 维”的难题。试图用传统数学来解决这个难题,就像试图绘制海滩上每一粒沙子的地图以寻找路径;计算机在完成任务之前就会耗尽内存和时间。
本文介绍了一种新方法,教导计算机如何安全且快速地解决这一难题。以下是其工作原理的简明解释:
问题:“维数灾难”
将目标周围的空间想象成一个巨大的、多层的迷宫。
- 旧方法(网格求解器): 想象试图通过在地板的每一英寸上绘制网格来绘制这个迷宫。在小房间(低维)中,这很有效。但在 13 维空间中,网格点的数量变得如此巨大(超过宇宙中的原子数量),以至于没有任何计算机能够处理。
- 学习方法(神经网络): 作者没有绘制网格,而是训练了一个“神经网络”(一种 AI 大脑)来学习安全路径的形状。然而,教导这个 AI 同时避免碰撞并到达目标是很棘手的。AI 经常感到困惑,误以为自己安全而实际上即将撞毁,或者因为数学过于平坦而缺乏转向线索而陷入停滞。
解决方案:"MPC 监督器”
为了解决困惑的 AI,作者在训练过程中添加了一个“监督器”。
- 教师(MPC): 他们使用一种强大但缓慢的计算机算法,称为模型预测控制(MPC),充当教师。这位教师可以完美地解决难题,但速度太慢,无法用于实时操作。
- 学生(神经网络): AI 学生尝试学习路径。
- 课程表: 他们没有要求学生在第一天就解决整个 13 维迷宫,而是使用了“课程表”。
- 首先,他们让学生练习短而简单的路径。
- 教师(MPC)检查学生的作业。如果学生表现良好,教师会说:“好的,现在尝试一条稍长的路径。”
- 如果学生犯错,教师不会只说“错了”。它会为那个确切的位置生成一条具体、正确的路径,向学生展示该怎么做。
- 这创造了一个反馈循环:随着学生变得更聪明,教师的示例变得更加精确,帮助学生更快、更准确地学习。
结果:“安全管”
一旦 AI 训练完成,它就会创建一个反向可达 - 避障管(BRAT)。
- 比喻: 想象一个围绕目标的发光、无形的隧道。
- 隧道内部: 你保证能安全到达对接端口而不会撞毁。
- 隧道外部: 你处于危险之中。
- AI 不仅知道隧道在哪里;它还知道确切该朝哪个方向转向以进入隧道并保持在其中。
实时工作原理(在线阶段)
当实际航天器飞行时,它使用两种模式:
- “进入隧道”模式: 如果飞船很远(在隧道外),AI 会将其 steering 向发光的隧道入口。
- “对接”模式: 一旦进入隧道,AI 切换到精确模式,轻柔地将飞船引导至端口。
- 安全网: 即使 AI 犯错或飞船偏离到太靠近边缘,一个“安全过滤器”也会像紧急刹车一样,在飞船过于靠近目标本体时立即覆盖 AI 指令,将飞船推离碰撞。
为什么这很重要
作者在两种场景下测试了这种方法:
- 6 维测试: 他们将他们的 AI 与“完美”的基于网格的解决方案进行了比较。他们的 AI 同样安全,但对接更快,因为它没有受到网格方法“像素化”错误的影响。
- 完整的 13 维测试: 这是真正的考验。网格方法甚至无法运行。他们的 AI 在**98.88%**的情况下成功对接,碰撞率几乎为零。
- 速度: AI 在16 毫秒内做出决策。
- 对比: 旧的“完美”优化方法需要12 秒才能做出决策(对于实时操作来说太慢了)。其他学习方法几乎 100% 失败。
总结
本文提出了一种方法,通过利用缓慢、完美的“教师”来训练快速、聪明的“学生”,从而教导 AI 在高维空间中对接航天器。其结果是一个安全、快速且能够解决以前计算机无法处理的问题的系统。它确保航天器能够在不撞毁的情况下找到进入微小移动目标的路径,即使在复杂的轨道物理环境中也是如此。
技术摘要:基于 MPC 监督的高维系统神经反向可达 - 避障管
问题陈述
自主航天器对接需要控制策略,在紧密耦合的高维平动 - 旋转动力学下,同时保证避障和目标可达性。虽然哈密顿 - 雅可比(HJ)可达性为这类“可达 - 避障”问题提供了形式化保证,但传统的基于网格的求解器受限于维数灾难,通常将实际应用限制在五维或六维系统。涉及完整六自由度(6-DOF)动力学的航天器对接导致 13 维状态空间,使得基于网格的方法在计算上不可行。
现有的基于学习的方法(如 DeepReach)试图利用神经网络近似 HJ 值函数以扩展至高维。然而,这些方法在可达 - 避障设置中表现不佳,特别是当目标集(对接端口)与失败集(碰撞区)紧密耦合时。可达 - 避障变分不等式(VI)的嵌套极小 - 极大结构在状态空间的大片区域产生梯度消失,导致训练不稳定和策略次优。此外,纯偏微分方程(PDE)训练往往无法在对接任务所需的长时域上收敛。
方法论
作者提出了一种基于学习的反向可达 - 避障管(BRAT)框架,将 HJ 结构与模型预测控制(MPC)监督相结合,以应对上述挑战。该方法包含离线训练阶段和在线部署阶段。
离线训练:MPC 监督的课程学习
核心创新是一种训练策略,通过课程驱动的 MPC 监督增强标准的 PDE 残差最小化。
- 神经架构:使用 SIREN(正弦表示网络)神经网络近似 HJ 值函数,并采用精确边界条件参数化,以确保边界约束在构建时即得到满足。
- 混合损失函数:网络通过最小化组合损失进行训练:
- PDE 损失:惩罚对可达 - 避障变分不等式的违反。
- MPC 监督损失:利用 MPC 求解器生成的值目标。这些标签在 PDE 残差信号较弱的区域(例如远离活动边界处)提供直接监督。
- 训练 - 验证 - 优化循环:为应对学习长时域值函数的时间挑战,作者引入了一个主动反馈回路。训练采用课程学习,逐步扩展时域。在特定检查点,训练暂停,在保留集上针对 MPC 成本估计验证当前值函数。如果验证失败,训练在当前时域继续。关键在于,在每个检查点使用当前学习到的策略作为“热启动”重新生成 MPC 标签,形成一个自举循环,即网络质量的提升带来更优的监督标签。
在线部署:双控制器架构
学习到的值函数通过两个实时控制器进行部署,两者均由最小限制安全滤波器(仅避障 BRT)支持,以确保即使系统在学习到的 BRAT 之外也能保持安全。
- BRAT 梯度控制器:
- 收敛阶段:当状态位于 BRAT 之外(V>0)时,控制器利用值函数梯度,通过 bang-bang 控制驱动系统进入 BRAT 内部。
- 精度阶段:一旦进入 BRAT 内部(V≤0),控制器执行最小时间搜索,找到状态保持安全的最紧时间切片,并应用 bang-bang 控制进行精确终端引导。
- 终端 MPC 控制器:该控制器利用短时域 MPC,并将学习到的值函数作为可微终端成本,结合了短时域规划的可处理性与神经网络编码的长时域可达 - 避障信息。
主要贡献
- 扩展到可达 - 避障问题:作者将 MPC 监督的 DeepReach 扩展到可达 - 避障问题,引入基于课程的训练策略及训练 - 验证 - 优化循环,以实现在高维系统中的稳定学习。
- 新颖控制器套件:开发了两种实时控制器(BRAT 梯度控制器和值函数增强的终端 MPC),利用学习到的值函数实现安全对接。
- 高维验证:在保真度递增的航天器对接模型上进行了评估,包括 6D 平面系统(与基于网格的基准真值进行验证)和完整的 13D 轨道系统。
- 性能优势:证明所提方法在成功率和计算效率方面均优于现有的 MPC、Vanilla DeepReach 和强化学习(RL)基线。
结果
该框架在 6D 平面对接问题和完整的 13D 轨道对接问题上进行了评估。
6D 平面对接:
- 准确性:学习到的 BRAT 与基于网格的基准真值高度吻合,相对于网格解实现了 81.12% 的真正例率(TPR)和 0.15% 的低假正例率(FPR)。
- 性能:所提出的 BRAT 控制器实现了 99.6% 的对接成功率,0% 的碰撞率,与基于网格的基准真值(99.8% 成功率)相当。
- 效率:BRAT 控制器实时运行,每步平均计算时间为 10.74 毫秒,显著快于标准 MPC(5880 毫秒)和终端 MPC(2246 毫秒)。
- 最优性:与基于网格的解(30.18 秒)相比,学习到的控制器实现了稍快的平均对接时间(29.17 秒),这归因于神经网络能够减轻基于网格求解器固有的离散化误差。
13D 轨道对接:
- 可扩展性:该框架成功扩展到 13D 系统,这是一个基于网格的求解器不可行的领域。
- 性能:在 10,000 个均匀采样的初始条件下,BRAT 控制器实现了 98.88% 的对接成功率和 0.58% 的碰撞率。
- 对比:基线在 13D 情况下表现严重不佳。标准 MPC 的碰撞率为 27%,超时率为 73%。Vanilla DeepReach 和 RL 基线几乎完全失败(99.4% 超时)。终端 MPC 实现了 83% 的成功率,但每控制步需要约 12.7 秒,使其无法在星载硬件上实时执行。所提出的 BRAT 控制器保持了每步 16.00 毫秒的执行时间。
意义与主张
本文声称,这项工作解决了将形式化可达 - 避障保证应用于高维耦合动态系统(如航天器对接)的关键空白。通过将 MPC 监督与基于 PDE 的学习紧密结合,作者克服了纯 PDE 驱动训练在可达 - 避障设置中的不稳定性。
其意义在于能够合成具有以下特性的控制器:
- 形式化安全:能够通过 HJ 框架提供可达 - 避障保证。
- 可扩展:在传统网格方法失效的 13 维状态空间中有效。
- 计算高效:能够在星载硬件上实时执行,而基于优化的 MPC 因速度过慢而无法处理高维问题。
- 鲁棒:能够处理通常困扰基于学习方法的目标集与失败集之间的紧密耦合。
作者指出,当前的公式化假设无扰动环境和静止目标。未来的工作被确定为通过微分博弈公式扩展框架以包含有界扰动,并处理具有时变目标集的翻滚目标。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。