想象一下,一艘返回地球的航天器就像一名试图降落在移动目标上的跳伞员,而且还穿着一套沉重且笨拙的防护服。空气变得越来越稠密,风向也在变化,而这套防护服可能比预想的要重一些或轻一些。目标是保持跳伞员的头部指向正确的方向(姿态控制),以免发生翻滚或烧毁。
传统上,工程师们使用一种“规则书”的方法(称为带有增益调度功能的 PID 控制器)。这就像一位非常严格、经验丰富的教练,他背诵了一张图表:“如果空气这么厚,且速度这么快,你就把左侧襟翼拉动这么多。” 如果一切都按照图表进行,这种方法效果很好;但如果跳伞员突然变重了,或者风向发生了奇怪的变化,这位教练可能会感到困惑,因为这种情况并不在规则书中。
这篇论文探讨了如何通过深度强化学习 (Deep Reinforcement Learning, RL) 来教航天器如何自主飞行。强化学习不再依赖规则书,而是让航天器在模拟器中进行数百万次的“电子游戏”,通过试错来学习。
以下是他们实验过程的简单类比拆解:
1. 三位“学生”
研究人员对比了三种不同的航天器控制方式:
- 老兵 (基准模型/The Veteran): 传统的规则书控制器。它可靠但僵化。
- 自学者 (纯 RL/The Autodict): 一个仅通过玩游戏来学习的学生。它没有规则书,试图完全靠自己摸索物理规律。
- 混合型学生 (混合 RL/The Hybrid Student): 这个学生面前摆着打开的规则书,但被允许根据自己的观察进行微调。如果规则书说“向左转”,学生可能会说:“实际上,由于我感觉到有一股气流,我们再多往左转一点点吧。”
2. 训练营 (动力学随机化/Dynamics Randomization)
教机器人飞行的最大问题在于,它可能会过度适应特定的训练条件,从而在现实世界稍有不同时失败。这就像一个学生背下了练习题的所有答案,却在正式考试中不及格,因为题目表述方式变了。
为了解决这个问题,研究人员使用了动力学随机化。
- 类比: 想象你在训练一名篮球运动员。你不是让他只在平坦的球场上投篮,而是让他要在刮风的日子、凹凸不平的球场、使用更重的球,以及篮筐高度略有不同的情况下进行投篮。
- 结果: 通过在训练过程中不断改变“物理规则”(改变航天器的重量、机翼的刚度或电机的反应速度),AI 学会了适应。它不再仅仅死记硬背特定的动作,而是开始理解飞行的“概念”。
3. 结果:谁赢了?
- 自学者 (纯 RL): 它学会了飞得非常好,通常比“老兵”更出色,但前提是条件必须与训练时完全一致。如果航天器的重量发生意外变化,它有时会陷入恐慌。
- 混合型学生: 这是最终的赢家。通过将“老兵”的安全性与“自学者”的适应性相结合,它变得最为稳健。
- 它比“老兵”能更好地追踪“攻角”(即保持头部指向正确方向)。
- 它比单纯的规则书更能应对“意外”变化(如航天器变重或电机变慢)。
- 至关重要的是,由于规则书仍然作为安全网存在,该系统更加安全。如果 AI 感到困惑,规则书可以接管控制。
4. “神奇”算法 (MR.Q)
研究人员测试了几种不同的学习算法(即学生的“大脑”)。他们发现一种名为 MR.Q 的算法表现最好,因为它不需要针对每个特定问题进行繁琐的人工调优。这就像是发现了一个天生就能理解游戏机制的学生,比其他学生更不需要教练指导。
5. 核心结论
论文得出结论:虽然 AI 在许多情况下可以比传统方法更好地学习如何驾驶航天器,但它需要一个安全网。最好的方法是混合控制器 (Hybrid Controller):一个处理基础操作的、经过验证的传统规则书,配合一个能够处理复杂、不可预测部分的 AI“副驾驶”,从而使整个系统更安全、更精准。
核心启示: 你不需要完全取代旧的、安全的规则书。相反,你应该为它配备一个聪明的、具备适应能力的助手,它知道如何处理那些意料之外的情况,从而让整个系统变得更安全、更精准。
技术摘要:用于航天器再入大气层期间姿态控制的深度强化学习
问题陈述
本文研究了在航天器进行高超声速升力体大气层再入(高度从 93 km 到 10 km)期间,对其姿态进行控制的挑战。这是一个涉及高度非线性动力学、显著不确定性以及变化环境条件(马赫数、动压)的安全关键型跟踪问题。传统方法依赖于增益调度比例积分微分(PID)控制器,这需要大量的专家调优以及针对特定极端情况的正式验证。作者研究了深度强化学习(RL)是否可以提供一种更具适应性、精确性和鲁棒性的替代方案,同时解决了由于“黑盒”性质导致难以进行空间级软件验证与确认(V&V)的问题。
方法论
作者在一个连续、离策(off-policy)强化学习框架内形式化了姿态控制问题。他们利用了一个高保真六自由度仿真模型,该模型包含了气动力、推进器动力学和传感器滞后。
- 控制架构: 本研究对比了三种架构:
- 基准(Baseline): 带有前馈逆动力学的工业标准增益调度 PID 控制器。
- 纯 RL(Pure RL): 一个无模型智能体(MR.Q, TD7, TD3, SAC),直接输出舵面偏转变化量和推进器指令。
- 混合控制器(Hybrid Controllers):
- 加性混合(Additive Hybrid): RL 智能体输出一个残差指令,叠加在基准 PID 输出之上。
- 增益调度混合(Gain-Scheduling Hybrid): RL 智能体输出缩放因子(以分贝为单位),用于调整基准 PID 控制器的增益。
- 算法: 研究重点关注先进的连续控制算法,特别对比了基于 TD3 的扩展算法(TD7, MR.Q)和基于 SAC 的扩展算法。其中,MR.Q(基于模型表示学习的 Q 学习)因其使用基于模型的表示学习和损失调整的优先经验回放(prioritized experience replay)而受到关注。
- 奖励函数: 设计了一个严格正值的奖励函数,以避免产生提前终止的诱因。它结合了攻角(angle of attack)、侧滑角(sideslip)和银行角(bank angle)的指数衰减跟踪误差,以及惩罚过度使用推进器和舵面变化率的控制成本。
- 泛化策略: 为了解决分布外(OOD)泛化问题,作者采用了:
- 动力学随机化(Dynamics Randomization, DR): 在训练期间随机化物理参数(质量、惯性张量、执行器带宽)和初始姿态。
- 任务调度(Task Scheduling): 对比了诸如“先难后易”(SMT)和“主动多任务”(AMT)等策略与均匀随机采样策略。
核心贡献
- 将前沿强化学习应用于高超声速再入: 作者将先进的连续控制算法(特别是 MR.Q)应用于需要增益调度的挑战性航天器姿态跟踪问题。他们证明了 MR.Q 在无需特定任务调优的情况下表现出色,在标称条件下通过持续适应环境变化,性能超越了传统的增益调度 PID 控制器。
- 通过混合控制实现鲁棒性: 本文探索了混合架构,以减轻纯 RL 的不透明性和稳定性担忧。研究发现,虽然纯 RL 在标称条件下可以超越基准控制器,但混合控制器(尤其是加性混合)提供了更安全的后备机制。基准 PID 作为经过验证的安全层,由 RL 智能体进行性能增强或适应变化。
- 训练策略评估: 研究系统地对比了动力学随机化与任务调度方法。研究确定,连续均匀动力学随机化对于强制实现泛化是充分且有效的,而复杂的任务调度策略(如 SMT 或 AMT)在该特定领域并未产生更优的结果,反而引入了训练不稳定性。
结果
- 标称性能: 在标称条件下,MR.Q 算法(无论是纯型还是加性混合型)与工业标准基准相比,实现了更高的累积回报和更紧密的攻角跟踪。学习型控制器的攻角误差分布更窄,尽管基准控制器在零值附近的误差集中度更高。
- 分布外(OOD)泛化:
- 仅在标称条件下训练的策略在面对初始姿态和惯性张量的变化时泛化能力较差,表现往往逊于基准控制器。
- 使用**动力学随机化(DR)**训练的策略显著提高了鲁棒性。在质量、惯量和执行器带宽发生变化时,它们保持了较高的成功率(>93%),而基准控制器在这些情况下会失效(特别是在低执行器带宽时)。
- 使用 DR 训练的加性混合控制器表现最佳,实现了最高的成功率(高达 94-99%),并相比基准控制器降低了气动角的第 90、95 和 98 百分位误差。
- 任务调度: 任务调度方法(SMT, AMT)并未优于简单的均匀动力学随机化。在某些情况下,专注于“困难”任务(SMT)甚至导致了训练失败(成功率为 0%)。
意义与主张
本文声称,深度强化学习——特别是当结合混合控制架构并通过动力学随机化进行训练时——可以在高超声速再入的操作包线内,实现比传统增益调度 PID 控制器更优的鲁棒性和跟踪性能。
作者强调,虽然纯 RL 提供了高性能,但混合方法是实现飞行就绪系统的最有力候选方案。这种架构通过保留一个经过形式化验证的基准控制器,提供了内在的安全性,允许通过监控逻辑将 RL 组件限制在边界内或将其禁用,以应对系统接近其验证域边缘的情况。研究结论指出,MR.Q 由于其基于模型的表示和多步回报而特别有效,并且简单的动力学随机化是确保泛化能力的一种比复杂任务调度更可靠的训练策略。这项工作旨在通过在严格定义的运行包线内提供可靠性的统计证据,从而弥合自适应 AI 与航天飞行严苛的 V&V 要求之间的差距。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。