← 最新论文
💻 computer science

CALOS: Control-Affine Lyapunov On-manifold Safety Layer for Safe Deep Reinforcement Learning for Quadrotors

本文介绍了 CALOS,一种基于控制仿射李雅普诺夫(control-affine Lyapunov)的实时安全层,它通过一个可高效求解的二次规划来强制执行四旋翼飞行器的姿态约束,从而在不修改底层策略的情况下,消除安全违规、减少跟踪误差并加速深度强化学习的收敛。

原作者: Fabrizio Cesareo, Sebastiano Mengozzi, Nicola Mimmo, Andrea Acquaviva

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Fabrizio Cesareo, Sebastiano Mengozzi, Nicola Mimmo, Andrea Acquaviva

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:CALOS —— 控制仿射李雅普诺夫流形安全层

问题陈述
深度强化学习(DRL)在四旋翼飞行器控制方面展现了显著能力,但学习到的策略在训练或部署期间缺乏关于安全约束的形式化保证。现有的安全 DRL 方法面临着持久的矛盾:约束马尔可夫决策过程(CMDPs)可能导致学习不稳定,而运行时过滤器(屏蔽或控制障碍函数)如果纠正动作过于激进,则会削弱梯度信号。此外,当前架构的局限性阻碍了多个安全证书的联合优化。例如,ATACOM 方法将动作投影到约束流形上,但缺乏用于旋转耗散的能量型证书;而基于李雅普诺夫的方法通常独立处理约束,存在满足一个约束时却违反另一个约束的风险。这些方法的顺序组合无法保证联合可行性,特别是在需要最大控制能力的较大跟踪误差情况下,顺序缩放往往会使控制力失效。

方法论
本文提出了 CALOS(控制仿射李雅普诺夫流形安全),这是一种运行在标准 DRL 策略(具体为近端策略优化,PPO)之上的透明运行时安全层,无需修改底层的学习算法。CALOS 将姿态倾角约束与李雅普诺夫稳定性条件统一到一个二次规划(QP)中,以计算对标称转矩输出的最小范数修正。

  1. 倾角约束(预测性倾角投影):
    姿态通过机体坐标系下的重力矢量(gbg_b)表示,以避免欧拉角奇异性。通过使用辛欧拉离散化,未来的重力矢量被建模为关于控制转矩的仿射函数。这种形式化允许施加横滚和俯仰限制(ϕmax=θmax=60\phi_{max} = \theta_{max} = 60^\circ),表现为四个线性不等式(APTPτbPTPA_{PTP}\tau \le b_{PTP})。

  2. 李雅普诺夫约束:
    基于倾角误差和角速度定义了一个李雅普诺夫候选函数 V(x)V(x)。该层强制执行衰减条件 V˙cV\dot{V} \le -cV,由于旋转动力学的控制仿射特性,这可以转化为单个线性不等式(ALτbLA_L\tau \le b_L)。这确保了旋转能量的耗散。

  3. 统一形式化:
    不同于先应用倾角投影再进行李雅普诺夫缩放的顺序方法(后者在误差较大时会导致转矩归零),CALOS 将五个线性约束(四个倾角约束和一个李雅普诺夫约束)堆叠到一个单一系统中。安全层求解:
    τ=argminτR312ττ02s.t.A(x)τb(x) \tau^\star = \arg \min_{\tau \in \mathbb{R}^3} \frac{1}{2} \|\tau - \tau_0\|^2 \quad \text{s.t.} \quad A(x)\tau \le b(x)
    其中 τ0\tau_0 是来自策略的标称转矩。

  4. 求解器:

    • CALOS-P: 一种使用阻尼伪逆修正的投影近似法。它联合执行所有约束而不保证获得精确的最小范数解,优先考虑大规模并行训练的速度。
    • CALOS-QP: 一个精确求解器,利用三维转矩空间。它枚举所有可能的激活集(26 个候选集)以寻找满足库恩-塔克(KKT)条件的精确最小范数解。如果没有可行解,系统将回退到未经过修正的策略动作并进行执行器限幅。

核心贡献

  • 统一安全层: 首个在单个 QP 步骤中联合优化倾角约束和李雅普诺夫稳定性的运行时层,避免了顺序组合带来的可行性问题。
  • 实时可扩展性: 精确求解器(CALOS-QP)具有极高的计算效率,足以在数千个并行仿真环境中运行,这是现代大规模并行 DRL 训练的要求。
  • 训练轨迹零违规: 该方法在训练期间严格执行约束,防止智能体探索不安全的状态空间区域。

实验结果
在 NVIDIA Isaac Lab 的轨迹跟踪任务中进行了评估,将 CALOS 与无约束 PPO、独立倾角投影(PTP)、独立李雅普诺夫缩放以及两者的顺序级联方法进行了对比。

  • 跟踪性能: 在训练轨迹上,CALOS-P 和 CALOS-QP 相比无约束 PPO 基准减少了 55–60% 的横向跟踪误差。在具有较大初始位置偏移的未见轨迹上,CALOS 变体将误差维持在 0.08 m 以下,而李雅普诺夫法和级联法由于转矩归零而无法完成跟踪。
  • 安全指标: 在训练轨迹上,CALOS-QP 实现了零姿态约束违规。在极端初始偏移下,违规次数最多为连续 3 步(CALOS-P)或 9 步(CALOS-QP),而顺序方法最高可达 27 步。
  • 收敛性与数据效率: 通过将探索限制在安全区域,CALOS 加速了训练收敛。
  • 内化行为: 使用 CALOS 训练的策略即使在测试时禁用安全层,仍保留了更安全且更准确的行为,其横向误差比 PPO 训练的策略低 55–74%。这表明策略成功内化了安全约束。

意义
论文声称 CALOS 解决了安全执行与学习效率之间的权衡。通过将安全形式化为单个低维 QP,它确保了梯度信号不会因激进的顺序修正而退化。该方法允许策略在安全流形内学习最优行为,从而在不牺牲跟踪性能的前提下,获得本质上更安全且更具数据效率的策略。作者指出,QP 可行集在所有测试中均保持非空,证实了该联合形式化的鲁棒性。

未来工作
作者确定了三个研究方向:

  1. 开发学习型、任务感知型的李雅普诺夫证书,以避免在无人机跟踪非零但可行的参考姿态时进行不必要的干预。
  2. 将框架扩展到非控制仿射动力学(例如包含旋翼速度动力学或叶片摆动效应的模型)。
  3. 利用领域随机化和数据驱动的安全过滤器研究从仿真到现实(sim-to-real)的迁移,以处理物理硬件上的模型不确定性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →