想象一下,你正在训练一位极具天赋但鲁莽的机器人司机,让它穿梭于繁忙的城市中。你希望机器人能快速高效地抵达目的地,同时也必须确保它绝不会撞向建筑物或其他车辆。
本文提出了一种构建机器人“大脑”的新方法,使安全性不再是事后补救的考量,而是从一开始就内置的核心特性。
以下是他们方法的拆解,辅以简单的类比:
问题所在:“安全卫士”的瓶颈
传统上,工程师会先构建机器人的驾驶大脑(一个神经网络),然后在输出端附加一个独立的“安全卫士”(称为控制障碍函数,CBF)。
- 类比:想象一位赛车手(神经网络),速度极快但可能危险地急转。你在副驾驶座上安排了一位严格的教练(安全卫士)。如果司机试图做出不安全的行为,教练就会拍他的手,强行将方向盘转回安全位置。
- 缺陷:
- 教练过于僵化:通常,这位教练拥有一本固定的规则手册(例如“永远不要靠近墙壁 5 米以内”)。如果规则太严,车辆会开得非常缓慢且谨慎(保守);如果太松,车辆仍可能撞毁。手动调整这本规则手册非常困难。
- 教练反应迟缓:每次司机做出动作,教练都必须停下来,计算出完美的修正方案,然后才允许司机继续。这消耗了时间和计算资源,不利于实时驾驶。
解决方案:“安全即设计”的大脑
作者赵、李、全和永提出了一种名为CAffNet-Lite的新方法。他们不再将司机与独立的教练分开,而是构建了一个单一的大脑,将安全性硬编码进司机的肌肉记忆中。
- 类比:不再需要独立的教练,而是训练司机从一开始就根本不会考虑不安全的动作。司机的大脑在物理结构上被构建为:在数学上不可能将方向盘转向墙壁。
- 工作原理:
- 联合学习:他们同时训练司机(控制器)和安全规则(CBF 参数)。安全规则并非固定数值,而是大脑中灵活的部分,能根据情境学习该有多严格。
- 无需“停顿计算”:由于安全性已内置于结构中,机器人无需暂停并求解复杂的数学问题(二次规划)来检查某个动作是否安全。它直接输出一个由设计保证安全的动作。
创新点:“轻量级”版本
作者们还注意到,当面对众多障碍物(如拥有数百栋建筑的城市)时,以往版本的这种“安全大脑”过于笨重且缓慢。
- 类比:想象一名保安正在检查一份包含 1,000 个禁区的清单。旧方法会检查所有可能的禁区组合,以确定哪些是激活的。这就像检查大楼里的每一扇门是否上锁。
- 修复方案(CAffNet-Lite):他们创建了一个“轻量级”版本,仅检查最关键的门(车辆实际靠近的门)和绝对边界,而忽略无关的门。
- 结果:它运行速度快得多,且能更好地扩展到复杂系统(如无人机或飞机),同时不丢失机器人不会撞毁的保证。
他们的证明
该论文声称,通过使用这种新架构:
- 安全性得到保证:无论发生什么,机器人在数学上都会保持在“安全区”内(就像保持在道路上一样)。
- 性能更优:由于安全规则是学习得来的且灵活(而非由人类固定),机器人能更高效地行驶,比使用僵化、人工调整的安全卫士的机器人更快抵达目标。
- 速度:“轻量级”版本在训练和运行方面比之前的重型版本快得多,使其适用于现实世界的高速应用。
实验结果
他们在两种场景下测试了该方法:
- 在二维空间中移动的简单机器人:他们表明,与其他方法相比,他们的方法在严格避开障碍物的同时,能以更快的速度抵达目标,且“晃动”更少。
- 固定翼飞机:他们表明,“轻量级”版本的计算速度远快于原始的重型版本,证明其能够处理像飞机这样复杂的高维系统。
简而言之:他们构建了一个既聪明又快速、且在数学上无法做出危险动作的机器人大脑,而无需依赖一个缓慢的独立安全计算机来为其保驾护航。
技术摘要:学习安全设计型神经网络控制器
问题陈述
神经网络(NN)正日益被用作反馈控制策略,以处理复杂的高维非线性动力学。然而,纯学习控制器往往缺乏形式化的安全保证,可能会生成违反关键约束(如避障或执行器限制)的动作。一种常见的缓解策略是在预训练控制器后附加一个安全滤波器,该滤波器通常基于控制障碍函数(CBF)。在标准框架中,该滤波器求解一个在线二次规划(QP),以强制执行由 CBF 候选函数 h(x) 和扩展 K 类函数 α(⋅) 定义的安全约束。
这种解耦设计存在两个主要局限性:
- 保守性与次优性:α(⋅) 函数通常是固定的(例如 α(h)=ωh),其参数需手动调节。调节不当会导致过于保守的行为,从而降低控制性能;而激进的调节则可能引发安全违规。
- 计算开销:在运行时求解 QP 会引入计算延迟和可靠性问题,阻碍实时部署,特别是对于具有高维状态空间或众多约束的系统。
尽管像 BarrierNet 和 CAffNet 这样的近期工作试图将安全性整合到学习过程中,但它们要么保留了昂贵的在线 QP 层,要么由于将输出投影到由众多约束定义的可行集所导致的指数级复杂度而遭受可扩展性问题。
方法论
作者提出了一种“安全设计”框架,联合学习神经网络控制器和神经网络参数化的 CBF 条件,将安全约束直接嵌入控制器架构中,从而消除对在线 QP 求解器的需求。
CAffNet-Lite 架构:
核心贡献是 CAffNet-Lite,这是现有 CAffNet 架构的一个轻量级扩展。它将约束仿射层与可训练投影模块集成,通过构造满足状态相关的仿射约束 A(x)u≤b(x)。
- 轻量级约束分解:与枚举所有可能激活约束组合(导致 O(2nc) 的指数级复杂度)的 CAffNet 不同,CAffNet-Lite 采用了一种简化的分解策略。它仅考虑最低阶(k=1)或最高阶(k=min(nc,m))的子约束。这将最坏情况复杂度降低为多项式级 O(ncm),显著提高了具有众多约束系统的可扩展性。
- 投影机制:网络输出无约束控制信号 fθ(x)。如果该信号违反约束,投影层通过将信号投影到子约束超平面上来计算可行候选集。最终输出是无约束信号(如果可行)或最接近的可行投影,从而确保硬约束的满足,而无需满秩或线性独立的约束。
CBF 参数的联合学习:
该框架不再固定衰减函数 α(⋅),而是将其替换为可训练的神经网络参数化形式 αϑ(x,h(x))。这使得系统能够学习一种“最优衰减”特性,以适应控制器的行为和系统动力学。安全约束被表述为:
A(x)u≤bϑ(x)
其中 bϑ(x) 包含了学习到的 αϑ。
理论保证:
由于投影层涉及可能导致控制信号不连续的 argmin 操作,作者在 Filippov 意义 下确立了安全性。他们证明了所得的分段连续控制律保证了安全集的 强前向不变性,确保如果系统起始于安全集内,则其在所有未来时间都将保持在该集合内。
主要贡献
- CAffNet-Lite:引入了一种轻量级投影架构,将相对于约束数量的计算复杂度从指数级降低到多项式级,同时保留了硬仿射约束满足性和通用近似性质。
- 联合优化:一个联合训练神经网络控制器和 CBF 参数(特别是衰减函数)的框架,使得无需在线 QP 求解器即可通过构造满足安全约束。
- 理论证明:证明了所提出的控制器在 Filippov 意义下满足安全集的强前向不变性,解决了由投影层引入的不连续性。
实验结果
该框架在两个仿真场景中进行了评估:
具有避障功能的单积分器:
- 设置:一个二维积分器系统,需避开三个凸多面体障碍物。
- 发现:CAffNet 和 CAffNet-Lite 实现了最低的平均成本(最接近标称控制器),同时严格满足所有安全约束(0% 违规)。相比之下,标准神经网络和 HardNet 出现了约束违规,而基于固定参数的 QP 方法要么过于保守(无法到达目标),要么需要更高的计算时间。
- 效率:CAffNet-Lite 在性能上与 CAffNet 相当,但测试时间更短,证明了轻量级分解的高效性。
固定翼飞机地理围栏:
- 设置:一个 7 状态、3 输入的飞机模型,执行地理围栏约束。
- 发现:CAffNet 和 CAffNet-Lite 都成功学习了避开地理围栏的安全速度指令。
- 效率:与原始 CAffNet 相比,CAffNet-Lite 展示了显著更低的训练和测试时间,证实了其在高维系统中更优越的可扩展性。虽然 CAffNet 由于拥有更多投影候选项而在成本收敛速度上略快,但 CAffNet-Lite 为实时应用提供了更好的权衡。
意义与主张
该论文声称,通过将仿射安全约束直接嵌入神经网络控制器并联合学习 CBF 参数,所提出的方法克服了固定参数滤波器的保守性和在线 QP 求解器的计算负担。作者强调,CAffNet-Lite 提供了一种可扩展、可实时部署的解决方案,通过构造保证硬安全约束。这项工作将其定位为迈向“安全设计”控制的一步,其中安全性不再是事后的考虑或运行时滤波器,而是学习策略的固有属性。作者谦逊地指出,未来的工作将探索将该框架扩展到更广泛的约束类别,并在现实世界系统中评估其性能。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。