随着自主机器人在我们的日常生活中变得越来越普遍,从人行道上的送货机器人到监测森林的无人机,一个根本性的问题随之而来:我们如何确保它们永远不会伤害任何人或任何事物?答案在于一个被称为“安全滤波器”(safety filter)的数学概念。想象一下,一个机器人收到向前移动的指令,但一名行人突然走进了它的路径。安全滤波器就像一个警觉的守护者,瞬间检查该指令是否安全。如果路径畅通,机器人继续前进;如果路径受阻,滤波器会微妙地调整机器人的运动,程度恰好足以避免碰撞,同时仍尽可能尝试实现其目标。多年来,工程师们一直使用一种基于控制障碍函数(control barrier functions)的特定类型的安全滤波器,这种方法提供了对安全性的严格保证。然而,为复杂的机器人设计这些滤波器一直是非常困难的。传统方法往往会导致安全区域过小,迫使机器人行动过于谨慎且效率低下,或者当机器人的运动变得过于复杂而无法通过人工绘图时,这些方法会完全失效。
一组研究人员开发了一种名为 VertexCBF 的新方法来解决这个问题,使机器人能够学习更大且更实用的安全区域。他们并没有试图计算机器人可能采取的每一种可能的未来路径——对于复杂的机器来说,这是一项在计算上不可能完成的任务——而是专注于一个特定的数学捷径。他们意识到,对于许多机器人而言,关于安全性的最关键决策发生在机器人电机能力的极值边缘。通过将搜索限制在机器人控制能力的极端极限或“顶点”(vertices)处,他们能够比以前更快、更准确地生成高质量的训练数据。随后,他们利用这些数据来教导一种神经网络(一种人工智能类型)去识别安全和不安全的状态。其结果是一个能够学习在不过于谨慎的情况下保持机器人安全的系统,有效地恢复了机器人可以自由运行的最大可能区域。
研究人员在十五种不同的机器人系统上测试了这种方法,范围从简单的单摆、无人机到复杂的潜水器和步行机器人。在每种情况下,他们都将这种新的学习方法与现有技术进行了对比。旧方法产生的安全区域要么是空的(意味着机器人无法移动),要么小到让机器人几乎处于瘫痪状态。相比之下,新方法始终能找到大而可靠的安全区域。例如,在一个模拟平衡杆机器人的系统中,传统方法未能找到任何安全路径,而新方法成功识别出了一个机器人可以安全运行的广阔区域。团队还通过在硬件实验中将学习到的安全滤波器应用于一台真实的移动机器人,验证了这些发现。该机器人被要求在空间中导航,同时避开那些故意移动以拦截它的行人。使用用他们的新方法训练的安全滤波器,该机器人在所有十次试验中都成功避免了碰撞,在保持安全距离的同时平滑地调整路径并继续前往目的地。
这种方法之所以特别强大,是因为它平衡了两个相互竞争的需求:严格的数学安全性与实际的效率。研究人员将一种确保机器人绝不违反运动定律的物理规则,与一种填补空白的数据驱动学习过程相结合。他们设计了一种具有特定结构的神经网络,以保证学习到的安全区域绝不会大于机器人的物理极限,从而防止人工智能“幻觉”出并不存在的安全路径。这确保了机器人始终处于其真实的物理约束之内。这项研究表明,通过专注于控制的极端极限而非试图采样每一个可能的中间状态,该系统可以学习如何在复杂环境中导航,并达到以往方法无法实现的信心水平。这项工作为在拥挤、不可预测的人类环境中部署自主机器人指明了方向,在这些环境中,安全性必须是绝对的,但效率也不能被牺牲。
技术摘要:VertexCBF
问题陈述
随着自主机器人应用的扩展,确保其运行的安全性和可靠性仍然是一个关键挑战。虽然控制障碍函数(CBF)为安全过滤提供了一个具有理论基础的框架,但为具有状态和输入约束的系统设计有效的 CBF 是极其困难的。现有的基于学习的方法往往在可扩展性、可解释性方面表现不佳,或者会导致过于保守的安全集。此外,仅依赖物理信息学习(求解 Hamilton–Jacobi–Bellellar 变分不等式)的方法往往会收敛到平凡解或次优解,而使用全控制轨迹优化进行监督的方法则可能计算成本过高且信息量不足。
方法论:VertexCBF
作者提出了 VertexCBF,这是一个用于学习神经 CBF 的框架,该框架旨在逼近由 Hamilton–Jacobi (HJ) 可达性所刻画的最优安全集。该方法将物理信息学习与源自控制仿射系统特定结构属性的稀疏、高质量监督相结合。
核心组件
价值函数的神经逼近:
该方法使用神经网络来逼近平稳 HJ 安全价值函数 V(x)。为了确保学习到的安全集永远不会超过原始物理约束,网络采用了残差架构:
VΘ(x)=c(x)−rΘ(x)
其中 c(x) 是约束函数,rΘ(x)≥0 是由多层感知器(MLP)输出的非负残差。这保证了 VΘ(x)≤c(x),确保学习到的安全集是约束集的子集。
顶点限制控制搜索:
其核心创新在于生成监督标签。对于具有凸多胞体控制集 U 的控制仿射系统(x˙=f(x)+g(x)u),哈密顿量在 U 的顶点处达到最大值。
- 与其求解复杂的偏微分方程(PDE)或进行全控制轨迹优化(例如 MPPI),VertexCBF 将控制搜索限制在控制多胞体的顶点上。
- 这通过将无限时界安全问题转化为在离散控制序列集合上的有限时界优化问题。
- 监督标签通过 GPU 并行树搜索(使用束搜索、随机束搜索或分支定界法)在这些顶点限制的轨迹上生成。这避免了对数值 PDE 解法器的需求,并降低了与全控制采样相比的计算负担。
训练目标:
神经网络通过最小化两个损失项的凸组合进行训练:
- 物理信息损失 (LPDE): 在密集采样的无标签状态上强制执行平稳 HJ 变分不等式。
- 数据损失 (Ldata): 最小化网络输出与在稀疏采样状态下通过顶点限制控制树搜索生成的标签之间的均方误差。
这种结合引导优化过程远离平凡的常数解(这是仅靠 PDE 学习时常见的现象),同时保持与系统动力学的局部一致性。
主要贡献
- 系统化学习框架: 本文引入了一种结合 HJ 可达性理论与监督学习来学习神经 CBF 的方法。
- 顶点限制监督: 通过利用控制仿射动力学和凸控制约束,作者证明了可以通过顶点限制的树搜索高效地生成监督。这种方法比全控制采样更具可扩展性,比仅基于 PDE 的优化更有效。
- 残差参数化: 残差架构的使用确保了学习到的 CBF 被约束函数上界限制,防止学习过程将安全集扩展到物理极限之外。
- 全面评估: 该方法在 15 个多样化的动力系统(涵盖 2 到 13 个状态以及 1 到 6 个控制变量)上进行了评估,并与仅基于 PDE 的基准方法以及全控制 MPPI 监督进行了对比。
实验结果
评估表明,VertexCBF 始终比基准方法恢复出更大且更可靠的安全集:
- 可靠性: 仅基于 PDE 的学习(ND)经常失败,会坍缩为带有空安全集或高假安全率 (ρFS) 的平凡解。VertexCBF 在大多数系统中保持了较低的假安全率。
- 有效性: 与通过 MPPI 生成的全控制数据 (FCD) 相比,VertexCBF(使用顶点限制控制数据,VRCD)实现了具有竞争力或更优的有效安全体积 (ηeff) 和更低的假不安全率 (ρFU)。全控制 MPPI 监督通常会导致过于保守的安全集。
- 硬件验证: 在移动机器人于行人中导航的硬件实验中,证实了所学习的神经 CBF 可以作为安全过滤器实时部署,尽管存在模型失配(如轮胎打滑、感知延迟),仍能在 10 次试验中成功避免碰撞。
意义与主张
本文声称 VertexCBF 提供了一种实用且系统化的设计方法,用于学习神经 CBF。其重要性在于:
- 可扩展性: 它通过利用控制集的顶点结构,避免了基于网格的 PDE 解法的不可行性以及全控制轨迹优化的高计算成本。
- 鲁棒性: 通过引入源自顶点限制搜索的高质量、稀疏监督,它克服了仅基于 PDE 学习的不稳定性及平凡化问题。
- 安全保证: 残差架构提供了一个内置保证,即学习到的安全集保持在原始状态约束之内。
作者承认了局限性,指出该方法尚未提供正式的收敛保证或确定性误差界限,而是依赖于通过闭环展开进行的后训练验证。他们还指出,虽然该方法可以很好地扩展到高达 13 个状态的系统,但由于树搜索随控制顶点数量呈指数级增长,极高维度的全身动力学(例如完整的类人机器人模型)可能仍面临计算挑战。未来的工作建议解决收敛保证、高维系统的可扩展性以及向不确定动力学的扩展问题。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。