想象一下,你正在试图教一个机器人如何在浓雾弥漫的森林中行走。这个机器人有一张地图,但地图并不完美;树木可能比画出来的稍高或稍矮,地面可能很湿滑或者布满了隐藏的岩石。如果机器人只是盲目地遵循地图,它可能会绊倒、摔倒,或者撞上一棵它没预见到的树。这就是机器人领域面临的一个重大挑战的核心:当你不百分之百确定世界是什么样子,或者不确定自己的机器人会对环境做出何种反应时,该如何规划路径?科学家们称之为“不确定性下的运动规划”。这不仅仅是寻找最短路线的问题,更是要寻找一条“最安全”的路线,一条能够考虑到出错可能性的路线。如果机器人在探索火星,一次碰撞就可能意味着价值数百万美元任务的终结,那么“猜测”是绝对不允许的。你需要一种计算风险的方法,而不仅仅是计算距离。
这篇论文针对的是机器人探索行星表面(如火星或月球那尘土飞扬、岩石遍布的地形)时遇到的确切问题。来自佐治亚理工学院的研究人员为机器人开发了一个由两步组成的“大脑”,帮助它即使在对地形或自身运动感到不确定时也能安全导航。
首先,机器人使用一种称为 AO-RRT(渐近最优快速探索随机树)的方法。你可以把它想象成一个在森林中快速勾勒出许多可能路径的机器人,就像一名徒步旅行者向地图上投掷飞镖以观察落点一样。但这里有一个转折:它不仅仅是选择最短的路径,而是会为每一步计算一个“风险分”。它会问:“如果我走这里,如果地面很滑,我撞到岩石的可能性有多大?”它使用一种称为**条件风险价值(CVaR)**的数学工具,将注意力集中在最坏的情况上。如果一条路径平均看起来不错,但存在极小的发生灾难性碰撞的概率,这个工具就会将其标记为危险。
一旦机器人勾勒出了一个大致安全的路径草图,它就会进入第二步:序列凸规划(SCP)。想象一下,第一步的草图是用颤抖的手画出来的;虽然安全,但可能有些颠簸或不平整。SCP 就像一只稳定且平滑的手,对这幅画进行精修。它通过处理那条粗略的路径并使其变得更加平滑和高效,同时保持原有的安全保障。它解决了一个复杂的数学难题,以确保机器人不仅在“看起来”能完成转向,而且实际上确实能在不打滑或不碰撞的情况下完成转向。
研究人员通过两种方式测试了该系统:一种是在计算机模拟中,另一种是在一个模拟了多岩石、不确定环境的实验室里,使用名为“Leo”的实验机器人。结果令人震惊。当他们让机器人进行不考虑风险的规划时,它选择了一条看起来很高效但导致联合碰撞风险达到 0.94 的路径。这个高风险分数表明,机器人几乎肯定会撞到障碍物,从而导致任务失败。然而,当他们使用这种具备风险意识的规划方法时,机器人找到的路径将碰撞风险降低到了仅为 6 × 10⁻³(即 0.006 的微小概率)。更令人印象深刻的是,与冒险路径相比,这种风险感知规划将整体风险降低了超过 97%,同时几乎保持了相同的能量消耗(控制成本)。
在现实世界的硬件测试中,即使在轮子打滑的情况下,机器人在颗粒感较强的沙质地形上也成功追踪了这些安全路径。尽管地面存在不确定性,机器人保持航向的平均误差仅为 6 厘米。这篇论文表明,通过教导机器人去稍微“畏惧”一下最坏的情况,我们可以引导它们穿过未知领域而不至于发生碰撞,从而使太空探索更加安全,也更有可能取得成功。
技术摘要:面向行星环境下安全导航的风险感知运动规划(考虑动力学约束与不确定性)
问题陈述
自主空间探索要求机器人代理在交互过程往往未知的环境中执行运动规划。具体而言,学习地形力学(例如针对轮式机器人)引入的不确定性可能导致高风险的运动规划、危险的操作或任务失败。此外,来自感知系统的观测不确定性进一步加剧了安全导航的挑战。未能考虑执行器退化、未建模地形动力学以及传感器噪声的传统规划器存在导致关键任务失败的风险。虽然以往的研究已经解决了风险感知的几何轨迹问题,或者使用了带有风险约束控制器的风险中性规划器,但本文旨在解决如何量化学习到的动力学模型本身的不确定性,从而生成风险感知的初始轨迹。
方法论
所提出的方法通过一个两阶段框架实现具有风险意识的代价最优动力学约束运动规划:
1. 不确定性量化与建模
- 动力学模型: 系统被建模为一个具有未建模动力学残差 d(x,u) 的一阶速度控制机器人。该残差使用满足 Lipschitz 连续性的神经网络进行近似。
- 符合预测(Conformal Prediction): 为了量化神经网络输出的不确定性,采用了符合预测技术。通过计算预测的残差动力学与真实值(通过运动捕捉测量)之间的误差,为线性加速度和角加速度误差建立一个 95% 置信水平的置信集 M。
- 风险场构建: 靠近不确定障碍物的程度被建模为风险场。对于每个具有边界不确定性尺度 σi 的障碍物 i,基于符号距离 di(x) 计算风险得分 ri(x)。这些得分被融合为一个取值范围在 [0,1] 之间的单一 RiskMap(风险图)。
- 风险膨胀 SDF: 通过向障碍物的符号距离场(SDF)向外膨胀一个条件风险价值(CVaR)裕量,应用软风险惩罚,从而创建一个作为约束边界的 “RiskSDF”。
2. 两阶段规划框架
步骤 A:风险感知 AO-RRT(初始轨迹生成)
- 一种渐近最优快速探索随机树(AO-RRT)算法用于生成动力学可行的轨迹。
- 闭环风险计算: 与标准规划器不同,树中的边通过在一定时界内对开环参考进行闭环跟踪来评估,模拟来自不确定性集合 M 的扰动。
- 代价函数: 边的代价结合了在整个扰动场景系综下,软碰撞约束违反情况的 CVaR。这确保了初始轨迹能够一次性同时兼顾动力学和障碍物位置的不确定性,提供了一种时间一致的风险度量。
步骤 B:序列凸规划(SCP)精炼
- AO-RRT 轨迹作为 SCP 的初始解。
- 优化: 将非线性问题转化为局部凸问题。目标函数共同最小化控制量和 CVaR(使用 Rockafellar-Uryasev 增广形式),并针对终端误差、缺陷松弛项和 SDF 缓冲违规进行惩罚。
- 约束: 问题包含关于动力学、状态/控制边界以及相对于真实 SDF 安全间隙的仿射约束。风险图的梯度通过自动微分(JAX)精确计算。
- 求解器: 凸子问题通过迭代使用 CLARABEL 求解器进行求解,直到收敛,从而在优化平滑度和降低风险的同时,保证遵循非线性动力学。
核心贡献
- 不确定性量化: 使用符合预测技术量化基于学习的动力学模型中的不确定性。
- 风险感知 AO-RRT: 将带有闭环风险计算(CVaR)的 AO-RRT 形式化为代价函数,以生成本质上避开高风险区域的初始轨迹。
- 联合优化: 将非线性运动规划问题转化为局部凸优化问题,在 AO-RRT 提供的同伦路径内共同最小化 CVaR 和控制代价,确保动力学可行性。
实验结果
该方法通过在配备 ZED 2i 立体相机和 Jetson Orin AGX 的 Leo 漫游车上的模拟和硬件实验进行了验证,该车在颗粒状地形中导航。
- 模拟对比:
- 无风险感知代价: AO-RRT 最小化了控制代价,但规划了一条直接穿过高风险区域的轨迹,导致联合碰撞风险为 0.94。SCP 精炼将其降低至 0.29,但轨迹仍处于高风险同伦区域内。
- 具有风险感知代价: AO-RRT 生成了一条位于低不确定性障碍物附近的初始轨迹。随后的 SCP 精炼实现了 6×10−3 的联合碰撞风险,控制代价为 18.4 单位。
- 风险降低: 风险感知方法在轨迹层面展示了相比于风险中性方法超过 ~97% 的风险降低。
- 硬件性能:
- 尽管存在由地形引起的轮式打滑,但采用基于滑移调整的前馈速度的收缩控制算法使轨迹跟踪的均方根(RMS)误差保持在 6 cm。
- 系统成功从点云构建风险图,并在障碍物丰富的环境中执行了动力学可行的轨迹。
重要性与主张
作者声称,这项工作为行星和月球机器人的运动规划提供了一种更安全、具备风险感知的解决方案,这对于任务成功至关重要。通过将不确定性量化直接集成到动力学约束规划循环中,该方法显著降低了由未建模动力学和感知不确定性导致的决策失效或危险操作的概率。论文强调,虽然 SCP 本身可以精炼轨迹,但它无法逃离高风险同伦区域;因此,由 AO-RRT 提供的风险感知初始化对于实现报告的 97% 风险降低是必不可少的。具体而言,论文指出,风险感知 AO-RRT 步骤生成的初始轨迹解相比于风险中性方法减少了 **97%** 的风险,而经过风险中性 AO-RRT 后进行的 SCP 精炼仅能将联合碰撞风险降低约 ~69%(从 0.94 降至 0.29),且无法脱离高风险区域。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。