想象你正驾驶一辆汽车穿过一片茂密且蜿蜒的森林,树木不断移动,而你的目标是以最快的速度抵达某个特定的林间空地,同时避免发生碰撞。这正是机器人在复杂环境中导航所面临的日常挑战。
本文介绍了一种名为BOW 规划器(基于窗口的贝叶斯优化,Bayesian Optimization over Windows)的新型机器人“驾驶员”。其工作原理可通过以下简单类比进行解释:
问题所在:“网格搜索”与“智能猜测”
传统机器人规划器通常像一个人试图通过检查巨大网格上的每一个可能的转向来寻找最佳路径。它们测试左转、右转、急左转、急右转,如此反复。虽然这种方法详尽无遗,但极其缓慢且计算成本高昂,就像试图品尝海滩上的每一粒沙子,只为找到那一粒尝起来像巧克力的沙子。
其他方法可能会进行随机猜测,但它们往往浪费时间去测试那些径直撞向墙壁(障碍物)的路径。
解决方案:“智能窗口”
BOW 规划器通过两项主要技巧改变了游戏规则:
- “窗口”(前瞻): 机器人不再试图一次性规划从起点到终点的整个旅程(这太难了),而是只向前看一个短暂的“时间窗口”——也许仅仅是接下来的几秒钟。它会问:“如果我现在踩油门或转动方向盘,我实际上能到达哪里?”这将搜索范围限制在机器人物理上能够实现的转速和转向内。
- 贝叶斯优化(“智能采样器”): 这是整个操作的核心。想象你试图在雾气弥漫的山上找到最高点,但你只能走几步就会累倒。
- 愚蠢的探险者会随机行走。
- 聪明的探险者(BOW)会根据它已经访问过的少数地点构建一张心理地图。它利用数学(具体来说是高斯过程)来推测峰值可能在哪里,悬崖又在哪里。
- 关键在于,BOW 不仅仅寻找最高点;它还会学习悬崖在哪里(即安全约束)。它学会了避开“坏”区域,而无需真的坠崖才能获知。
实际运作方式
论文将这一过程描述如下:
- 采样: 机器人在其可达的时间窗口内挑选几个“试驾”(控制输入)。
- 学习: 它模拟这些试驾。如果一次试驾撞到了墙,它就学会该区域是“坏”的;如果一次试驾更接近目标,它就学会该区域是“好”的。
- “采集”函数: 机器人使用一个特殊公式(称为约束期望改进,Constrained Expected Improvement)来决定其下一步行动。它在“哪里是最佳路径?”和“哪里是安全的?”这两者之间取得平衡。
- 结果: 与其测试成千上万条路径,BOW 仅需极少的尝试就能找到最佳安全路径(即极高的样本效率)。
现实世界的验证
作者不仅进行了模拟,还在真实机器人上进行了测试:
- 地面机器人(UGV): 他们驾驶一辆轮式机器人穿过布满障碍物的杂乱房间。BOW 比其他顶尖方法更快且更安全。
- 飞行机器人(UAV): 他们驾驶无人机穿越充满障碍物的三维空间。无人机成功导航至目标,并实时避开了碰撞。
核心结论
BOW 规划器就像一位超高效的导航员,不会浪费时间去检查不可能的路线。它能从少量样本中快速学习,确切知道哪些是“禁行区”,并能穿过拥挤的房间找到最快、最安全的路径。
论文的关键要点:
- 速度: 其规划速度远快于当前的顶尖方法。
- 安全性: 它将安全规则直接融入学习过程,因此极少建议发生碰撞。
- 通用性: 它既适用于地面机器人(轮式),也适用于飞行机器人(无人机),可在二维和三维空间中运行。
- 开源: 代码已公开,供他人使用和在此基础上构建。
论文总结道,虽然该方法在局部导航(从 A 点到 B 点避开即时障碍物)方面表现出色,但它依赖于一种“启发式”(最佳猜测规则),这可能会使其在非常狭窄、棘手的通道中陷入困境。未来的工作可能会将这种智能导航器与“树搜索”方法相结合,以解决更困难的全局导航问题。
以下是论文《BOW:复杂环境中运动规划的基于窗口的贝叶斯优化》的详细技术总结。
1. 问题陈述
在复杂、拥挤且高维的环境中,移动机器人的运动规划是一个具有挑战性的约束优化问题。核心难点包括:
- 运动学动力学约束:机器人在避障的同时必须遵守物理限制(速度、加速度、偏航率)。
- 计算成本:在长规划时域内评估目标函数(如时间、能量)和安全约束的计算成本高昂,尤其是对于具有复杂动力学的系统。
- 权衡:现有方法往往难以在最优性、安全性和计算效率之间取得平衡。传统的基于采样的方法(如 RRT)可能速度较慢,而基于网格或启发式的方法(如 DWA)可能缺乏采样效率或陷入局部极小值。
- 实时性要求:在线规划需要在每个时间步的严格时间预算(毫秒级)内找到可行且接近最优的控制输入。
2. 方法论:BOW 规划器
作者提出了BOW(基于窗口的贝叶斯优化),这是一种可扩展的运动规划算法,将**动态窗口法(DWA)与约束贝叶斯优化(CBO)**相结合。
核心概念
BOW 不搜索整个控制空间或使用固定的网格搜索,而是将搜索限制在由机器人当前运动学动力学限制(可达速度和加速度)定义的动态规划窗口(Vd)内。在此窗口内,它利用贝叶斯优化高效地采样控制输入。
关键技术组件
模型预测控制(RHC):
- 规划器在较短的预测时域(Δ)内运行。
- 它假设在时域内施加恒定的控制输入 ut,以简化代价函数的计算。
- 目标是在满足安全约束 ck(避障)的前提下,最小化代价函数 J(到目标的距离)。
高斯过程(GP)代理模型:
- 由于通过仿真评估真实代价和约束的成本高昂,BOW 将目标函数 J(u) 和约束函数 ck(u) 建模为高斯过程。
- 高斯过程在动态窗口内的一小组初始样本(p)上进行训练。
约束期望改进(CEI):
- 为了选择下一个控制输入,BOW 使用一种改进的采集函数,称为约束期望改进(CEI)。
- 公式:CEI(u)=EI(u)×P(feasible∣u)
- $EI(u)$ 平衡了目标函数的探索与开发。
- P(feasible∣u) 是控制输入满足所有安全约束的概率(由约束的高斯过程后验推导得出)。
- 这使得规划器能够同时优化性能和安全性,在搜索过程中有效地将约束视为软概率约束。
算法流程:
- 从动态窗口中采样 p 个控制候选项。
- 通过仿真评估代价和约束。
- 基于数据训练高斯过程。
- 最大化 CEI 以找到最优控制 ut∗。
- 使用运动模型(RK4 积分)生成轨迹,并针对完整时域进行验证。
- 应用控制量一个步长 ℓ(其中 ℓ≤Δ),然后重复上述过程。
3. 主要贡献
- 增强的采样效率:与网格搜索或随机采样相比,BOW 仅需显著更少的评估次数(例如 5–15 个样本)即可找到最优控制策略,大幅减少了计算时间。
- 集成安全性的优化:与先优化后检查约束的方法不同,BOW 将安全约束直接纳入采集函数,确保所选控制在概率上是可行的。
- 可扩展性:该方法能有效扩展到高维问题(已在 6 自由度无人机上测试)和复杂环境,而计算时间不会呈线性爆炸式增长。
- 理论保证:论文提供了渐近收敛性的证明,表明随着样本数量的增加,所选控制会收敛到可行区域内的真实最优解。
- 开源:该规划器已作为开源包发布,并包含真实世界和仿真实验视频。
4. 实验结果
BOW 规划器在仿真和真实世界环境中,针对无人地面车辆(UGV)和无人飞行器(UAV)进行了评估。
- 基准测试:在六个不同的 2D 环境(包括“虫洞陷阱”和泊松森林)以及五个 3D UAV 场景中,与 RRT、DWA、MPPI、HRVO 和 CBF 进行了对比。
- 性能指标:
- 计算时间:BOW 实现了最快的规划时间,每个时域耗时10 毫秒至 30 毫秒,每步执行时间低至0.10–0.15 毫秒。相比之下,CBF 和 MPPI 等竞争对手耗时数百至数千毫秒。
- 完备性:BOW 在所有环境中保持了100% 的成功率(完美完备性),而 DWA、HRVO 和 CBF 等竞争对手在特定复杂场景(如狭窄通道或高密度障碍物)中未能找到解决方案。
- 轨迹质量:BOW 生成的轨迹长度具有竞争力且平滑(加加速度适中),在平滑性方面优于 RRT,在一致性方面优于 MPPI。
- 采样效率:在视觉对比中,BOW 仅用约 15 个样本就识别出了最优控制,而 DWA 需要完整的网格搜索,MPPI 则需要对可行和不可行空间进行均匀采样。
- 真实世界部署:成功部署在差速驱动 UGV 和四旋翼 UAV 上,展示了利用机载激光雷达在拥挤的 3D 空间中进行鲁棒的避障和实时导航能力。
5. 意义与影响
- 实际适用性:BOW 弥合了理论最优性与实时可行性之间的差距,使其适用于资源受限的边缘设备(如 Raspberry Pi、Jetson Nano)和高速机器人应用。
- 不确定性下的鲁棒性:通过使用概率模型(高斯过程),该规划器比确定性启发式方法更能处理动力学和环境感知中的不确定性。
- 未来方向:虽然 BOW 作为局部规划器表现出色,但作者承认其在全局规划方面的局限性(例如在狭窄通道中陷入局部极小值)。未来的工作旨在将 BOW 与基于树的搜索算法集成,以解决全局运动规划问题。
总之,BOW 规划器代表了局部运动规划的重大进步,它利用约束贝叶斯优化,在复杂动态环境中实现了快速、安全且采样高效的导航。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。