想象一下,你让一只四足机器狗(比如像波士顿动力那种)走进一个充满障碍的迷宫。它面前有台阶、碎石、甚至只有几块孤零零的石头可以落脚。如果它像以前那样,只是把地面看作一张模糊的“高度地图”,它可能会误判,以为一大片碎石是平坦的,结果一脚踩空摔个跟头。
这篇论文介绍了一个名为 QuadPiPS 的新系统,它就像给这只机器狗装上了一套“超级大脑”和“鹰眼”,让它能像人类一样聪明地选择落脚点。
我们可以用三个生动的比喻来理解它的核心工作:
1. 它的“眼睛”:全景鱼眼 + 智能滤镜 (Legged Egocan)
以前的机器人看世界,像是在看一张平铺的2.5D 地形图(就像看一张只有高低起伏的地图)。但这不够用,因为机器人需要知道地面的纹理和能不能踩。
QuadPiPS 换了一种看世界的方式,叫 "Egocan"(以机器人为中心的罐子)。
- 比喻:想象机器人戴着一副360 度全景鱼眼眼镜。这副眼镜不仅记录地面的高低,还能通过特殊的算法(就像给照片加滤镜),瞬间分析出地面的倾斜角度(法向量)和材质属性(语义标签)。
- 作用:它能告诉机器人:“这块石头虽然高,但表面很平,可以踩(绿色)”;“那块斜坡虽然能走,但太滑了,最好跨过去(黄色)”;“那个柱子太细,踩上去会翻车,绝对不能碰(红色)”。
- 创新点:它不需要把点云数据(一堆杂乱的数据点)重新处理成地图,而是直接在图像空间里做判断,速度极快,就像人眼直接看东西一样自然。
2. 它的“思考”:把地面切成“拼图块” (Superpixels)
有了清晰的图像,怎么找落脚点呢?以前的方法是把地面切成整齐的方格(像棋盘),但这在复杂地形下很笨拙。
QuadPiPS 使用了一种叫 SLIC 超像素 的技术。
- 比喻:想象机器人把眼前的地面看作一幅油画。它不是把画切成死板的方格,而是像切披萨或拼图一样,根据颜色和纹理的相似性,把地面自动分割成一个个不规则的“色块”。
- 作用:如果面前有一块大石头,算法会自动把它识别为一个完整的“可踩区域”,而不是把它切得支离破碎。这让机器人在做决策时,能更精准地知道“这块大石头中间哪里最稳”,而不是盲目地踩在边缘。
3. 它的“决策”:像下棋一样的“搜索与规划” (Planning & Optimization)
找到了可以踩的“色块”后,机器人怎么走过去?
- 比喻:这就像下国际象棋。
- 粗规划:先大概看一眼,规划出一条从起点到终点的“躯干路径”(就像棋手先看大方向)。
- 精细搜索:然后,它在那些“色块”之间进行** exhaustive search(穷举搜索)。它会模拟:“如果我把左前脚踩在这个角,右后脚踩在那个角,身体会不会翻?”它会尝试成千上万种组合,直到找到一条绝对安全**的路线。
- 动作执行:一旦确定了脚踩哪里,它就用数学优化方法计算出完美的摆腿轨迹(就像体操运动员计算起跳和落地的角度),确保动作流畅且符合物理定律。
为什么它很厉害?(实验结果)
论文在模拟和真实的机器狗(Unitree Go2)上做了测试,结果令人印象深刻:
- 在“稀疏”地形中无敌:当地面上只有几块孤零零的石头(像跳房子游戏)时,旧的方法(基于高度图)通常会失败,因为它们把石头看成了连成一片的大平地,导致机器人踩空。而 QuadPiPS 能精准地识别出每一块石头,成功率高得惊人。
- 在“危险”地形中更稳:在狭窄的平衡木或带障碍物的斜坡上,它能利用“语义标签”(知道哪里不能踩)来避免翻车,而旧方法往往会因为看不清障碍而直接撞上去。
- 实时性:虽然计算很复杂,但它能在机器人行走的毫秒级时间内完成所有思考,就像人走路时大脑瞬间处理平衡一样自然。
总结
QuadPiPS 就像是给机器狗装上了一套**“直觉 + 逻辑”**的混合系统:
- 它不再依赖笨重的地图重建,而是直接看懂眼前的图像。
- 它不再盲目地按方格走路,而是像拼图一样灵活地寻找落脚点。
- 它不再只是机械地执行动作,而是像棋手一样预判每一步的风险。
这项技术让机器狗从“能走路的铁疙瘩”进化成了“能在复杂野外环境中灵活穿梭的智能探险家”。
QuadPiPS 技术总结:基于感知信息的四足机器人步点规划框架
1. 研究背景与问题定义 (Problem)
随着四足机器人(Legged Robots)在复杂非结构化环境中的应用日益增多,传统的基于高程图(Elevation Map)或体素网格(Voxel Grid)的环境表示方法在**步点规划(Foothold Planning)**方面面临挑战:
- 表示局限:传统方法通常将环境离散化为 2.5D 网格,难以捕捉复杂的几何特征(如法向量)和语义信息(如是否可踩踏),导致在稀疏或狭窄的可行步点区域(如台阶、平衡木)规划失败。
- 计算瓶颈:构建高程图需要昂贵的点云预处理(滤波、射线投射等),增加了系统延迟。
- 规划与感知脱节:现有的规划器往往依赖后处理的几何信息,缺乏对原始传感器数据的直接利用,且难以在安全关键(Safety-critical)场景下实现实时的、动力学可行的步点搜索。
核心问题:如何构建一种感知驱动的框架,能够直接在感知空间(Perception Space)中利用原始深度和语义信息,为四足机器人生成安全、实时且动力学可行的步点规划,特别是在可行步点稀缺的复杂地形中。
2. 方法论 (Methodology)
QuadPiPS (Quad PiPS) 提出了一种感知空间步点规划框架,其核心流程分为感知、规划和控制三个层级:
2.1 感知层:增强型 Legged Egocan
- Egocan 表示:基于“感知空间规划”(PiPS)理念,扩展了原有的 Egocylinder 概念,增加了上下“帽”(Egocaps),形成封闭的 360° 局部环境表示。它直接利用深度相机数据,无需点云预处理。
- 多通道特征融合:
- 几何特征:通过深度图像梯度实时估计表面法向量(Surface Normals),捕捉地形朝向。
- 语义特征:利用深度学习模型(DeepLabV3+)预测可踩踏性标签(Steppability Labels),将环境分为“可踩踏(Steppable)”、“可跨越(Passable)”和“不可通行(Non-passable)”。
- 超像素过分割(Superpixels Oversegmentation):
- 针对 Egocan 底部图像,提出了一种改进的 SLIC 超像素算法。
- 将稀疏的多通道图像(深度 + 法向 + 语义)过分割为感知均匀的平面区域(Planar Regions)。
- 这些区域作为候选步点的搜索空间,既保留了地形的几何细节,又避免了均匀网格的冗余。
2.2 规划层:分层搜索与优化
框架借鉴并扩展了 ALEF (Augmented Leafs with Experience on Foliations) 框架,将规划空间分解为离散和连续子空间:
- 躯干路径搜索(Coarse Torso Search):
- 基于平面区域构建图,使用 A* 算法搜索粗略的躯干路径,作为后续步点搜索的引导。
- 接触模式族搜索(Contact Mode Family Search):
- 离散空间:构建“接触模式族转换图”。节点代表部分支撑状态(部分脚着地),边代表完整的支撑状态转换。
- 约束:在搜索过程中加入用户定义的步态序列、可达性体积(Reachability Volumes,基于超二次曲面)、支撑稳定性(Stance Stability)和摆动距离约束。
- 优势:通过显式的图搜索,在稀疏地形(如稀疏的踏脚石)中能找到全局最优的步点序列,而非依赖启发式规则。
- 摆动轨迹优化(Swing Trajectory Optimization):
- 连续空间:利用非线性轨迹优化(基于 OCS2 库)生成动力学可行的全身参考轨迹,连接选定的步点。
- 优化目标包括最小化能量、满足摩擦锥约束和平面约束。
2.3 控制层:MPC 与 WBC
- 模型预测控制(MPC):以 50Hz 频率跟踪参考轨迹,具有重新规划(Re-planning)能力,可根据当前状态调整摆动脚落点以维持稳定。
- 全身控制(WBC):以 >1kHz 频率运行,将 MPC 输出的状态和输入转化为关节力矩指令,优先保证动力学可行性。
3. 关键贡献 (Key Contributions)
- Legged Egocan 表示:首次将 Egocan 扩展用于四足机器人,融合了表面法向量和语义可踩踏标签,实现了从感知到动作的端到端管道。
- 合成数据生成:利用基于基本几何形状(Primitive Shapes)的技术生成带有真实步点标签的合成训练数据,解决了语义分割模型在机器人领域缺乏标注数据的问题。
- 超像素过分割算法:提出了一种针对稀疏多通道图像的 SLIC 改进算法,将 Egocan 地面图像转化为适合步点搜索的凸平面区域集合。
- 实时 ALEF 扩展:将 ALEF 框架适配为感知驱动、实时且动力学可行的四足运动规划器,支持在未知环境中的在线搜索。
- 全面的实验验证:
- 仿真:在 ANYmal C 上进行了 10 种复杂地形(台阶、碎石、平衡木等)的基准测试,对比了 5 种基线方法。
- 实机:在 Unitree Go2 上部署了自定义计算套件,成功完成了包括斜坡、楼梯和踏脚石在内的 5 种真实地形测试。
4. 实验结果 (Results)
- 仿真基准测试:
- 在稀疏步点环境(如稀疏踏脚石、带障碍的平衡木)中,QuadPiPS 显著优于基于高程图的基线方法(EM-MPC, EM-RL 等)。高程图方法常因将小石块合并为大平面而导致规划失败。
- 在语义敏感环境(如带障碍的平衡木)中,QuadPiPS 利用语义标签成功避开了不稳定的障碍物,而纯几何方法则容易尝试踩踏导致翻倒。
- 在简单环境(如斜坡、碎石)中,基于学习的方法(EM-DTC)表现良好,但在复杂地形下缺乏鲁棒性。
- 实机部署:
- QuadPiPS 在 Unitree Go2 上成功实现了地形感知 locomotion。
- 能够处理动态变化的地形(如滑动的木板)和高度变化(如 35cm 高的台阶)。
- 尽管存在跟踪误差(如脚滑出平台),MPC 层能够有效恢复稳定性。
- 性能指标:感知流水线在硬件上运行频率约为 20Hz(受限于语义分割推理时间,但通过多线程优化未成为瓶颈),规划与控制在 15Hz-50Hz 范围内运行,满足实时性要求。
5. 意义与影响 (Significance)
- 范式转变:证明了“感知空间规划”(PiPS)不仅适用于避障,也能有效解决复杂的四足步点规划问题,减少了中间表示(如点云转高程图)带来的信息丢失和延迟。
- 安全性提升:通过显式的图搜索和语义理解,QuadPiPS 在可行步点稀缺的安全关键场景中表现出极高的鲁棒性,填补了传统启发式规划器在复杂地形下的能力空白。
- 硬件部署可行性:展示了在嵌入式计算平台(Jetson Orin NX + Mini PC)上运行复杂感知 - 规划 - 控制闭环的可行性,为四足机器人在真实世界(如灾难救援、野外勘探)的自主导航提供了技术路径。
- 未来方向:指出了当前框架在超像素时间一致性(减少抖动)和动力学可行性约束(结合 ALEF 经验启发式)方面的改进空间,并建议结合学习策略(Learning-based Policies)以进一步增强底层控制的鲁棒性。
总结:QuadPiPS 通过深度融合感知语义、几何特征与分层规划算法,成功解决四足机器人在复杂、稀疏地形下的步点规划难题,实现了从感知到动作的高效、安全闭环,是四足机器人自主导航领域的一项重要进展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。