想象一下你有一只机器狗。为了在行走时不会摔倒或迷路,它需要准确地知道自己在哪里以及移动得有多快。这被称为里程计(Odometry)。
传统上,机器狗主要使用两种方式来确定这一点:
- “眼睛”(外感官): 摄像头和激光雷达(LiDAR)等观察世界的设备。这些设备很棒,但如果是在漆黑的夜晚、大雾天或者墙壁全是白色的情况下,机器人就会变成“盲人”。
- “内耳”(本体感觉): 位于机器人关节和身体内部的传感器,感知腿部的运动。它们永远不会变盲,但就像一个闭着眼睛走路的人:它们可以根据走了多少步来猜测自己的位置,但如果踩到冰面打滑或踩到石头,它们的猜测就会出错。
问题在于,将这两者结合起来通常需要一个非常困难且繁琐的人工“标定”过程。你必须精确地告诉机器人它的眼睛是如何相对于它的腿部定位的。如果你更换了机器人或移动了摄像头,你就必须重新进行那些复杂的数学计算。
论文的解决方案:一个“智能导师”系统
作者创建了一个类似于即插即用智能导师的系统。它是如何工作的,我们可以用简单的类比来说明:
1. “储水池”(记忆库)
系统并没有尝试编写复杂的数学公式来描述机器人的运动,而是使用了一个“储水池”(回声状态网络,Echo State Network)。你可以把它想象成一个巨大的、混沌的海绵,它吸收了机器人最近所有的运动信息(关节角度、速度、力量)。
- 工作原理: 你不需要训练这个海绵本身。它是预先构建好的,拥有随机的连接。它只是负责承载机器人所感受到的“历史记录”。
2. “读取器”(学生)
连接在这个海绵上的是一个简单的小型神经网络,称为读取器(Readout)。它的任务是观察海绵并说道:“基于所有这些感觉,我们正以每秒 2 米的速度移动。”
- 创新之处: 通常情况下,你需要这个“学生大脑”在实验室里进行离线训练。但这篇论文是在机器人实际行走时教导这个学生的。
3. “导师”(监督)
当机器人的“眼睛”(摄像头/激光雷达)工作良好时,它们充当导师的角色。
- 导师会说:“不对,我们实际的移动速度是每秒 2.1 米。”
- 学生大脑会倾听,将自己的猜测与导师的答案进行比较,并立即调整自己的内部权重,以尽可能接近真相。
- 关键点: 系统足够聪明,能够判断导师是否处于混乱状态(例如在黑暗中)。如果导师不可靠,系统就会忽略导师的纠正,让学生仅根据自己最好的猜测继续学习,而不会被错误的数据“责骂”。
4. “裁判”(切换管理器)
有一个裁判(切换管理器)在同时观察机器人的“内耳”(学生)和“眼睛”(导师)。
- 场景 A(光线充足): 裁判信任导师(眼睛)来引导机器人,并利用导师来教导学生。
- 场景 B(光线不足/黑暗): 裁判发现导师正在挣扎(摄像头失效了)。它会立即将机器人切换到依赖学生(习得的“内耳”模型)模式。
- 因为学生是在机器人行走时接受训练的,所以即使没有眼睛,它也已经学会了如何表现得异常精准。
为什么这很特别?
- 无需手动数学计算: 你不需要测量摄像头相对于腿部的精确位置。机器人会在运动过程中自行学习这种关系。
- 适用于任何机器狗: 无论是波士顿动力的 Spot 还是 Ghost Robotics 的 Vision 60,该系统都能立即投入使用。它不需要在模拟器中进行预训练。
- 具有韧性: 如果灯光熄灭或机器人走进一个没有任何特征的白色房间,眼睛会失效,但机器人不会崩溃。它会无缝切换到它的“内耳”模式,而这个模式已经在眼睛正常工作时得到了磨练。
实验结果
团队在两只真实的机器狗上测试了该系统:
- Spot: 他们在一个人工关闭“导师”(视觉)功能的测试集中进行了测试。机器人的“学生”大脑学习速度足够快,以至于即使在眼睛关闭时,机器人也能保持直线行走而不偏离航线。
- Vision 60: 他们把机器人带进了一栋真实的建筑,并在行走途中关掉了灯。基于摄像头的系统(导师)迷失了方向,机器人的路径发生了剧烈偏移。然而,新系统却能切换到它习得的“内耳”模式,并保持正确的路径,最终到达的目标点远比原系统更接近真实位置。
局限性
论文承认了一个大前提:如果眼睛和内耳同时失效,机器人就无法学习。 如果机器人处于全黑环境,且由于腿部在冰面上打滑得太厉害以至于传感器无法分辨差异,那么该系统将无法工作。它需要至少一个可靠的信号来防止“学生”大脑做出错误的猜测。
简而言之,这篇论文为机器狗提供了一种通过“感觉”来学习行走的方法,将眼睛仅作为临时的老师,以便在视觉失效时仍能继续前行。
技术摘要:基于极简外感知监督的在线鲁棒足式机器人里程计学习
问题陈述
鲁棒的足式机器人导航依赖于准确的里程计,这通常通过多传感器融合来实现。然而,传统方法面临着显著的部署障碍:
- 标定与建模复杂性: 融合本体感知(关节传感器、IMU)与外感知(摄像头、LiDAR)数据需要精细的传感器间标定以及针对特定平台的运动学建模。这些参数对机器人配置或传感器安装位置的变化非常敏感。
- 环境退化的脆弱性: 虽然工业级封装的外感知传感器能提供精确的跟踪,但在对抗性条件下(例如摄像头的低光照环境、LiDAR 的无特征环境)会失效。
- 本体感知的局限性: 纯本体感知方法依赖于手工设计的运动学和接触模型,在发生打滑、冲击、地形顺应性变化或负载变化时,这些模型性能会发生退化。
- 离线训练约束: 现有的基于学习的方法通常需要在代表性数据集上进行离线训练,这限制了它们在面对新硬件或动态环境时的适应能力,且无需预训练。
本文旨在解决开发一种即插即用、与平台无关的里程计系统的需求,该系统能够在极简监督下在线学习“本体感知到速度”的映射,从而消除显式标定或预训练的需求,并在外感知传感器失效时无缝切换回学习到的本体感知功能。
方法论
所提出的系统由两个主要部分组成:一个在线学习本体感知模块和一个鲁棒不变扩展卡尔曼滤波(InEKF)框架。
1. 基于低秩 EKF 的高效 ESN 本体感知
核心创新在于一个本体感知模块,它能够直接从带有噪声的关节级传感信号(位置、速度、转矩)中学习估计基座速度,而无需手工设计的模型。
- 回声状态网络(ESN)骨干: 为了避免在线训练循环权重的高昂计算成本,系统使用了 ESN。关节信号的历史信息通过固定的、随机初始化的循环动力学被压缩进储层状态(xt)中。这起到了本体感知历史的延迟嵌入作用。
- MLP 读取器: 一个多层感知器(MLP)利用权重 θ^t 将储层状态映射为基座速度(vtesn)。
- 基于低秩 EKF(LOFI)的在线训练: 作者没有使用随机梯度下降(SGD),因为 SGD 在处理流式数据中的不确定性量化和样本加权方面表现不佳,而是采用了一种滤波方法。
- 最优读取器参数 θt∗ 被视为通过随机游走演化的隐状态。
- 低秩 EKF 利用稀疏的外感知速度监督信号(vtsup)实时更新 MLP 权重。
- 该方法考虑了本体感知输入(储层协方差)和监督信号两者的不确定性。
- 使用低秩近似(LOFI)使得系统能够实时处理高维度的 MLP 权重(D≈8000+),保持了 O(D(L+C)) 的内存复杂度及 O(D(L+C)2) 的计算复杂度。
2. 基于鲁棒 InEKF 的足式机器人里程计
学习到的本体感知速度被集成到 InEKF 框架中,与 IMU 数据以及可选的外感知速度进行融合。
- 状态表示: 导航状态包括姿态、速度、位置和 IMU 偏差,通过捷联惯性导航模型进行传播。
- 自适应测量选择: 一个**切换管理器(Switching Manager)**动态地选择速度测量源:
- 外感知(VINS): 当视觉惯性系统可靠时使用。它同时也作为更新本体感知 MLP 的监督信号。
- 本体感知(ESN): 当 VINS 退化(如纹理缺失场景、光照变化)时使用。系统依赖于已通过可靠监督进行更新的学习模型。
- 不确定性处理: 切换逻辑通过监测 VINS 的健康状况(特征跟踪质量和协方差)以及 ESN 的协方差来工作。如果 VINS 被标记为“不可用”且 ESN 协方差较低,系统会将状态估计切换至学习到的本体感知速度,并停止 MLP 更新,以防止受到错误监督信号的干扰。
核心贡献
- 在线本体感知学习: 本文提出了首个将足式本体感知建模为 ESN 之上 MLP 读取器的方法,且该方法是在部署期间进行在线学习的。它不需要预训练,不需要手工设计的运动学/接触模型,并且可以迁移到任何配备本体感知传感器的足式机器人上。
- 用于神经训练的低秩 EKF: 作者利用低秩 EKF 在线训练 MLP 读取器权重。这种方法独特之处在于它能量化权重和输入的确定性,从而根据监督信号的质量实现自适应学习率,克服了标准 SGD 在流式设置下的局限性。
- 鲁棒 InEKF 框架: 提供了一个统一的里程计框架,能够最优地融合 IMU 数据与学习到的本体感知或外感知速度。该框架具备自适应切换策略,确保在外感知传感器失效时保持韧性,实现向在线学习模型的无缝回退。
实验结果
该方法在两个四足平台 Boston Dynamics Spot 和 Ghost Robotics Vision 60 上进行了验证。
Spot 数据集评估:
- 系统在多种序列(如 ATRIUM、BICORRIDOR、DOWNSTAIR)上进行了测试,监督窗口分别为 10s、30s 和 60s。
- 性能: 仅需 30 秒的监督,该方法就能学习到可靠的速度映射。在许多序列中,其表现与 GaRLILEO(外感知-本体感知基准)和 Leg-InEKF(离线标定基准)相当甚至更优,尽管它完全没有使用离线标定。
- 观察: 准确度随监督窗口的增加而提高。例外情况出现在 OVERPASS 序列中,即由于无监督运动分布(下楼梯)与监督分布(平地/上楼梯)存在差异,导致了漂移。这凸显了该模型无法超越其监督分布进行泛化的局限性。
Vision 60 真实世界部署:
- 在配备 Intel RealSense D435i 的建筑内进行测试,未进行外感知与机器人传感器之间的显式外参标定。
- 场景: 机器人穿越了视觉退化的区域,包括灯光熄灭的走廊,以及在旋转过程中灯光熄灭的盥洗室。
- 结果: 当 VINS 因缺乏视觉特征或光照变化而失效时,切换管理器成功检测到退化并切换到了学习到的本体感知模块。系统维持了准确的轨迹,而仅靠 VINS 的基准方法则出现了严重的漂移和过冲。
重要性与声明
本文声称展示了一个具有韧性的、与平台无关的里程计系统,该系统能够:
- 消除标定: 无需显式的外感知与本体感知间的标定或系统运动学建模,实现了在不同硬件上的“即插即用”部署。
- 适应对抗性条件: 通过在外感知传感器退化时无缝回退到在线学习的本体感知模型,保持鲁棒的运动估计。
- 高效在线学习: 证明了复杂的神经网络读取器可以通过低秩 EKF 在线实时训练,并能同时兼顾传感器输入和监督信号的不确定性。
承认的局限性:
作者谦虚地指出,该框架假设外感知和本体感知不会同时发生退化。此外,学习到的读取器 MLP 并不期望能泛化到与其速度监督分布显著不同的运动类型;对于未见过的运动类型进行预测会导致错误的估计。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。