想象一下,一只四足机器人在杂乱的公园里奔跑。它必须弄清楚自己的身体究竟在哪里、移动速度有多快以及面向哪个方向,而与此同时,它的脚还在泥地里打滑、踩在松动的岩石上,或者正跳向空中。
这篇论文介绍了一种用于这些机器人的新型“大脑”,名为 GAIT。它的主要任务是帮助机器人仅通过体内的传感器(就像人类在不看地图的情况下也能知道自己在跑步一样)来理解自身的运动。
以下是通过简单的类比对这种新方法进行的解释:
1. 旧的方法:“奶昔”问题
以前,机器人的大脑会将所有的传感器数据——身体旋转的速度、腿部移动的速度以及关节弯曲的位置——全部混合在一起,变成一个巨大的“奶昔”(一组单一的数字列表)。
- 缺陷: 如果一只脚在石头上打滑,机器人的大脑就会感到困惑,因为它无法分辨这个“奶昔”中哪一部分是“打滑”,哪一部分是“真实的运动”。它会将打滑的脚与稳固的脚混为一谈,从而导致错误的判断。
2. 新的方法:“评审团”
新的 GAIT 方法不会将所有东西混合在一起。相反,它将每一个传感器读数视为一个独立的个体标记(Token),就像评审团上的每一位不同的法官。
- 惯性标记(Inertial Tokens): 这些是“平衡法官”(感知旋转和震动的传感器)。
- 腿部标记(Leg Tokens): 这些是“足部法官”(告知每只特定腿位置的传感器)。
3. “注意力机制”:聪明的协调员
神奇之处在于注意力机制(Attention Mechanism)。你可以把它想象成坐在评审团前的一位聪明的协调员。
- 它是如何工作的: 协调员观察当前的情况。
- 如果一只脚稳稳地踩在地面上,协调员会说:“仔细听这位足部法官的!他们现在非常可靠。”
- 如果一只脚正在打滑或处于空中,协调员会说:“暂时忽略那位足部法官吧;他们在误导我们。让我们多听听平衡法官的意见。”
- 结果: 机器人学会了实时重新分配自身感官的权重。它不需要一个单独的程序来告诉它“你的脚正在打滑”。网络学会了自行判断:“哦,这条腿的数据看起来不太可靠,所以我应该更多地信任身体传感器。”
4. 从一种步态的学习到精通多种步态
研究人员通过一个模拟环境训练了这个机器人大脑,在这个环境中,机器人只学习了小跑(Trot)(一种特定的两拍行走模式)。
- 测试: 然后,他们将机器人带入现实世界,并让它尝试从未见过的运动模式,比如跃步(Bounding)(奔跑式跳跃)或跳跃(Pronking)(四肢同时上下跳动)。他们还把它放在了“碎石地形”(松动的岩石和木头)上,而这些地形在训练模拟中并不存在。
- 结果: 尽管它只练习过小跑,但这个全新的“评审团”大脑足够聪明,能够应对新的步态和湿滑的岩石。它的表现优于那些依赖僵化数学公式或其他在面对新情况时会产生混乱的学习型方法。
5. 为什么这很重要
- 无需“打滑检测器”: 旧的方法需要专门的传感器或复杂的数学检查来识别脚是否在打滑。而这种新方法通过关注哪些传感器是值得信赖的,从而自主学习这种行为。
- 在现实世界中表现更好: 因为它学会了动态地权衡自身的感官,所以当地面发生变化或机器人开始尝试新的运动方式时,它不会崩溃或迷失方向。
总结: 这篇论文展示了一个充当智能团队领袖的机器人大脑。它不再盲目地平等对待所有感官,而是不断地询问:“我现在可以信任谁?”并据此调整注意力,使其能够在崎岖不平的地面上以及从未练习过的行走风格下自信奔跑。
技术摘要:GAIT:基于惯性-腿部 Token 注意力的足式机器人本体感受状态估计
问题陈述
准确且鲁棒的本体感受状态估计对于足式机器人的运动控制至关重要,特别是在由于光照或几何限制导致视觉/激光雷达等外部感知传感器失效的环境中。虽然现有的基于学习的状态估计器在应对滑动方面比启发式基于模型的方法有所改进,但它们在部署到未见地形或步态模式时往往表现出泛化能力差的问题。这种局限性源于标准架构通常将所有传感器测量值拼接成一个单一的扁平向量,迫使网络在没有显式结构机制来区分接触与非接触腿的情况下,隐式地学习运动学测量的变化可靠性。因此,这些模型往往会过拟合于训练期间观察到的特定接触模式,并在面对分布偏移(如打滑或未建模的地形)时性能下降。
方法论
本文提出了 GAIT,一种基于注意力的本体感受状态估计框架,该框架通过在网络架构中引入归纳偏置(inductive biases)来处理与接触相关的测量可靠性。该系统由两个主要部分组成:
带有 IL Tokenization 的基于注意力的状态估计网络:
- 惯性-腿部 (IL) Tokenization: 不同于将输入扁平化,该网络将惯性测量(IMU)和腿部运动学测量(关节位置、速度和跟踪误差)表示为独立的 Token。具体而言,它为每条腿和惯性传感器分别创建了独立的 Token。
- 架构: 网络利用带有交叉注意力的 Perceiver IO 编码器。潜在 Token(latent tokens)查询输入 Token(惯性及腿部测量),以根据当前状态学习每个测量的相对重要性。这使得网络能够根据足端是否接触地面,自适应地重新加权腿部运动学测量,而无需显式的接触估计器。
- 时序建模: Token 化后的输入通过 2D 位置嵌入(覆盖“IL 轴”和“历史轴”)进行处理,并传递给门控循环单元(GRU)以捕捉时序依赖关系。
- 输出: 网络预测机体坐标系下的线速度 (vˉB) 及其关联的不确定度 (uˉ),不确定度被参数化为一个对角协方差矩阵。
- 训练策略: 采用两阶段损失函数。首先使用平均绝对误差(MAE)以保证稳定性,随后使用高斯极大似然损失来联合训练速度预测及其不确定度。训练数据是在仿真环境(RaiSim)中使用 Unitree Go1 机器人生成的,且仅使用 Trot 步态数据。值得注意的是,训练期间仅在 IMU 测量值中添加高斯噪声,以防止滤波器传播与更新之间的相关性问题。
不变扩展卡尔曼滤波器 (IEKF):
- 预测的机体线速度及其不确定度被集成到 IEKF 中,作为伪测量值。
- 与传统的接触辅助型 IEKF 不同,该方法不依赖于显式的接触估计或基于静态接触假设的零速度更新。相反,它将网络的速度预测视为右不变观测,使滤波器即使在接触假设被违反(例如打滑)时也能鲁棒运行。
核心贡献
- IL Tokenization: 引入了一种 Token 化架构,将惯性测量与腿部测量分离,为表示接触相关的测量可靠性变化提供了归纳偏置。
- 接触无关学习: 该方法能够学习根据接触条件重新加权测量值,而无需依赖显式的接触估计器或启发式的滑动抑制机制。
- 不确定度感知集成: 网络联合预测速度与不确定度,从而能够在卡尔曼滤波框架内更可靠地集成学习到的伪测量值。
- 泛化能力: 尽管仅在模拟的 Trot 步态下进行训练,该框架在面对未见步态模式(Bound, Pace, Pronk)和未建模地形(碎石)时仍展现出了鲁棒性。
实验结果
实验在 Unitree Go1 机器人在多种地形上进行,包括橡胶、光滑表面(硼酸粉末)以及未建模的碎石地形。系统在训练步态(Trot)和未见步态(Bound, Pace, Pronk)上进行了测试。
- 速度预测: 在大多数地形下,所提方法在机体坐标系线速度预测的均方根误差(RMSE)方面优于基准学习型方法(NMN)和基于模型的 IEKF。特别是在未建模的碎石地形上,该方法优于“无 IL Token”变体,表明 Tokenization 有助于处理未建模的接触几何形状。
- 状态估计: 当集成到 IEKF 中时,与接触辅助型 IEKF 及其他学习型基准相比,该框架降低了位置和速度的绝对轨迹误差(ATE)和相对误差(RE)。“无 IL Token”变体的位移漂移显著更高(平均 REpos 大了 73.6%),凸显了 Tokenization 方案的重要性。
- 对未见步态的泛化: 虽然仅针对 Trot 步态进行训练,但在测试 Bound、Pace 和 Pronk 步态时,所提网络的预测误差仍低于基准方法。相比之下,其他学习型基准在这些未见步态条件下的误差比基于模型的 IEKF 更大。
- 注意力分析: 注意力权重可视化显示,网络能够动态调整关注点。在腾空阶段(例如 Pronk 步态中),注意力转向惯性 Token(特别是加速度计),且预测的不确定度增加,正确反映了腿部运动学观测性的丧失。在接触阶段,注意力则适当地加权腿部 Token。
意义与主张
本文主张,将结构先验(归纳偏置)引入神经网络架构是提高学习型状态估计器泛化能力的有效策略。通过通过 Tokenization 显式建模接触条件与测量可靠性之间的结构关系,所提方法实现了与基于模型的方法相当甚至更好的鲁棒性,且无需显式的接触估计或启发式调优。结果表明,该框架可以有效处理由未见地形和步态模式引起的分布偏移,使其成为复杂现实环境中足式机器人实现高频、可靠本体感受反馈的可行方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。