技术摘要:RAPT —— 用于仿真到现实人形机器人部署的模型预测型分布外检测与故障诊断
问题陈述
将学习到的控制策略从仿真环境迁移到现实世界(Sim-to-Real)的部署过程中存在显著风险。在仿真中表现稳健的策略,在部署时可能会因为未建模动力学、传感器噪声、延迟、负载变化、地形变化或实现误差,而自信地进入分布外(OOD)状态。这些 OOD 事件可能导致“无声失败”、跌倒、自碰撞或硬件损坏。
现有的异常检测方法通常无法满足高频人形机器人控制(50 Hz)的特定约束:
- 计算成本: 不确定性和集成方法通常对于实时控制循环来说过于昂贵。
- 校准问题: 生成式模型(如 LSTM-VAE)可能存在似然度失校准和输入复杂度偏差的问题。
- 缺乏可解释性: 许多方法仅提供二进制的停止信号,无法提供关于执行何时、何处以及为何偏离标称行为的见解。
- 状态耦合: 通用的时间序列方法通常将本体感受通道视为独立信号,而非耦合的机器人状态。
方法论
本文介绍了 RAPT(循环异常概率轨迹模型,Recurrent Anomaly Probabilistic Trajectory Model),这是一种轻量级的、自监督的监控系统,旨在与预训练的控制策略并行运行。RAPT 分为四个阶段运行:
1. 标称数据采集
RAPT 从在大型仿真环境(NVIDIA Isaac Lab)中执行的专家策略所产生的标称本体感受轨迹中收集数据。这些轨迹定义了系统在部署期间必须保持的“标称行为流形”。观测值在训练前进行归一化处理。
2. 概率循环轨迹模型
RAPT 被训练为一个自监督循环重构模型。其架构包括:
- 残差状态编码器(Residual State Encoder): 处理观测历史。
- 基于 GRU 的时间桥接(GRU-based Temporal Bridge): 捕捉时间依赖性。
- 潜在瓶颈层(Latent Bottleneck): 压缩状态表示。
- 概率解码器(Probabilistic Decoder): 输出对角高斯重构分布 [μt,logσt2]。
该模型最小化标称观测值的负对数似然(NLL)。这种公式化方法捕捉了异方差偶然不确定性(heteroscedastic aleatoric uncertainty),允许具有自然更高变异性的维度拥有更大的预测方差,同时更严厉地惩罚一致性维度的偏差。对于速度跟踪任务,使用前向动力学变体(以 ot−1,at−1 为条件来预测 ot);否则,优先使用纯重构模式。
3. 仿真训练、部署校准的 OOD 检测
在部署时,RAPT 评估每个维度的预测偏差。为了处理 Sim-to-Real 差距,RAPT 支持两种校准模式:
- 仿真校准: 测量与仿真训练分布的偏差,使残余的 Sim-to-Real 不匹配变得可见。
- 现实世界校准: 使用一段经过验证的标称运行过程来适应静态偏移(传感器噪声、延迟、硬件动力学),从而能够检测相对于特定硬件的新 OOD 事件。
检测利用了分层门控机制:
- 局部门控(Local Gate): 检测异常大的单维度偏差(ℓt,i>τmax+5σi)。
- 全局门控(Global Gate): 检测平均预测偏差的广泛偏移(ℓˉt>τglobal+3σglobal)。
- 混合安全包络(Hybrid Safety Envelope): 可选地与确定性范围检测器配对。最终的异常决策是局部、全局和范围门控的逻辑或(OR)运算。
4. 故障定位与诊断
- 时间显著性(Temporal Saliency): 在检测到异常时,RAPT 通过循环模型中的集成梯度,计算最终 NLL 对历史窗口的梯度。这会产生一个时空归因图,突出显示何时以及哪些本体感受通道首先偏离了标称行为。
- 语义诊断: 多模态大语言模型(LLM)接收结构化证据(时间显著性摘要、关节运动学轨迹、任务上下文和视觉关键帧),以执行故障原因的零样本分类(例如碰撞、传感器故障、地形变化),而无需在检测器训练期间使用标记的故障数据。
核心贡献
- 仿真训练、部署校准的监控: RAPT 从大规模仿真中学习,并使用仿真或简短的现实世界数据校准阈值,支持用于调试和硬件时间 OOD 检测的功能。
- 针对高自由度人形机器人的低误报率 OOD 检测: 通过使用经过校准的单维度和全局门的概率预测偏差建模,RAPT 在严格的假阳性率(FPR)约束下优于高频兼容的基准方法。
- 提供用于故障诊断的局部证据: 系统生成单维度 NLL 信号和时间显著性,从而实现无需故障数据标签的后验语义故障诊断。
实验结果
作者在 NVIDIA Isaac Lab 和物理硬件上对 Unitree G1 人形机器人进行了验证。
- 仿真性能: 在四项任务(速度跟踪、动作模仿、弹道投掷)和 15 类 OOD 类别中,在 0.5% 的回合级假阳性率(FPR)下,RAPT 比最强的基准方法将真阳性率(TPR)提高了 37%。
- 硬件性能: 在物理 Unitree G1 上进行的 78 次试验中,RAPT 实现了 89% 的 TPR,且比高频兼容的基准方法具有更少的误报。
- 诊断准确性: 在具有挑战性的 OOD 子集上,通过零样本 LLM 方法,RAPT 在 21 个故障类别中实现了 75% 的语义故障诊断准确率。
- 延迟: 监控流水线的运行时间约为 1.6ms,兼容 50 Hz 控制循环。
意义与主张
论文将 RAPT 定位为并非替代领域随机化或系统辨识,而是作为监测在迁移后仍然存在的残余不匹配和不可预见的 OOD 事件的补充层。
- 安全性与调试: RAPT 提供了一个可观测的部署时信号,用于安全监控和调试,而无需修改底层控制器。一旦检测到 OOD,它会触发预定义的安全响应(例如安全停止、受控跌落、恢复)。
- 可解释性: 通过超越二进制停止信号,转向局部、单维度证据和语义推理,RAPT 解决了学习策略中“黑盒”性质的故障问题,允许操作员区分外部扰动、执行器退化和传感器故障。
- 可复现性: 作者承诺发布训练流水线、标记的现实世界数据集以及 C++ 部署代码,以支持未来的基准测试。
这项工作证明,轻量级的自监督概率模型可以有效地弥合仿真与现实之间的差距,既能提供即时的安全干预,也能提供后验诊断见解,适用于复杂的人形机器人系统。