Resumen Técnico: RAPT – Detección de Fuera de Distribución y Diagnóstico de Fallos Basado en Predicción de Modelos para el Despliegue de Humanoides de Simulación a Realidad
Declaración del Problema
El despliegue de políticas de control aprendidas para robots humanoides desde la simulación a la realidad (Sim-to-Real) conlleva un riesgo significativo. Las políticas que parecen robustas en simulación pueden entrar con confianza en estados fuera de la distribución (OOD, por sus siglas en inglés) tras el despliegue debido a dinámicas no modeladas, ruido de sensores, latencia, cambios de carga, variaciones de terreno o errores de implementación. Estos eventos OOD pueden provocar "fallos silenciosos", caídas, auto-colisiones o daños en el hardware.
Los métodos de detección de anomalías existentes suelen no cumplir con las restricciones específicas del control de humanoides de alta frecuencia (50 Hz):
- Costo Computacional: Los métodos de incertidumbre y de ensambles (ensembles) suelen ser demasiado costosos para los bucles de control en tiempo real.
- Problemas de Calibración: Los modelos generativos (p. ej., LSTM-VAEs) pueden sufrir de mala calibración de la verosimilitud y sesgo de complejidad de entrada.
- Falta de Interpretabilidad: Muchos enfoques solo proporcionan una señal binaria de parada, sin ofrecer información sobre cuándo, dónde o por qué la ejecución se desvió del comportamiento nominal.
- Acoplamiento de Estados: Los métodos genéricos de series temporales suelen tratar los canales propioceptivos como señales independientes en lugar de estados acoplados del robot.
Metodología
El artículo presenta RAPT (Recurrent Anomaly Probabilistic Trajectory Model), un sistema de monitoreo ligero y auto-supervisado diseñado para ejecutarse junto a una política de control pre-entrenada. RAPT opera en cuatro etapas:
1. Recolección de Datos Nominales
RAPT recolecta trayectorias propioceptivas nominales de políticas expertas ejecutadas en una simulación a gran escala (NVIDIA Isaac Lab). Estas trayectorias definen el "manifold de comportamiento nominal" que el sistema debe preservar durante el despliegue. Las observaciones se normalizan antes del entrenamiento.
2. Modelo de Trayectoria Recurrente Probabilístico
RAPT se entrena como un modelo de reconstrucción recurrente auto-supervisado. La arquitectura incluye:
- Codificador de Estado Residual: Procesa el historial de observaciones.
- Puente Temporal basado en GRU: Captura dependencias temporales.
- Cuello de Botella Latente: Comprime la representación del estado.
- Decodificador Probabilístico: Produce una distribución de reconstrucción gaussiana diagonal [μt,logσt2].
El modelo minimiza la Log-Verosimilitud Negativa (NLL) de las observaciones nominales. Esta formulación captura la incertidumbre aleatoria heterocedástica, permitiendo que las dimensiones con variabilidad naturalmente más alta tengan una varianza predictiva mayor, mientras penaliza más severamente las desviaciones en dimensiones consistentes. Para tareas de seguimiento de velocidad, se utiliza una variante de dinámica hacia adelante (condicionada en ot−1,at−1 para predecir ot); de lo contrario, se prefiere la reconstrucción pura.
3. Detección OOD Entrenada en Simulación y Calibrada en Despliegue
En el despliegue, RAPT evalúa las desviaciones predictivas por dimensión. Para manejar la brecha Sim-to-Real, RAPT soporta dos modos de calibración:
- Calibración de Simulación: Mide las desviaciones respecto a la distribución entrenada en simulación, haciendo visibles los desajustes residuales de Sim-to-Real.
- Calibración en el Mundo Real: Utiliza una breve ejecución nominal verificada para adaptarse a desfases estáticos (ruido de sensores, latencia, dinámica del hardware), permitiendo la detección de nuevos eventos OOD relativos al hardware específico.
La detección utiliza un mecanismo de compuerta jerárquica:
- Compuerta Local: Detecta desviaciones por dimensión inusualmente grandes (ℓt,i>τmax+5σi).
- Compuerta Global: Detecta cambios amplios en la desviación media predictiva (ℓˉt>τglobal+3σglobal).
- Envolvente de Seguridad Híbrida: Opcionalmente emparejada con un detector de rango determinista. La decisión final de anomalía es el OR lógico de las compuertas local, global y de rango.
4. Localización de Fallos y Diagnóstico
- Saliencia Temporal: Tras la detección de una anomalía, RAPT calcula los gradientes de la NLL final con respecto a una ventana de historial mediante gradientes integrados a través del modelo recurrente. Esto produce un mapa de atribución espacio-temporal, resaltando cuándo y qué canales propioceptivos se desviaron primero del comportamiento nominal.
- Diagnóstico Semántico: Un Modelo de Lenguaje de Gran Escala (LLM) multimodal recibe evidencia estructurada (resúmenes de saliencia temporal, trayectorias cinemáticas articulares, contexto de la tarea y fotogramas clave visuales) para realizar una clasificación zero-shot de las causas de fallo (p. ej., colisiones, fallos de sensores, cambios de terreno) sin requerir datos de fallos etiquetados durante el entrenamiento del detector.
Contribuciones Clave
- Monitoreo Entrenado en Simulación y Calibrado en Despliegue: RAPT aprende de la simulación a gran escala y calibra los umbrales utilizando tanto simulación como breves datos del mundo real, apoyando tanto la depuración como la detección OOD de hardware en tiempo real.
- Detección OOD de Baja Tasa de Falsos Positivos para Humanoides de Altos Grados de Libertad: Al utilizar el modelado de desviación predictiva probabilística con compuertas calibradas por dimensión y globales, RAPT supera a los baselines compatibles con alta frecuencia bajo estrictas restricciones de falsos positivos.
- Evidencia Localizada para el Diagnóstico de Fallos: El sistema genera señales de NLL por dimensión y saliencia temporal, permitiendo el diagnóstico semántico post-hoc de los modos de fallo sin necesidad de datos de fallos etiquetados.
Resultados Experimentales
Los autores validaron RAPT en un humanoide Unitree G1 tanto en NVIDIA Isaac Lab como en hardware físico.
- Rendimiento en Simulación: A través de cuatro tareas (seguimiento de velocidad, mímica de movimiento, lanzamiento balístico) y 15 categorías OOD, RAPT mejoró la Tasa de Verdaderos Positivos (TPR) en un 37% respecto al baseline más fuerte con una Tasa de Falsos Positivos (FPR) por episodio del 0.5%.
- Rendimiento en Hardware: En un Unitree G1 físico a través de 78 ensayos, RAPT logró una TPR del 89% con menos falsos positivos que los baselines compatibles con alta frecuencia.
- Precisión del Diagnóstico: En un subconjunto desafiante de OOD, RAPT alcanzó una precisión de diagnóstico de fallo semántico del 75% a través de 21 categorías de fallo utilizando el enfoque de LLM zero-shot.
- Latencia: El pipeline de monitoreo opera aproximadamente a 1.6ms, compatible con bucles de control de 50 Hz.
Significado y Reivindicaciones
El artículo posiciona a RAPT no como un reemplazo para la aleatorización de dominios o la identificación de sistemas, sino como una capa complementaria que monitorea el desajuste residual y los eventos OOD imprevistos que persisten tras la transferencia.
- Seguridad y Depuración: RAPT proporciona una señal observable de despliegue para el monitoreo de seguridad y depuración sin modificar el controlador subyacente. Activa respuestas de seguridad predefinidas (p. ej., parada segura, caída controlada, recuperación) tras la detección de OOD.
- Interpretabilidad: Al ir más allá de las señales binarias de parada hacia la evidencia localizada por dimensión y el razonamiento semántico, RAPT aborda la naturaleza de "caja negra" de los fallos en las políticas aprendidas, permitiendo a los operadores distinguir entre perturbaciones externas, degradación de actuadores y fallos de sensores.
- Reproducibilidad: Los autores se comprometen a liberar el pipeline de entrenamiento, los conjuntos de datos del mundo real etiquetados y el código de despliegue en C++ para apoyar futuros benchmarks.
El trabajo demuestra que un modelo probabilístico ligero y auto-supervisado puede cerrar eficazmente la brecha entre la simulación y la realidad, ofreciendo tanto intervenciones de seguridad inmediata como conocimientos diagnósticos post-hoc para sistemas humanoides complejos.