Résumé Technique : RAPT – Détection de l'Hors-Distribution Prédictive par Modèle et Diagnostic de Défaillance pour le Déploiement de Humanoïdes Sim-to-Real
Énoncé du Problème
Le déploiement de politiques de contrôle apprises pour des robots humanoïdes de la simulation vers la réalité (Sim-to-Real) comporte un risque significatif. Des politiques qui semblent robustes en simulation peuvent entrer avec assurance dans des états hors-distribution (OOD - Out-of-Distribution) lors du déploiement en raison de dynamiques non modélisées, du bruit des capteurs, de la latence, des changements de charge utile, des variations de terrain ou des erreurs d'implémentation. Ces événements OOD peuvent entraîner des « échecs silencieux », des chutes, des auto-collisions ou des dommages matériels.
Les méthodes de détection d'anomalies existantes échouent souvent à répondre aux contraintes spécifiques du contrôle de haut niveau des humanoïdes (50 Hz) :
- Coût Computationnel : L'incertitude et les méthodes d'ensemble sont souvent trop coûteuses pour les boucles de contrôle en temps réel.
- Problèmes de Calibrage : Les modèles génératifs (ex: LSTM-VAE) peuvent souffrir d'un mauvais calibrage de la vraisemblance et d'un biais de complexité d'entrée.
- Manque d'Interprétabilité : De nombreuses approches ne fournissent qu'un signal d'arrêt binaire, n'offrant aucune indication sur quand, où ou pourquoi l'exécution a dévié du comportement nominal.
- Couplage d'États : Les méthodes de séries temporelles génériques traitent souvent les canaux proprioceptifs comme des signaux indépendants plutôt que comme des états de robot couplés.
Méthodologie
Le papier présente RAPT (Recurrent Anomaly Probabilistic Trajectory Model), un système de surveillance léger et auto-supervisé conçu pour fonctionner parallèlement à une politique de contrôle pré-entraînée. RAPT opère en quatre étapes :
1. Collecte de Données Nominales
RAPT collecte des trajectoires proprioceptives nominales issues de politiques expertes exécutées dans une simulation à grande échelle (NVIDIA Isaac Lab). Ces trajectoires définissent la « variété du comportement nominal » (nominal behavior manifold) que le système doit préserver pendant le déploiement. Les observations sont normalisées avant l'entraînement.
2. Modèle de Trajectoire Récurrent Probabiliste
RAPT est entraîné comme un modèle de reconstruction récurrent auto-supervisé. L'architecture comprend :
- Encodeur d'État Résiduel : Traite l'historique des observations.
- Pont Temporel basé sur GRU : Capture les dépendances temporelles.
- Goulot d'Étranglement Latent : Compresse la représentation de l'état.
- Décodeur Probabiliste : Produit une distribution de reconstruction gaussienne diagonale [μt,logσt2].
Le modèle minimise la Négative Log-Vraisemblance (NLL) des observations nominales. Cette formulation capture l'incertitude aléatoire hétéroscédastique, permettant aux dimensions ayant naturellement une plus grande variabilité d'avoir une variance prédictive plus élevée, tout en pénalisant plus lourdement les déviations dans les dimensions constantes. Pour les tâches de suivi de vitesse, une variante de dynamique directe (conditionnée sur ot−1,at−1 pour prédire ot) est utilisée ; sinon, la reconstruction pure est préférée.
3. Détection OOD Entraînée en Simulation et Calibrée au Déploiement
Lors du déploiement, RAPT évalue les déviations prédictives par dimension. Pour gérer l'écart Sim-to-Real, RAPT prend en charge deux modes de calibrage :
- Calibrage en Simulation : Mesure les déviations par rapport à la distribution entraînée en simulation, rendant visibles les écarts résiduels Sim-to-Real.
- Calibrage en Monde Réel : Utilise une brève exécution nominale vérifiée pour s'adapter aux décalages statiques (bruit des capteurs, latence, dynamique du matériel), permettant la détection de nouveaux événements OOD relatifs au matériel spécifique.
La détection utilise un mécanisme de porte hiérarchique :
- Porte Locale : Détecte des déviations par dimension anormalement grandes (ℓt,i>τmax+5σi).
- Porte Globale : Détecte des décalages larges dans la déviation moyenne prédictive (ℓˉt>τglobal+3σglobal).
- Enveloppe de Sécurité Hybride : Optionnellement couplée à un détecteur de plage déterministe. La décision d'anomalie finale est le OU logique des portes locale, globale et de plage.
4. Localisation de Défaillance et Diagnostic
- Saliance Temporelle : Lors d'une détection d'anomalie, RAPT calcule les gradients de la NLL finale par rapport à une fenêtre d'historique via des gradients intégrés à travers le modèle récurrent. Cela produit une carte d'attribution spatio-temporelle, mettant en évidence quand et quels canaux proprioceptifs ont d'abord dévié du comportement nominal.
- Diagnostic Sémantique : Un Grand Modèle de Langage (LLM) multimodal reçoit des preuves structurées (résumés de saillance temporelle, trajectoires cinématiques articulaires, contexte de la tâche et images clés visuelles) pour effectuer une classification zero-shot des causes de défaillance (ex: collisions, défauts de capteurs, changements de terrain) sans nécessiter de données de défaillance étiquetées lors de l'entraînement du détecteur.
Contributions Clés
- Surveillance Entraînée en Simulation et Calibrée au Déploiement : RAPT apprend à partir de la simulation à grande échelle et calibre les seuils en utilisant soit la simulation, soit de brèves données du monde réel, supportant ainsi le débogage et la détection OOD du matériel.
- Détection OOD à Faible Taux de Faux Positifs pour Humanoïdes à Haut Degré de Liberté : En utilisant une modélisation de déviation prédictive probabiliste avec des portes calibrées par dimension et globales, RAPT surpasse les bases comparables compatibles haute fréquence sous des contraintes strictes de taux de faux positifs.
- Évidence Localisée pour le Diagnostic de Défaillance : Le système génère des signaux NLL par dimension et une saillance temporelle, permettant un diagnostic sémantique post-hoc des modes de défaillance sans données de défaillance étiquetées.
Résultats Expérimentaux
Les auteurs ont validé RAPT sur un humanoïde Unitree G1, à la fois dans NVIDIA Isaac Lab et sur du matériel physique.
- Performance en Simulation : À travers quatre tâches (suivi de vitesse, mimétisme de mouvement, lancer balistique) et 15 catégories OOD, RAPT a amélioré le Taux de Vrais Positifs (TPR) de 37 % par rapport à la meilleure base de référence à un Taux de Faux Positifs (FPR) par épisode de 0,5 %.
- Performance Matérielle : Sur un Unitree G1 physique à travers 78 essais, RAPT a atteint un TPR de 89 % avec moins de faux positifs que les bases comparables haute fréquence.
- Précision du Diagnostic : Sur un sous-ensemble OOD difficile, RAPT a atteint une précision de diagnostic de défaillance sémantique de 75 % à travers 21 catégories de défaillance en utilisant l'approche LLM zero-shot.
- Latence : Le pipeline de surveillance opère à environ 1,6 ms, ce qui est compatible avec les boucles de contrôle à 50 Hz.
Signification et Revendications
Le papier positionne RAPT non pas comme un remplacement pour la randomisation de domaine ou l'identification de système, mais comme une couche complémentaire qui surveille le décalage résiduel et les événements OOD imprévus qui persistent après le transfert.
- Sécurité et Débogage : RAPT fournit un signal observable de déploiement pour la surveillance de la sécurité et le débogage sans modifier le contrôleur sous-jacent. Il déclenche des réponses de sécurité prédéfinies (ex: arrêt sécurisé, chute contrôlée, récupération) lors de la détection OOD.
- Interprétabilité : En allant au-delà des signaux d'arrêt binaires grâce à des évidences localisées par dimension et au raisonnement sémantique, RAPT répond à la nature de « boîte noire » des échecs dans les politiques apprises, permettant aux opérateurs de distinguer entre perturbations externes, dégradation des actionneurs et défauts de capteurs.
- Reproductibilité : Les auteurs s'engagent à publier le pipeline d'entraînement, les jeux de données du monde réel étiquetés et le code de déploiement en C++ pour soutenir les futurs benchmarks.
Ce travail démontre qu'un modèle probabiliste léger et auto-supervisé peut efficacement combler le fossé entre la simulation et la réalité, offrant à la fois des interventions de sécurité immédiates et des analyses diagnostiques post-hoc pour les systèmes humanoïdes complexes.