Ontology-Grounded World Models for Failure Diagnosis and Closed-Loop Repair in Physical AI Systems
Cet article introduit Onto-EV-WM, une interface fondée sur une ontologie qui améliore les modèles de monde existants en suivant explicitement les prédicats de tâche non satisfaits et en les liant à des mécanismes de correction, atteignant ainsi des taux de réussite élevés dans le diagnostic et la réparation de défaillances en boucle fermée à travers divers benchmarks d'IA physique tels que LIBERO et PointMaze.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé technique : Onto-EV-WM pour le diagnostic de défaillance et la réparation en boucle fermée
1. Énoncé du problème
Les systèmes d'IA physique utilisant des modèles de monde (par exemple, EV-WM) prédisent des futurs candidats et les évaluent via des scores de vecteurs de caractéristiques ou d'événements. Cependant, ces scores scalaires ou vecteurs d'événements manquent souvent d'informations sémantiques explicites concernant la raison pour laquelle un candidat échoue. Plus précisément, ils ne consignent pas :
- Quel prédicat de tâche spécifique reste non satisfait (par exemple, une relation spatiale ou une contrainte d'articulation).
- Les arguments typés associés à la défaillance.
- Un label de routage indiquant quel mécanisme de correction doit être appliqué.
- Un résultat d'acceptation post-correction basé sur les prédicats de tâche natifs.
Par conséquent, bien qu'un système puisse identifier un candidat au score faible, il manque d'une interface structurée pour diagnostiquer la condition non satisfaite spécifique, assigner une stratégie de correction compatible et vérifier le résultat à l'aide d'un protocole en boucle fermée. L'article traite l'écart entre la prédiction de haute dimension et la vérification symbolique de la tâche, visant à fournir une interface explicite pour le diagnostic et la réparation sans remplacer le modèle de monde sous-jacent ou le contrôleur visuomoteur.
2. Méthodologie : Onto-EV-WM
Les auteurs proposent Onto-EV-WM, une interface de diagnostic et de correction à porte de vérification ancrée dans une ontologie, située en couche au-dessus de l'architecture EV-WM existante. Il ne s'agit pas d'un remplacement du modèle de monde, mais d'une couche symbolique qui gère le flux de la prédiction vers la correction.
2.1 Architecture et composants
Le système fonctionne via un pipeline structuré impliquant trois composants principaux :
- Couche d'enregistrement ontologique (TBox et ABox) :
- TBox (Task Box) : Définit un schéma local à la tâche incluant les types d'entités (ex: Objet, Région, Articulation), les signatures de prédicats (ex:
in_region,contact) et les contraintes de type. Elle sert de vocabulaire réutilisable pour la tâche spécifique. - ABox (Assertion Box) : Instancie l'état actuel. Le système construit trois ABoxes spécifiques à la provenance :
- : Les assertions requises compilées à partir de la spécification de tâche structurée ().
- : Les assertions ancrées à partir des sorties prédites du modèle de monde.
- : Les assertions ancrées directement à partir de l'état du simulateur.
- TBox (Task Box) : Définit un schéma local à la tâche incluant les types d'entités (ex: Objet, Région, Articulation), les signatures de prédicats (ex:
- Diagnostic et routage déterministes :
- Diagnostic () : Compare l'ABox requise () avec l'ABox observée/prédite. Il identifie les assertions non satisfaites (), préservant le prédicat spécifique, ses arguments typés et toute violation de marge continue. Cela génère un enregistrement de défaillance typé (ex:
relation_missing(plate, stove_front)). - Routage () : Une base de règles déterministes associe la défaillance typée à un "label de route" spécifique. Une route est un label de dispatch pour un mécanisme de correction compatible (ex: "pose d'articulation source", "prédicat de relation d'objet"), et non une action robotique directe.
- Diagnostic () : Compare l'ABox requise () avec l'ABox observée/prédite. Il identifie les assertions non satisfaites (), préservant le prédicat spécifique, ses arguments typés et toute violation de marge continue. Cela génère un enregistrement de défaillance typé (ex:
- Boucle de correction à porte de vérification :
- Génération de proposition : Un proposeur (appris, heuristique ou basé sur la planification) génère une correction basée sur l'enregistrement de défaillance et la route sélectionnée.
- Application : La correction est appliquée soit via une mutation directe de l'état du simulateur (ex: modification de $qpos$), soit par exécution médiée par le contrôleur.
- Vérification : Un vérificateur de tâche natif contrôle l'état résultant par rapport au prédicat de la tâche.
- Réessai borné : Si la vérification échoue, le système incrémente un budget de tentatives (), réancre l'état, et peut soit réessayer la même route, soit changer de route. La boucle se termine en cas de succès ou d'épuisement du budget.
2.2 Flux opérationnel
L'interface sépare la prédiction, l'ancrage, le diagnostic, l'application et la vérification.
- Entrée : Spécification de la tâche, tag de source (prédiction ou simulation) et état.
- Processus : Ancrage de l'état dans une ABox Diagnostic des prédicats manquants Assignation d'une route Génération de la correction Application Vérification.
- Sortie : Un état accepté, un candidat de planification conservé, ou une trace de défaillance typée non résolue.
3. Contributions clés
L'article apporte trois contributions techniques principales :
- Ontologie de tâche robotique opérationnelle : Une conception d'interface d'ancrage explicite qui représente les états prédits et observés par le simulateur comme des ABoxes distinctes et spécifiques à la tâche sous un vocabulaire et des contraintes de type partagés.
- Diagnostic et routage déterministes : Un système basé sur des règles qui préserve les prédicats violés et leurs arguments typés, les associant à des routes de correction spécifiques à la tâche sans perdre le contexte d'origine.
- Contrat de correction à porte de vérification : Un protocole qui enregistre le cycle de vie complet d'une tentative de correction (diagnostic, sélection de la route, proposition, mode d'application et acceptation par le prédicat natif) et impose un mécanisme de réessai borné.
4. Résultats expérimentaux
Les auteurs évaluent Onto-EV-WM à travers trois contextes de benchmark distincts en utilisant des protocoles de simulation.
4.1 PointMaze (Comparaison alignée)
- Configuration : Comparaison de planification en état aléatoire sur 50 essais entre EV-WM et Onto-EV-WM.
- Résultats : Les deux méthodes ont atteint un taux de succès de 94%. Cependant, Onto-EV-WM a obtenu une distance moyenne de l'état final nettement plus faible (0.61177) par rapport à EV-WM (0.90573), indiquant une plus grande précision dans la satisfaction des conditions de la tâche.
- Note : Une configuration séparée avec un budget de recherche plus large et une sélection prioritaire au succès a atteint 100 % de succès, mais n'est pas directement comparable au réglage aligné en raison des différences de budget.
4.2 LIBERO-Goal (Correction par fenêtre échantillonnée)
- Configuration : Évaluation sur 10 tâches de manipulation à l'aide de 4 graines d'échantillonnage d'évaluation. Le protocole échantillonne des fenêtres de démonstration de 25 étapes. Les corrections sont appliquées via un mécanisme appris de delta source/articulation $qpos$ fixe directement à l'état du simulateur.
- Résultats :
- Graine 0 : 93,8 % de succès de la fenêtre corrigée (469/500).
- Sur 4 graines : 94,05 ± 0,30 % de succès corrigé.
- Récupération : Sur 261 échecs de lecture, 142 ont été "sauvés" (54,4 %) par le mécanisme de correction.
- Contexte : L'ontologie fournit l'enregistrement de diagnostic liant l'échec à la tête de correction fixe ; la métrique rapportée reflète la configuration complète ancrée par l'ontologie.
4.3 LIBERO-Plus (Registre fixe)
- Configuration : Évaluation sur un registre fixe de 10 030 tâches de perturbation à travers quatre suites (LIBERO-10, Goal, Object, Spatial).
- Résultats :
- Succès global : 85,00 % (8 526/10 030 tâches).
- Répartition par suite :
- LIBERO-Goal : 91,39 %
- LIBERO-Object : 91,38 %
- LIBERO-Spatial : 91,38 %
- LIBERO-10 : 65,98 % (identifiée comme la suite avec le plus grand nombre d'échecs résiduels).
- Comparaison : La configuration Onto-EV-WM surpasse plusieurs bases, y compris DINO-WM + CEM (61,57 %) et diverses modèles VLA, bien que la comparaison soit systémique et n'isole pas la contribution causale de l'ontologie seule.
5. Signification et affirmations
L'article positionne Onto-EV-WM comme une interface de niveau système qui améliore les systèmes d'IA physique en ajoutant un raisonnement typé explicite au processus de diagnostic et de réparation des défaillances.
- Portée modeste : Les auteurs déclarent explicitement que les résultats ne constituent pas :
- Une récupération sur robot réel ou une validation sim-to-real.
- Un graphe de connaissances en monde ouvert général ou une ontologie robotique universelle.
- Une part causale de l'ontologie seule (les gains de performance sont attribués à la configuration complète).
- Une nouvelle classe de politique apprise remplaçant les contrôleurs existants.
- Valeur centrale : La signification réside dans la capacité d'enregistrer pourquoi une tâche a échoué (prédicats typés et arguments) et de structurer le processus de réparation (routes et vérification) de manière découplée du modèle de prédiction sous-jacent. Cela permet une réparation en "boucle fermée" au sein des protocoles de simulation où les portes de vérification filtrent l'acceptation des corrections.
- Limites : L'évaluation repose sur des protocoles basés sur la simulation. La "boucle fermée" fait référence à un cycle de vérification-réessai borné au sein du simulateur, et non à un contrôle de rétroaction en temps réel sur du matériel physique. Les résultats quantitatifs reflètent la performance du système intégré sous des protocoles spécifiques plutôt que l'efficacité isolée de l'ontologie.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.