← Derniers articles
💻 computer science

EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees

Ce document introduit EvoPlan, un cadre neuro-symbolique qui intègre la recherche évolutionnaire pour extraire des contraintes spatio-temporelles à partir de démonstrations et les combine avec un planificateur PDDL évolutionnaire et une boucle d'exécution contrainte afin de permettre aux robots basés sur les LLM de générer des plans sûrs et exécutables avec des garanties formelles dans des environnements ouverts.

Auteurs originaux : Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

Publié 2026-07-09
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot à naviguer dans un monde agité, comme un robot de livraison dans une usine ou une voiture autonome dans une ville. Vous disposez de deux outils principaux pour l'aider, mais les deux présentent un défaut majeur :

  1. Le « Écrivain Créatif » (IA/LLM) : C'est une IA intelligente capable de lire vos instructions (« Allez à la cafétéria ») et de concevoir un plan ingénieux. Elle est excellente pour comprendre le contexte et corriger les erreurs. Le problème : Elle est un peu imprudente. Elle peut concevoir un plan qui semble bon, mais qui est physiquement impossible, ou elle pourrait accidentellement brûler un feu rouge parce qu'elle n'a pas « réfléchi » aux règles.
  2. Le « Comptable Rigide » (Planificateurs Classiques) : C'est un système rigide, basé sur des règles. Il ne fonctionne que si vous lui donnez une description mathématique parfaite du monde. Le problème : Il est incapable de comprendre le langage naturel ou de corriger ses propres erreurs. Si le monde change légèrement, il se fige.

EvoPlan est un nouveau cadre qui combine le meilleur des deux mondes. Il utilise l'« Écrivain Créatif » pour imaginer des plans et le « Comptable Rigide » pour s'assurer qu'ils sont sûrs et exécutables. Voici comment cela fonctionne, décomposé en trois étapes simples :

1. Le « Coach de l'Ombre » (Apprendre les règles)

Avant même que le robot ne bouge, le système doit apprendre les « règles non écrites » de la route ou de l'usine.

  • Le Problème : Les chercheurs ne possèdent que des vidéos de bons comportements (des conducteurs conduisant en toute sécurité ou des gens marchant poliment). Ils n'ont pas de vidéos de mauvais comportements pour montrer au robot ce qu'il ne faut pas faire.
  • La Solution : Le système agit comme un coach d'écriture créative. Il prend une vidéo d'une conduite exemplaire et demande à l'IA : « Et si le conducteur accélérait ? Et s'il brûlait un feu rouge ? » Il invente ces scénarios « mauvais » (contrefactuels) pour créer un contraste.
  • Le Résultat : En comparant les « bonnes » vidéos à celles des scénarios inventés « mauvais », le système apprend un manuel de règles unique et universel (appelé une contrainte STL). Considérez cela comme un « Coach de l'Ombre » qui murmure à l'oreille du robot : « Ne dépasse jamais la vitesse X », ou « Reste toujours à une distance de Y mètres des gens ». Ce manuel de règles s'applique à chaque mouvement du robot.

2. L'« Éditeur Évolutif » (Construire le plan)

Maintenant, le robot doit établir un plan pour aller du point A au point B.

  • Le Processus : L'« Écrivain Créatif » (l'IA) propose un plan. Mais au lieu de l'accepter tel quel, le système le soumet à un processus d'édition rigoureux.
  • La Boucle :
    1. L'IA écrit un projet de plan.
    2. Un « Validateur » (le comptable) le vérifie. Si le plan est défectueux (ex : « Vous ne pouvez pas ouvrir une porte qui n'existe pas »), le validateur signale l'erreur spécifique.
    3. L'IA lit l'erreur, corrige cette partie spécifique, et réessaie.
    4. Cela se répète de nombreuses fois, comme un écrivain qui peaufine une histoire jusqu'à ce qu'elle soit parfaite.
  • La Magie : Le système conserve les « bonnes parties » du plan qui ont déjà été vérifiées et ne réécrit que les parties défectueuses. Au fil du temps, le plan devient plus long et plus fiable jusqu'à ce qu'il soit entièrement valide.

3. Le « Gardien de la Sécurité » (Exécution en temps réel)

Enfin, le robot commence à se déplacer. C'est là que le « Coach de l'Ombre » et le « Gardien de la Sécurité » prennent le relais.

  • La Vérification : Le robot n'exécute pas son plan aveuglément. Avant de faire un seul pas (ou de tourner une roue), le système vérifie ce mouvement spécifique par rapport au manuel de règles appris à l'étape 1.
  • Le Filet de Sécurité :
    • Scénario A : Le robot prévoit de tourner à gauche. Le Gardien vérifie : « Y a-t-il un piéton là ? La vitesse est-elle sûre ? » Oui. Le robot avance.
    • Scénario B : Le robot prévoit de tourner à gauche. Le Gardien vérifie : « Attendez, un piéton est trop proche ! » Non. Le robot s'arrête immédiatement.
  • La Reprogrammation : Si le Gardien dit « Non », le robot ne s'écrase pas. Il verrouille toutes les étapes sûres qu'il a déjà accomplies, met à jour sa position actuelle, et demande à l'« Éditeur Évolutif » d'écrire un nouveau plan pour le reste du voyage.

Pourquoi cela importe

L'article démontre que ce système fonctionne mieux qu'en utilisant uniquement l'IA ou uniquement les règles.

  • En Conduite : Lors de tests sur des données de conduite, le système a considérablement réduit les collisions et les infractions aux feux rouges sans nécess avoir besoin de réentraîner l'IA du conducteur. Il a simplement ajouté un « garde-fou » qui empêche les mauvaises actions.
  • En Navigation : Lors de tests dans des puzzles complexes en monde ouvert (comme trouver des objets dans une maison), le système a résolu plus de tâches que les autres planificateurs d'IA, même lorsque les mots utilisés dans les instructions ne correspondaient pas parfaitement au vocabulaire du robot.

En bref : EvoPlan est un système de planification robotique qui utilise l'IA pour être créatif et flexible, mais qui force celle-ci à porter un « casque de sécurité » (appris à partir de données) et un « manuel de règles » (vérifié par du code) pour garantir qu'elle ne fasse jamais rien de dangereux ou d'impossible. C'est comme avoir un conducteur brillant mais impulsif qui est constamment guidé par un copilote très strict et très intelligent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →