← Derniers articles
💻 computer science

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

L'article propose CRAFT, un cadre qui exploite les grands modèles de langage pour décomposer de manière autonome des tâches complexes de coordination multi-robots en sous-tâches et les modèles de langage visuels pour affiner les fonctions de récompense, permettant ainsi un apprentissage efficace et un transfert dans le monde réel des comportements de coordination sans conception manuelle de la récompense.

Auteurs originaux : Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

Publié 2026-06-08
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à une équipe de deux chiens une chorégraphie complexe, comme passer à travers une porte étroite sans se cogner l'un contre l'autre, ou soulever une marmite lourde ensemble sans renverser la soupe.

Si vous les jetez simplement dans la pièce en disant : « Faites-le ! », ils seront probablement confus, se bousculeront et n'apprendront jamais. C'est le problème auquel les chercheurs de l'UC Berkeley ont été confrontés avec les robots. Ils voulaient que les robots travaillent ensemble, mais les méthodes d'entraînement informatique standard échouaient car les tâches étaient trop longues, trop compliquées, et les robots ne pouvaient pas se « parler » pour planifier à l'avance.

Entrez en scène : CRAFT.

Considérez CRAF comme un entraîneur super intelligent, propulsé par l'IA, qui ne se contente pas de regarder les robots, mais leur apprend activement comment apprendre. Voici comment ce « coach » fonctionne, décomposé en étapes simples :

1. L'entraîneur décompose la grande tâche en petits exercices (Génération de curriculum)

Imaginez un entraîneur de football. Il ne dit pas immédiatement à une nouvelle équipe : « Allez gagner la Coupe du Monde ! ». Au lieu de cela, il décompose la tâche : « Aujourd'hui, nous pratiquons la passe. Demain, nous pratiquons le tir. La semaine prochaine, nous pratiquons la défense. »

CRAFT utilise un Modèle de Langage Étendu (LLM) — un type d'IA très doué pour comprendre le langage et la logique — pour agir comme cet entraîneur. Lorsqu'on lui donne une tâche imposante et intimidante (comme « Deux robots doivent traverser une porte »), l'entraîneur la décompose en une liste de petites étapes plus faciles :

  • Étape 1 : Apprendre simplement à marcher sans heurter la porte.
  • Étape 2 : Apprendre à marcher en passant la porte.
  • Étape 3 : Apprendre à se coordonner pour qu'un robot attende pendant que l'autre passe.

2. L'entraîneur écrit les règles du jeu (Génération de récompenses)

Dans l'entraînement des robots, les robots apprennent en receant des « points » (récompenses) lorsqu'ils font de bonnes choses et en perdant des points lorsqu'ils font des erreurs. Habituellement, les humains doivent écrire ces règles, ce qui est difficile.

L'entraîneur de CRAFT utilise l'IA pour écrire les règles de notation pour chaque petit exercice.

  • Exemple : Pour l'exercice « passer la porte », l'IA écrit une règle qui dit : « Vous gagnez des points en vous rapprochant de la porte, mais vous en perdez si vous la heurtez. »
  • L'IA écrit cette règle sous forme de code informatique que les robots peuvent réellement comprendre.

3. L'entraîneur observe et critique (Évaluation de la politique)

Une fois que les robots tentent l'exercice, un Modèle Vision-Langage (VLM) — une IA capable de « voir » des vidéos et de comprendre ce qui se passe — les observe. Il agit comme un arbitre.

  • Ont-ils réussi ? Si oui, l'entraîneur dit : « Bon travail ! Passons à l'exercice suivant. »
  • Ont-ils échoué ? S'ils ont percuté ou s'ils sont restés bloqués, l'arbitre ne se contente pas de dire « Échec ». Il examine la vidéo et l'historique des scores pour comprendre pourquoi. Peut-être que les robots essayaient trop de maintenir leur équilibre et en ont oublié de progresser vers l'avant.

4. L'entraîneur ajuste les règles (Affinement de la récompense)

C'est la partie magique. Si les robots échouent, l'entraîneur n'abandonne pas.

  • L'« IA Arbitre » donne des conseils : « Les robots reçoivent trop de points pour l'équilibre et pas assez pour l'avancement. La règle concernant le mouvement doit être plus forte. »
  • L'« IA Entraîneur » prend ces conseils et réécrit les règles de notation pour corriger le problème.
  • Les robots essaient à nouveau avec les nouvelles règles. Ils répètent cette boucle (Essayer -> Observer -> Corriger les règles -> Réessayer) jusqu'à ce qu'ils maîtrisent ce petit exercice spécifique.

Le résultat : De la simulation à la réalité

Les chercheurs ont testé cela sur deux défis principaux :

  1. Navigation de quadrupèdes : Deux robots à quatre pattes (comme des chiens) apprenant à traverser une porte étroite sans collision.
  2. Manipulation bimanuelle : Deux bras robotiques apprenant à soulever une marmite lourde ensemble tout en la gardant de niveau.

Qu'est-ce qui s'est passé ?

  • Sans cet entraîneur, les autres méthodes échouaient ou apprenaient des mouvements étranges et non naturels (comme tordre leurs articulations de manière impossible juste pour obtenir des points).
  • Avec CRAFT, les robots ont appris à se coordonner de manière fluide. Ils ont appris les bases, puis sont passés aux choses difficiles.
  • Le test en conditions réelles : Le plus important ? Les chercheurs ont pris les robots entraînés dans la simulation informatique et les ont placés sur de vrais robots physiques (Unitree Go1 et Go2). Sans aucun réglage supplémentaire, les robots ont réussi à traverser la porte dans le monde réel, prouvant que l'entraînement fonctionnait en dehors de l'ordinateur.

En résumé

CRAFT est comme un tuteur patient et intelligent pour les robots. Au lieu d'espérer que les robots comprennent des tâches complexes par eux-mêmes, il :

  1. Simplifie la grande tâche en petites étapes.
  2. Crée des règles personnalisées pour chaque étape.
  3. Observe les robots et corrige les règles lorsqu'ils commettent des erreurs.
  4. Guide les robots des exercices simples vers une coordination complexe, leur permettant finalement d'accomplir des tâches réelles qu'ils ne pourraient apprendre d'aucune autre manière.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →