← Derniers articles
💻 computer science

Humanoid-DART: Humanoid Loco-Manipulation using Diffusion-guided Augmentation through Relabeling and Tracking

Humanoid-DART est un cadre auto-supervisé qui combine la génération de trajectoires basée sur la diffusion avec l'apprentissage par renforcement pour permettre aux robots humanoïdes d'apprendre diverses compétences de loco-manipulation à partir de démonstrations éparses en explorant automatiquement l'espace des objectifs avec une supervision experte minimale.

Auteurs originaux : Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

Publié 2026-06-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous appreniez à un robot humanoïde à effectuer des tâches complexes, comme ramasser une boîte et la déplacer vers un endroit précis, ou frapper dans un ballon. Habituellement, pour apprendre cela à un robot, il faut enregistrer des centaines d'heures d'humains accomplissant ces tâches parfaitement. Mais c'est coûteux, lent et difficile à réaliser pour chaque variation possible (et si la boîte est plus lourde ? Et si la cible est plus loin ?).

Le papier présente Humanoid-DART, un système ingénieux qui apprend à un robot à maîtriser ces tâches en partant de seulement une poignée d'exemples (seulement quatre). Il y parvient en agissant comme un coach créatif qui ne se contente pas de répéter ce qu'il a vu, mais qui imagine de nouvelles façons de faire et les pratique ensuite jusqu'à ce qu'ils fonctionnent.

Voici comment le système fonctionne, décomposé en parties simples :

1. La stratégie des deux équipes

Au lieu d'essayer d'apprendre tout au robot dans un seul cerveau géant, Humanoid-DART divise le travail en deux équipes spécialisées qui s'entraident :

  • Le « Rêveur » (Le modèle de diffusion) : C'est le planificateur créatif. Son rôle est d'imaginer un chemin que le robot devra suivre. Il observe les quelques exemples dont il dispose et commence à « rêver » de nouveaux chemins, légèrement différents, pour atteindre de nouveaux objectifs. Imaginez cela comme un artiste esquissant de nouveaux itinéraires sur une carte. Au début, ces croquis peuvent être physiquement impossibles (comme marcher à travers un mur ou glisser sur le sol), mais ils sont excellents pour explorer où le robot pourrait aller.
  • L'« Athlète » (La politique d'apprentissage par renforcement) : C'est l'exécuteur physique. Son rôle est de prendre le croquis du « Rêveur » et de tenter réellement de l'exécuter sur le robot. Il agit comme un coach strict. Si le Rêveur dessine un chemin où le pied du robot glisse ou s'il tombe, l'Athlète dit : « Non, ça ne marchera pas », et corrige le mouvement pour le rendre physiquement possible.

2. La « Boucle de pratique » (Le curriculum)

La magie opère dans la manière dont ces deux équipes communiquent entre elles au fil du temps. Le système fonctionne par cycles, comme un camp d'entraînement :

  1. Choisir un objectif : Le système choisit une cible (ex. : « Déplacer la boîte vers ce nouvel endroit »).
  2. Rêver : Le « Rêveur » crée un plan approximatif pour y parvenir.
  3. Tester : L'« Athlète » tente d'exécuter le plan dans un simulateur physique.
  4. Filtrer et Relabéliser :
    • Si le robot tombe ou échoue, le plan est jeté.
    • La recette secrète : Si le robot passe presque à côté du but (un « quasi succès »), le système ne traite pas cela comme un échec. Au lieu de cela, il dit : « D'accord, tu n'as pas atteint l'endroit prévu, mais tu as réussi à atteindre cet endroit ». Il relabelise la tentative comme un succès pour le nouvel endroit réellement atteint.
  5. Apprendre : Le « Rêveur » apprend de ces tentatives réussies (ou presque réussies) pour devenir meilleur dans l'élaboration de plans pour ces points spécifiques. L'« Athlète » devient meilleur dans l'exécution de ces plans.
  6. Répéter : Le système choisit de nouveaux objectifs, légèrement plus difficiles, basés sur ce qu'il vient d'apprendre, étendant ses compétences comme une boule de neige qui dévale une colline.

3. L'architecture à « Double Cerveau »

Pour rendre le « Rêveur » vraiment capable de gérer à la fois la marche et la manipulation d'objets, le papier lui donne une structure cérébrale spéciale en deux parties :

  • Le Navigateur : Se concentre sur la vue d'ensemble (où vont les pieds du robot).
  • Le Localisateur : Se concentre sur les détails (comment les mains et les articulations bougent par rapport à l'objet).
    En séparant ces fonctions, le robot apprend à coordonner tout son corps sans s'embrouiller, garantissant que lorsqu'il marche vers une boîte, sa main est prête à la saisir.

4. Les résultats

Les chercheurs ont testé ce système sur un vrai robot (un Unitree G1) et en simulation. Ils sont partis de seulement quatre exemples de base de un robot poussant, frappant, passant un objet ou ramassant une boîte.

  • Le résultat : Le système n'a pas seulement copié ces quatre exemples. Il a appris à accomplir ces tâches pour des objectifs situés 4 à 5 fois plus loin que les exemples originaux.
  • Couverture : Pour la tâche de « ramassage et placement », le robot a appris à couvrir 96 % des zones cibles possibles, alors que les autres méthodes n'en couvraient qu'une infime fraction.

Résumé

Humanoid-DART est comme un étudiant qui commence avec quelques exemples de manuels scolaires, mais qui apprend à résoudre des milliers de nouveaux problèmes en :

  1. Imaginant de nouvelles solutions.
  2. Les essayant et voyant ce qui fonctionne réellement.
  3. Célébrant les « quasi succès » comme de nouvelles opportunités d'apprentissage.
  4. Construisant lentement une immense bibliothèque de compétences sans avoir besoin qu'un humain enregistre chaque variation possible.

Le papier conclut que cette approche permet aux robots d'apprendre des tâches complexes impliquant tout le corps à partir de données très éparses, rendant le processus d'enseignement des robots beaucoup plus rapide et efficace qu'auparavant.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →