CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations
Cet article présente CLAM, un cadre qui permet aux robots d'apprendre des politiques de contrôle efficaces à partir de séquences d'observations non étiquetées en inférant des actions latentes continues par la prédiction de dynamique auto-supervisée et en les ancrant avec des données de jeu agnostiques vis-à-vis de la tâche, atteignant ainsi des performances comparables à l'imitation de comportement avec des étiquettes d'expert sans nécessiter de démonstrations coûteuses étiquetées en termes d'actions.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez d'apprendre à un robot à faire quelque chose, comme empiler des blocs ou verser une boisson. Habituellement, la meilleure façon d'apprendre à un robot est de lui montrer exactement quoi faire, étape par étape, en tenant sa main et en enregistrant chaque minuscule mouvement de ses moteurs. C'est comme donner à un étudiant un manuel scolaire avec les réponses écrites à la fin. Mais voici le hic : enregistrer ces mouvements de moteurs est incroyablement difficile, coûteux et ennuyeux. Cela nécessite qu'un expert humain contrôle physiquement le robot pendant des heures, ce qui est lent et coûteux.
Maintenant, imaginez un autre type d'enseignant. Cet enseignant n'a pas de robot ; il a juste une caméra vidéo. Il se filme en train de réaliser la tâche, ou il trouve des vidéos sur Internet de personnes en train de la faire. Le robot peut voir ce qui se passe — les blocs bougent, la tasse se remplit — mais il n'a aucune idée de comment la main humaine s'est déplacée pour que cela se produise. Les « signaux moteurs » sont manquants. C'est l'énigme que les scientifiques du domaine de la robotique tentent de résoudre : comment un robot peut-il apprendre à bouger de lui-même simplement en regardant des vidéos où les instructions de « mode d'emploi » sont cachées ? Cet article s'attaque précisément à ce problème, visant à permettre aux robots d'apprendre à partir de vidéos peu coûteuses et faciles à collecter, sans avoir besoin de sessions d'entraînement coûteuses et dirigées par la main.
Les chercheurs derrière cet article, Anthony Liang et son équipe, introduisent une nouvelle méthode appelée CLAM (Continuous Latent Action Models). Voyez CLAM comme un détective super intelligent capable de regarder deux images consécutives d'une vidéo et de deviner la « force invisible » qui a causé le changement. Si vous voyez une tasse se déplacer du côté gauche de la table vers le côté droit dans une vidéo, CLAM essaie de comprendre le mouvement continu spécifique qui s'est produit entre les deux, même s'il n'a jamais vu la main qui l'a déplacée.
Voici comment la magie opère. D'abord, le robot regarde une énorme pile de vidéos non étiquetées (juste des observations, sans instructions). Il essaie de prédire à quoi ressemblera l'image suivante en se basant sur l'image actuelle et sur une « supposition » concernant l'action cachée. Si la supposition est fausse, la prédiction échoue, et le robot apprend à ajuster sa supposition. Au fil du temps, il construit une bibliothèque de ces « actions cachées » qui donnent un sens au monde. Mais il y a un obstacle : ces actions cachées ne sont que des chiffres dans le cerveau du robot ; elles ne sont pas encore de vraies commandes motrices.
Pour corrier cela, l'équipe utilise un deuxième tas de données plus petit : des données de « jeu » (play data). Il s'agit simplement du robot qui erre autour, heurte des choses et bouge ses bras de manière aléatoire, mais cette fois, l'ordinateur enregistre les commandes motrices. C'est comme si le robot jouait avec de l'argile sans objectif, mais en tenant un journal de la façon dont ses doigts ont bougé. CLAM utilise ce journal pour apprendre à lui-même comment traduire ses suppositions d'« actions cachées » en mouvements physiques réels. L'innovation clé est que l'équipe entraîne la partie « supposition » et la partie « traduction » ensemble. Cela garantit que les suppositions restent simples et utiles, plutôt que de devenir un chaos que le robot ne peut pas exécuter.
Les résultats sont assez impressionnants. L'équipe a testé CLAM de deux manières : dans des simulations informatiques (comme un monde de jeu vidéo) et sur un vrai bras robotique physique appelé WidowX. Ils ont constaté que CLam pouvait apprendre à résoudre des tâches complexes, comme assembler des pièces ou ramasser des objets, avec un taux de réussite 2 à 3 fois plus élevé que les méthodes précédentes qui essayaient de faire la même chose. Dans de nombreux cas, le robot a appris à performer presque aussi bien que s'il avait été entraîné avec les données de « commandes motrices » parfaites et coûteuses, même s'il n'avait jamais vu ces données.
Crucialement, l'article montre que cette approche fonctionne mieux lorsque les « actions cachées » sont continues (fluides et lisses) plutôt que découpées en petites étapes discrètes, et lorsque le robot apprend à traduire ces actions en utilisant cette petite quantité de données de jeu non étiquetées. S'ils avaient essayé de forcer les actions dans un format rigide, étape par étape, ou s'ils avaient essayé d'entraîner la partie traduction séparément, le robot aurait eu des difficultés. L'article démontre qu'en utilisant ce travail de détective auto-supervisé combiné à un peu de données de jeu désordonnées et non étiquetées, nous pouvons enseigner de nouvelles compétences aux robots sans avoir besoin de téléopération coûteuse dirigée par des experts. C'est un grand pas vers la capacité des robots à apprendre de la vaste quantité de contenu vidéo déjà disponible sur Internet, plutôt que d'exiger que nous enregistrions manuellement chaque mouvement qu'ils font.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.