FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences
L'article présente FetchMan, un pipeline sim-to-real de bout en bout qui surmonte les limitations de performance de l'apprentissage par imitation synthétique en affinant les politiques grâce à l'apprentissage par renforcement Flow-GRPO, permettant à un humanoïde Unitree G1 d'atteindre un taux de succès zero-shot de 73,3 % dans des tâches de loco-manipulation à travers des scènes inédites.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Le rêve d'un robot capable de marcher dans une pièce, de repérer un objet spécifique et de le ramasser est depuis longtemps un objectif central en robotique. Pendant des décennies, les chercheurs ont lutté pour enseigner aux machines ce genre de comportement complexe car cela nécessite que deux compétences difficiles travaillent ensemble simultanément : déplacer le corps dans l'espace et utiliser les mains pour interagir avec le monde. Bien que les robots soient devenus très doués pour marcher seuls, ajouter la capacité d'atteindre et de saisir des objets tout en gardant l'équilibre sur deux jambes crée un mélange chaotique de physique qui est incroyablement difficile à programmer manuellement. La collecte des données nécessaires pour enseigner un robot de cette manière est également un obstacle massif ; demander à un humain de démontrer chaque façon possible de marcher vers un bol et de le ramasser dans chaque pièce possible prendrait des années et risquerait de casser le robot. Pour résoudre ce problème, les scientifiques se sont tournés vers les simulations informatiques, créant des mondes numériques où les robots peuvent s'entraîner des millions de fois sans crainte de dommages. Cependant, une question majeure demeurait : un robot entraîné entièrement dans un monde numérique peut-il réellement apprendre à gérer la réalité désordonnée et imprévisible d'une véritable maison ?
Une équipe de chercheurs de l'Université de Californie à Los Angeles, en collaboration avec des collaborateurs de l'Allen Institute for AI et de l'Université de Washington, a abordé ce défi avec un nouveau système qu'ils appellent FetchMan. Leur travail se concentre sur un robot humanoïde, l'Unitree G1, qui ressemble et se déplace beaucoup comme une personne. L'équipe voulait savoir si elle pouvait apprendre à ce robot à naviguer dans une pièce et à saisir un objet cible simplement en lui montrant des milliers d'exemples dans une simulation informatique, puis lui faire accomplir la tâche parfaitement dans le monde réel sans aucun entraînement supplémentaire. Ils ont découvert que le simple fait de montrer au robot de plus en plus d'exemples de la tâche ne suffisait pas. Même après s'être entraîné sur plus de 150 000 scènes différentes, les performances du robot ont atteint un plafond infranchissable. Il pouvait imiter l'enseignant numérique, mais il ne pouvait pas apprendre le timing subtil requis pour passer de la marche à l'atteinte de l'objet. Le robot essayait souvent de saisir l'objet trop tôt ou s'arrêtait de marcher trop tôt, échouant parce qu'il essayait de copier un enseignant qui utilisait des informations secrètes que le robot ne pouvait pas voir.
Pour briser cette barrière, les chercheurs ont ajouté une deuxième étape au processus d'entraînement. Au lieu de simplement copier l'enseignant numérique, ils ont laissé le robot s'entraîner par lui-même dans la simulation et l'ont récompensé uniquement lorsqu'il accomplissait avec succès l'ensemble de la tâche consistant à marcher vers l'objet et à le ramasser. Cette méthode, qui utilise une technique appelée apprentissage par renforcement, a permis au robot de comprendre par lui-même le bon timing et le bon mouvement. Il a appris à marcher plus près de l'objet avant de tendre la main, corrigeant les erreurs qu'il commettait lorsqu'il se contentait d'imiter. Lorsque l'équipe a testé ce robot perfectionné dans le monde réel, les résultats ont été frappants. Le robot, n'ayant jamais vu une vraie pièce ou un vrai objet durant son entraînement, a été capable de marcher dans des espaces inconnus, d'identifier un bol cible et de le saisir avec un taux de réussite de plus de 73 pour cent. C'était une amélioration significative par rapport à la méthode d'entraînement initiale, qui ne parvenait à réussir qu'environ 57 pour cent du temps lors des tests en conditions réelles.
Les chercheurs ont également exploré si cette approche pouvait fonctionner pour de nombreux types d'objets, et pas seulement pour des bols. Ils ont entraîné une version du système pour reconnaître et ramasser des articles comme du pain, des bouteilles et des livres en donnant au robot le nom de l'objet comme indice. Bien que cette version multi-objets ne soit pas aussi réussie que la version à objet unique, elle a tout de même réussi à accomplir la tâche dans diverses situations, prouvant que la méthode peut être étendue. L'étude souligne que si copier un enseignant est un bon point de départ, cela ne suffit pas pour maîtriser des tâches physiques complexes. Le robot a besoin de la liberté d'explorer et d'apprendre de ses propres succès et échecs pour véritablement comprendre comment se déplacer dans le monde. En combinant une quantité massive de pratique simulée avec une étape finale d'autocorrection, l'équipe a montré une voie claire vers la création de robots capables de s'adapter à de nouveaux environnements sans avoir besoin qu'un humain leur tienne la main à chaque étape.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.