← Derniers articles
💻 computer science

Vision-Based Dribbling for Humanoid Soccer via Privileged Representation Learning

Cet article propose un cadre d'apprentissage par renforcement intégré qui incorpore un encodeur de profondeur temporelle dans une politique afin de permettre à un robot humanoïde d'apprendre un dribble de football robuste, basé sur la vision, contre des adversaires statiques et dynamiques directement à partir d'observations de profondeur embarquées, atteignant des taux de réussite élevés sans dépendre d'une estimation d'état explicite ou d'informations privilégiées.

Auteurs originaux : Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

Publié 2026-07-15
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un robot footballeur essayant de dribbler avec un ballon le long d'un terrain tout en portant une paire de lunettes de haute technologie. Maintenant, imaginez qu'au lieu d'avoir un superordinateur dans la tête qui connaît la vitesse et la position exactes du ballon et de ses adversaires, ce robot doive tout découvrir simplement en regardant un flux vidéo provenant de ses propres yeux, tout en essayant de ne pas tomber. C'est le défi fou relevé dans cet article.

Les chercheurs ont construit un système où un robot humanoïde apprend à dribbler un ballon de football en combinant la « vision » et le « mouvement » en un seul grand cerveau. Habituellement, les robots sont construits comme une course de relais : une première équipe détecte le ballon, transmet l'information à une deuxième équipe qui planifie le trajet, puis une troisième équipe fait bouger les jambes. Mais les auteurs soutiennent que cette méthode à l'ancienne est comme essayer de conduire une voiture en regardant seulement une carte dessinée par quelqu'un d'autre ; si la carte est légèrement fausse ou si le ballon est caché pendant une fraction de seconde, le conducteur s'écrase. Au lieu de cela, ils ont appris au robot à apprendre la perception et le contrôle ensemble, comme un humain apprenant à faire du vélo en ressentant l'équilibre plutôt qu'en calculant la physique de chaque vacillement.

Pour enseigner au robot, ils ont utilisé un camp d'entraînement astucieux en deux étapes. D'abord, ils ont laissé le robot s'entraîner dans un jeu vidéo de simulation où il possédait des « codes de triche » (appelés informations privilégiées). Il savait exactement où se trouvaient le ballon et les ennemis, même s'ils étaient derrière un mur. Le robot a appris à dribbler parfaitement dans ce mode de triche, maîtrisant la façon de garder le ballon proche de lui et d'esquiver les obstacles. Ensuite, dans la deuxième phase, ils ont retiré les codes de triche. Ils ont entraîné un « encodeur de vision » spécial — imaginez cela comme un tuteur étudiant — pour regarder la même vidéo de caméra de profondeur que le robot verrait dans le monde réel et deviner quels auraient été les chiffres du « code de triche ». Le cerveau du robot utilisait ensuite ces suppositions pour prendre des décisions, apprenant ainsi efficacement à jouer au jeu en utilisant uniquement ses yeux.

Les résultats de cet entraînement ont été impressionnants, mais avec des limites très spécifiques. Lorsque le robot jouait sur un terrain vide sans personne essayant de lui voler le ballon, il était une étoile parfaite, réussissant 100 % du temps. Lorsqu'ils ont ajouté un obstacle statique (comme un cône ou un mur) sur son chemin, il a toujours fait un travail fantastique, réussissant 96 % du temps et ne mettant qu'un tout petit peu plus de temps pour atteindre le but.

Cependant, l'histoire change lorsque le robot fait face à un ennemi en mouvement. Lorsqu'un second robot a été programmé pour poursuivre le ballon et essayer de le frapper pour l'éloigner, le taux de réussite est tombé à 46 %. Dans ces simulations, le robot tombait ou perdait le ballon beaucoup plus souvent, et il percutait l'adversaire 68 % du temps. Les auteurs suggèrent que bien que le robot soit excellent pour voir et se déplacer de son côté, le véritable défi est de réagir à un adversaire vivant et mobile qui essaie activement d'interférer. Les yeux du robot fonctionnaient bien — il pouvait toujours voir le ballon et l'ennemi raisonnablement bien — mais le « cerveau » devait encore apprendre à comprendre comment esquiver une cible mouvante sans tomber, ce qui est encore un travail en cours.

Il est important de se rappeler que tout cela s'est passé à l'intérieur d'une simulation informatique utilisant un modèle de robot spécifique appelé Booster T1. Les auteurs précisent avec prudence que cela constitue une base solide pour l'avenir, mais ils n'ont pas encore testé cela sur un vrai robot sur un vrai terrain. Ils proposent que cette méthode d'enseigner aux robots à apprendre à partir de flux vidéo tout en gardant l'équilibre est une voie prometteuse, mais pour l'instant, le robot est encore un étudiant très talentueux dans une salle de classe virtuelle, pas encore tout à fait prêt pour la Coupe du Monde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →