← Derniers articles
🤖 AI

What Matters for Simulation to Online Reinforcement Learning on Real Robots

À travers une étude empirique à grande échelle impliquant 100 cycles d'entraînement en conditions réelles sur trois plateformes robotiques, cet article identifie des choix de conception spécifiques et robustes qui permettent un apprentissage par renforcement en ligne stable sur des robots physiques tout en démontant l'efficacité de certains paramètres par défaut largement utilisés.

Auteurs originaux : Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

Publié 2026-07-24
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous appreniez à un robot à marcher, à ramasser une tasse ou à conduire une voiture. Pendant longtemps, les scientifiques ont tenté de le faire en laissant le robot s'entraîner des millions de fois à l'intérieur d'un monde de jeu vidéo — un simulateur numérique parfait. C'est comme un pilote qui s'entraîne dans un simulateur de vol : c'est sûr, rapide et peu coûteux. Mais il y a un piège. Le monde réel est désordonné. Les sols ne sont pas parfaitement lisses, les pneus glissent d'une manière que l'ordinateur n'avait pas prédite, et les caméras voient les choses différemment d'un moteur de rendu numérique. Lorsque vous prenez un robot entraîné dans un jeu vidéo parfait et que vous le posez sur un vrai sol, il trébuche souvent, fait tomber des objets ou s'écrase. Ce fossé entre le jeu « parfait » et la réalité « désordonnée » est le plus grand obstacle en robotique.

Pour corriger cela, les chercheurs utilisent une technique appelée Apprentissage par Renforcement (RL - Reinforcement Learning). Voyez le RL comme un étudiant très déterminé qui apprend par essais et erreurs. Le robot tente une action, reçoit une « récompense » (comme un point pour un succès) ou une « punition » (comme un crash), et ajuste son cerveau pour faire mieux la prochaine fois. La grande question est la suivante : pouvons-nous laisser ce robot apprendre pendant qu'il se déplace réellement sur le vrai sol, et pas seulement dans le jeu ? C'est ce qu'on appelle l'« apprentissage en ligne » (online learning). C'est le Saint Graal car cela signifie que les robots pourraient s'adapter instantanément à de nouvelles situations, comme un humain apprenant à faire du vélo sur un chemin accidenté après n'avoir pratiqué que sur un chemin lisse. Mais jusqu'à présent, essayer d'enseigner cela à un robot de cette manière sur du matériel réel était risqué, instable et souvent une perte de temps et d'argent.

Cet article, écrit par des chercheurs de l'ETH Zurich et de Google DeepMind, pose une question très pratique : « Si nous avons déjà un robot qui a appris dans un simulateur, quels réglages spécifiques devons-nous ajuster pour lui faire apprendre de manière sûre et réussie dans le monde réel ? » Ils n'ont pas inventé un nouvel algorithme magique. Au lieu de cela, ils ont agi comme des mécaniciens, prenant des outils d'apprentissage standards et prêts à l'emploi pour tester plus de 100 sessions d'entraînement différentes sur trois robots très différents : un bras robotique (Franka Emika Panda), un robot quadrupède (Unitree Go1) et une voiture de course télécommandée.

Ils ont découvert que les réglages « par défaut » habituels pour ces robots apprenants sont en fait dangereux lors du passage de la simulation à la réalité. Si vous branchez simplement un cerveau entraîné en simulateur dans un vrai robot et que vous commencez l'apprentissage immédiatement, le robot oublie souvent tout ce qu'il savait et sombre dans le chaos. Les auteurs ont découvert que cela se produit parce que le « critique » du robot (la partie qui juge si une action est bonne) est confus par le changement soudain de la physique. Pour arrêter cela, ils ont développé une recette simple et fiable.

Premièrement, ils ont trouvé qu'il faut conserver une « mémoire » des anciennes données du simulateur mélangée aux nouvelles données du monde réel. C'est comme garder un manuel ouvert pendant que vous faites vos devoirs ; si vous jetez le manuel au moment où vous commencez, vous pourriez oublier les règles de base. Deuxièmement, ils ont trouvé que le robot a besoin d'une période de « mise en chauffe » où il s'entraîne quelques fois avec son ancien cerveau de simulateur avant d'être autorisé à changer d'avis. Enfin, et surtout, ils ont trouvé que le « cerveau » du robot (la partie qui décide quoi faire) doit se mettre à jour beaucoup plus lentement que son « jugement » (la partie qui apprend de ses erreurs). Si le cerveau change trop vite, il est confus par le monde réel désordonné. En ralentissant les mises à jour du cerveau et en maintenant le jugement stable, le robot peut apprendre à saisir des cubes, à marcher sans tomber et à garer une voiture de course avec une grande précision, le tout en seulement quelques minutes d'entraînement réel.

L'article montre qu'avec ces ajustements spécifiques et prudents, les méthodes d'apprentissage standards peuvent fonctionner de manière fiable sur du matériel réel. Ils n'ont pas seulement simulé cela ; ils l'ont testé sur des machines réelles, prouvant qu'il n'est pas nécessaire d'avoir un tout nouvel algorithme surpuissant pour faire apprendre les robots dans le monde réel — il suffit d'être plus intelligent sur la façon dont on leur fournit des données et sur la vitesse à laquelle on les laisse changer d'avis.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →