← Derniers articles
💻 computer science

Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks

Cet article aborde les limites de sécurité et de stabilité de l'apprentissage par renforcement traditionnel dans les tâches robotiques riches en contacts en proposant un cadre qui intègre un entraînement sensible à la passivité avec des contraintes basées sur l'énergie et un filtre de passivité pour le déploiement, garantissant ainsi la stabilité du contrôle et améliorant l'efficacité énergétique.

Auteurs originaux : Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

Publié 2026-09-03
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un bras robotique s'étendant pour toucher un mur, non pas pour le repousser, mais pour tâtonner son chemin à travers un labyrinthe sombre et sinueux. C'est le monde de la robotique riche en contacts, où les machines doivent interagir physiquement avec leur environnement pour résoudre des problèmes. Pendant des années, les scientifiques ont utilisé un outil puissant appelé apprentissage par renforcement pour apprendre aux robots comment faire cela. Voyez cela comme un processus numérique d'essais et d'erreurs : le robot tente un mouvement, reçoit une récompense s'il réussit, et apprend de ses erreurs. Bien que cette méthode ait produit des résultats impressionnants dans les simulations informatiques, un obstacle majeur subsiste lors du passage de ces robots au monde réel. Les algorithmes sont excellents pour trouver un chemin vers un objectif, mais ils ignorent souvent une règle fondamentale de la physique : l'énergie. Si un robot apprend une stratégie qui nécessite de pomper trop d'énergie dans ses articulations ou dans l'environnement, il peut devenir instable, trembler violemment ou même s'endommager lui-même et les objets qu'il touche. Garantir que les mouvements d'un robot sont sûrs et stables n'est pas seulement une préoccupation théorique ; c'est une nécessité pratique pour toute machine qui devra un jour travailler aux côtés des humains.

Des chercheurs de l'Istituto Italiano di Tecnologia à Gênes, en Italie, se sont donné pour mission de résoudre ce problème spécifique. Ils ont posé une question simple mais critique : pouvons-nous apprendre à un robot non seulement à être bon dans une tâche, mais aussi à être intrinsèquement sûr concernant son utilisation de l'énergie ? Leur travail se concentre sur un concept appelé passivité. En termes simples, la passivité signifie qu'un système ne peut pas créer d'énergie à partir de rien ; il peut seulement stocker ce qu'il reçoit ou le dissiper. Un robot passif est un robot qui se comporte comme un ressort bien amorti, absorbant les chocs plutôt que de les amplifier. L'équipe a découvert que les politiques d'apprentissage par renforcement standard, qui sont entraînées pour maximiser le succès de la tâche, échouent souvent à respecter cette règle. Dans leurs expériences, ces politiques standard ont appris à accomplir des tâches rapidement, mais ce faisant, elles ont généré des commandes de contrôle qui violaient les limites d'énergie, entraînant l'instabilité lors du déploiement dans le monde réel.

Pour corriger cela, les chercheurs ont développé une nouvelle approche qui combine la puissance d'apprentissage de l'intelligence artificielle avec des règles énergétiques strictes. Ils ont créé un système composé de deux parties distinctes travaillant ensemble. La première partie se déroule durant la phase d'entraînement. Ici, ils ont appris au robot à être « conscient de la passivité ». Au lieu de simplement récompenser le robot pour avoir atteint la sortie d'un labyrinthe, ils ont ajouté des contraintes invisibles qui le pénalisaient pour l'utilisation excessive d'énergie ou pour des changements trop rapides de sa rigidité. Cela a forcé le robot à apprendre une manière de bouger plus économique, découvrant des stratégies naturellement plus douces et plus stables. La seconde partie se déroule lorsque le robot est réellement en train de travailler. Même avec un meilleur entraînement, les chercheurs savaient qu'un programme informatique pouvait encore commettre une erreur. Ainsi, ils ont ajouté un filtre de sécurité, une dernière couche de protection qui se situe entre le cerveau du robot et ses muscles. Ce filtre surveille constamment le flux d'énergie. Si le robot tente de faire un mouvement qui injecterait trop d'énergie dans le système, le filtre le réduit automatiquement, garantissant que le robot reste dans des limites sûres.

L'équipe a testé cette méthode dans un scénario exigeant : une tâche d'exploration de labyrinthe où un bras robotique devait trouver son chemin en touchant aveuglément les parois. Ils ont comparé quatre types de robots différents : un qui ignorait totalement les règles d'énergie, un qui était entraîné à se soucier de l'énergie mais ne possédait pas de filtre de sécurité, un qui possédait un filtre de sécurité mais avait été entraîné sans les règles d'énergie, et enfin, leur nouvelle méthode combinant l'entraînement conscient de l'énergie et le filtre de sécurité. Les résultats étaient clairs. Le robot entraîné sans règles d'énergie pouvait terminer le labyrinthe dans les simulations, mais lorsqu'ils ont essayé de le faire fonctionner sur un véritable robot physique, il a échoué. Il se déplaçait de manière trop agressive, appliquant une force excessive dans les virages, ce qui provoquait une perte de contrôle. En revanche, les robots entraînés avec des contraintes énergétiques ont appris à se déplacer de manière plus conservatrice. Ils ont mis un peu plus de temps à apprendre la tâche durant la phase d'entraînement, mais une fois déployés, ils étaient bien plus fiables.

Lorsque les chercheurs ont mis les meilleurs modèles entraînés à l'épreuve dans le monde réel, la différence était flagrante. Le robot utilisant leur méthode combinée a terminé le labyrinthe avec succès à chaque essai, ne violant jamais les limites de force et ne dépassant jamais son budget énergétique. Le robot standard, même protégé par le filtre de sécurité, a éprouvé des difficultés car il n'avait pas appris à gérer son énergie efficacement dès le départ. Le filtre de sécurité seul pouvait stopper un désastre, mais il ne pouvait pas rendre le robot efficace. L'entraînement conscient de l'énergie seul rendait le robot efficace, mais il ne pouvait pas garantir la sécurité si le robot faisait une erreur soudaine et imprévisible. Ce n'est qu'en combinant les deux qu'ils ont obtenu un système qui soit à la fois sûr et efficace. Les chercheurs ont constaté que le robot entraîné avec des limites d'énergie strictes utilisait son budget énergétique beaucoup plus lentement et uniformément, lui permettant de gérer des virages et des obstacles complexes sans manquer de souffle.

Ce travail met en lumière un changement crucial dans notre façon de construire des machines intelligentes. Il suggère que pour que les robots travaillent en toute sécurité dans notre monde physique, ils ne doivent pas seulement être enseignés pour être intelligents ; ils doivent être enseignés pour être physiquement responsables. En intéant les lois de la conservation de l'énergie directement dans le processus d'apprentissage et en les appuyant par un filtre de sécurité en temps réel, les chercheurs ont montré une voie vers des robots qui sont non seulement capables, mais aussi dignes de confiance. Leurs expériences, menées sur un bras robotique à sept articulations, prouvent qu'il est possible d'apprendre à une machine à naviguer dans un environnement difficile et riche en contacts sans risquer sa propre stabilité ou la sécurité de son environnement. La méthode ne repose pas sur des modèles mathématiques complexes du monde qui pourraient être erronés ; elle repose plutôt sur le fait que le robot apprend les limites de sa propre énergie par l'expérience, guidé par des règles qui le maintiennent ancré dans la réalité physique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →