← Derniers articles
⚡ electrical engineering

Trajectory-Tracking Control of Multi-DOF Manipulators Subject to Payload Variations using Deep Reinforcement Learning

Cet article propose un contrôleur d'apprentissage par renforcement profond sans modèle basé sur l'algorithme Soft Actor-Critic avec une randomisation du domaine de la charge utile afin d'obtenir un suivi de trajectoire de haute précision pour des manipulateurs à 6 degrés de liberté sous des conditions de charge variables et complexes, démontrant des améliorations significatives de la précision et de la fluidité du couple par rapport au contrôle PID traditionnel en simulation.

Auteurs originaux : Xuan Quang Ngo, Huy Hung Nguyen, Tan Tien Nguyen, Van Tu Duong

Publié 2026-08-13
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xuan Quang Ngo, Huy Hung Nguyen, Tan Tien Nguyen, Van Tu Duong

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où les robots sont les assistants ultimes, capables de souder des pièces de voitures, de secourir des personnes sous des décombres ou d'empiler des boîtes dans un entrepôt. Mais pour qu'un robot soit véritablement utile, il doit savoir exactement comment bouger ses bras. C'est le travail d'un « contrôleur », le cerveau qui indique aux articulations du robot où aller. Habituellement, ces robots transportent des objets — des outils, des boîtes lourdes ou même des extincteurs qui s'allègent au fur et à mesure qu'ils pulvérisent. Le problème est que lorsque le poids dans la main d'un robot change, la façon dont son bras se déplace change aussi. C'est comme essayer de faire du vélo avec un sac à dos lourd attaché à soi : il faut pédaler plus fort et diriger différemment pour rester sur le chemin.

Pendant des années, les scientifiques ont essayé d'apprendre aux robots à gérer ces changements de poids en utilisant de vieilles astuces mathématiques. Ces méthodes sont comme donner au robot un ensemble de règles rigides : « S'il devient lourd, pousse plus fort ». Mais ces règles échouent souvent lorsque le poids change soudainement ou de manière sauvage, provoquant des oscillations, des dépassements de cible ou même faisant trembler le robot jusqu'à ce qu'il s'autodétruise. Entrez en scène une idée plus récente et plus séduisante : l'Apprentissage par Renforcement Profond (Deep Reinforcement Learning ou DRL). Considérez cela comme apprendre à un robot non pas en lui donnant un livre de règles, mais en le laissant jouer à un jeu vidéo encore et encore. Le robot essaie de bouger, reçoit un « score » pour sa réussite, et apprend de ses erreurs jusqu'à devenir un maître du jeu. Cet article examine si cette approche de « jeu » peut apprendre à un robot à suivre parfaitement une cible mouvante, même lorsque le poids dans sa main change constamment, diminue ou saute brusquement.

Les chercheurs derrière cette étude ont décidé de mettre cette idée à l'épreuve sur un robot à six bras très populaire appelé le UR5e. Ils voulaient voir s'ils pouvaient entraîner ce robot en utilisant un type spécifique d'algorithme de jeu appelé Soft Actor-Critic (SAC). Le grand défi était que le robot devait suivre un chemin rapide et sinueux tout en portant des charges allant de rien (0 kg) à un poids lourd de 5 kg, et parfois le poids changeait en plein milieu du mouvement.

Pour rendre le robot assez intelligent pour gérer n'importe quel poids, l'équipe n'a pas seulement entraîné le robot avec une charge spécifique. Au lieu de cela, ils ont utilisé une astuce appelée « randomisation de domaine » (domain randomization). Imaginez un jeu vidéo où le concepteur de niveau change aléatoirement la gravité, la friction ou le poids du personnage à chaque fois que vous commencez une nouvelle partie. En entraînant le robot dans cet environnement chaotique et changeant, le robot a appris une stratégie flexible qui fonctionne pour n'importe quel poids, plutôt que de mémoriser une solution unique pour une charge spécifique. Ils ont également donné au robot une « mémoire » spéciale en lui fournissant non seulement où il se trouve actuellement, mais aussi où il était un instant auparavant et où il doit aller ensuite. Cela a aidé le robot à anticiper les changements de la physique de son bras, un peu comme un surfeur qui regarde la vague suivante plutôt que de fixer simplement l'eau sous ses pieds.

Les résultats de leurs simulations ont été assez impressionnants. Lorsqu'ils ont testé leur nouveau contrôleur « entraîné par le jeu » contre un contrôleur traditionnel (un contrôleur PID standard, qui est l'approche du vieux livre de règles), la différence était flagrante. Le contrôleur traditionnel peinait énormément lorsque le poids changeait. Si le robot transportait une charge lourde et que le poids chutait soudainement, ou s'il commençait sans poids et devenait soudainement lourd, l'ancien contrôleur perdait pied. Il dépassait la cible, oscillait violemment et produisait d'énormes erreurs de suivi. Dans le test le plus difficile, où la charge changeait de manière complexe (restant immobile, puis changeant lentement, puis sautant soudainement), l'erreur moyenne de l'ancien contrôleur était un désordre de 19,41 degrés, et il utilisait une énergie saccadée et inefficace.

En revanche, le contrôleur DRL était un expert de la fluidité. Il maintenait le robot sur le chemin avec une erreur moyenne de seulement 1,41 degré. C'est une amélioration massive d'environ 92,72 %. Non seulement il était plus précis, mais il était aussi beaucoup plus fluide. Le couple (la force appliquée aux articulations) de l'ancien contrôleur variait de manière erratique, bondissant en moyenne de 5,26 Nm, tandis que le nouveau contrôleur limitait ces bonds à seulement 1,72 Nm. Cela signifie que le robot se déplaçait avec grâce, utilisant moins d'énergie et imposant moins de stress à ses moteurs.

L'étude a également montré que cet « entraînement randomisé » était la recette secrète. Lorsqu'ils ont essayé d'entraîner le robot avec un seul poids fixe et l'ont testé sur un poids différent, il a échoué lamentablement, les erreurs grimpant en flèche. Mais parce qu'ils l'ont entraîné sur un mélange sauvage de poids, il a acquis une compétence générale qui fonctionne partout. Les chercheurs ont découvert que la façon dont ils concevaient la « fiche de score » du robot (la fonction de récompense) était également cruciale. Ils ont dû équilibrer l'attribution de points pour atteindre la cible, des points pour la fluidité du mouvement et des points pour ne pas gaspiller d'énergie. S'ils ne s'étaient souciés que d'atteindre la cible, le robot se serait brisé par ses propres vibrations ; s'ils n'avaient tenu compte que de la fluidité, il serait moins réactif pour corriger sa trajectoire. Le mélange parfait de ces récompenses a appris au robot à être à la fois précis et délicat.

Bien sûr, tout cela se passe actuellement dans une simulation informatique. Les auteurs précisent avec prudence que, bien que le robot ait appris à être un champion dans le monde virtuel, il reste des obstacles avant qu'il ne puisse être un champion dans le monde réel. Pour l'une des raisons, le robot a parfois eu de « mauvais jours » pendant l'entraînement où il a commis une erreur soudaine et étrange, et ils soupçonnent qu'un meilleur système de mémoire (comme un réseau de mémoire à long terme) pourrait aider. Ils préviennent également que laisser un robot explorer de manière aléatoire dans le monde réel pourrait être dangereux, ils doivent donc déterminer comment transférer ces compétences virtuelles vers une machine physique en toute sécurité.

En résumé, cet article suggère qu'en apprenant aux robots à jouer à un jeu où les règles (le poids) changent constamment, nous pouvons créer des contrôleurs bien plus adaptables et précis que les anciennes méthodes. C'est une étape prometteuse vers des robots capables de gérer la réalité désordonnée et imprévisible du monde réel sans avoir besoin qu'un humain ajuste constamment leurs paramètres.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →