SmoothRL: Online Reinforcement Learning During Asynchronous Execution
SmoothRL est un cadre d'apprentissage par renforcement en ligne qui permet l'ajustement fin et efficace en termes d'échantillonnage de politiques de robots préentraînées au sein de boucles d'inférence asynchrones en modélisant explicitement la chronologie d'exécution et en ne propageant les gradients qu'à travers les nouvelles régions d'action exécutées afin de garantir la fiabilité en temps réel et un contrôle fluide.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les robots luttent depuis longtemps pour se déplacer avec la grâce fluide des êtres vivants. Si l'intelligence artificielle a appris aux machines à comprendre le langage et à reconnaître des objets avec une précision stupéfiante, traduire cette compréhension en mouvement physique reste un obstacle tenace. Le problème n'est pas seulement que les robots doivent être intelligents ; ils doivent également être rapides et fluides. Dans le monde réel, un bras robotique ne peut pas s'arrêter pour réfléchir entre chaque micro-mouvement. S'il s'arrête pour calculer son étape suivante, le mouvement devient saccadé et la tâche échoue. Pour se déplacer de manière fluide, un robot doit prédire une série de mouvements futurs et les exécuter tout en calculant simultanément l'ensemble suivant. Cela crée un problème de synchronisation complexe : le robot agit selon des instructions générées un instant plus tôt, tandis que l'ordinateur travaille déjà sur les instructions du moment d'après. Si le robot tente d'apprendre de ses erreurs tout en opérant dans ces conditions, le processus d'apprentissage échoue souvent, car le robot est jugé sur des actions qu'il n'a jamais réellement terminées, ou des actions qu'il a été contraint d'abandonner en plein milieu.
Une équipe de chercheurs chez Astribot a développé une nouvelle méthode appelée SmoothRL pour résoudre ce casse-tête de synchronisation spécifique. Leur travail permet aux robots d'apprendre de l'expérience en temps réel, même lorsqu'ils fonctionnent sur un calendrier complexe et imbriqué où la pensée et le mouvement se produisent simultanément. Les chercheurs se sont concentrés sur un décalage fondamental entre la façon dont les robots sont entraînés et la façon dont ils sont utilisés. Par le passé, les scientifiques entraînaient les robots en supposant que la machine s'arrêterait, réfléchirait, puis bougerait selon un rythme parfait et synchronisé. Mais dans le monde réel, pour maintenir un mouvement fluide, les robots utilisent un système où ils génèrent un « bloc » de mouvements futurs, envoient la première partie aux moteurs, et commencent immédiatement à calculer le bloc suivant pendant que le premier est encore en cours d'exécution. Cela crée une situation où le robot rejette constamment des parties de ses propres plans parce qu'un plan plus récent et plus frais est arrivé. Les chercheurs ont réalisé que pour qu'un robot apprenne efficacement dans cet environnement, il doit cesser d'essayer d'apprendre à partir des parties de son plan qui ont été jetées pour se concentrer uniquement sur les parties qu'il a réellement exécutées.
Le cœur de leur solution est une façon d'enseigner au robot à ignorer les actions « fantômes » qu'il a générées mais jamais utilisées. Lorsque le robot crée un plan pour les prochaines secondes, il divise ce plan en trois zones distinctes. La première zone contient les actions qui ont déjà été décidées par le cycle de calcul précédent ; le robot ne peut plus les modifier maintenant. La deuxième zone contient les nouvelles actions que le robot exécute réellement pendant que le calcul suivant est en cours. La troisième zone contient les actions futures restantes qui seront probablement remplacées par le calcul suivant avant même que le robot n'y parvienne. Les chercheurs ont construit un système d'entraînement qui ne regarde que la deuxième zone — les actions que le robot a réellement exécutées. Ils apprennent au robot à ajuster son comportement en se basant uniquement sur les conséquences des mouvements qu'il a réellement accomplis, coupant ainsi efficacement le signal d'apprentissage des parties du plan qui ont été écartées. Cela garantit que le robot apprend de la réalité, et non d'un futur hypothétique qui n'a jamais eu lieu.
Pour tester cela, les chercheurs ont mis en place trois tâches physiques exigeantes sur un robot mobile doté de deux bras. La première tâche consistait à lancer un objet dans un bac, un mouvement qui nécessite un élan continu et ininterrompu. Si le robot hésite ou subit une secousse au moment où il passe d'un cycle de calcul à l'autre, le lancer échoue. La deuxième tâche exigeait que le robot coiffe un stylo avec une précision extrême, en alignant deux petits objets avec une tolérance de seulement quelques millimètres. La troisième tâche consistait à ouvrir une boîte en carton en guidant une lame le long d'une infime couture, un travail qui exige une précision millimétrique pour éviter de couper la boîte elle-même. Dans ces trois cas, le robot a commencé avec un cerveau pré-entraîné qui était bon mais pas parfait. Lorsque les chercheurs ont laissé le robot pratiquer en utilisant leur nouvelle méthode d'apprentissage asynchrone, les résultats ont été spectaculaires. La capacité du robot à lancer l'objet avec succès est passée de trente-neuf pour cent à quatre-vingt-quatorze pour cent. Sa compétence pour coiffer le stylo est passée d'un maigre huit pour cent à quatre-vingt-trois pour cent, et son taux de réussite pour l'ouverture de la boîte est passé de trente pour cent à quatre-vingt-dix pour cent.
L'amélioration ne concernait pas seulement la réussite de la tâche plus fréquente ; il s'agissait de la manière dont le robot se déplaçait. Les chercheurs ont mesuré la fluidité du mouvement du robot et ont constaté que la nouvelle méthode réduisait les secousses soudaines et les accélérations brusques de près de moitié. Cette fluidité était cruciale pour la tâche de lancer dynamique, où une pause dans le mouvement ferait tomber l'objet. Le système s'est également avéré assez flexible pour gérer l'aide humaine. Si un opérateur humain devait intervenir pour corriger une erreur, le robot pouvait absorber cette action humaine directement dans son processus d'apprentissage sans avoir besoin de la traduire en un code différent. La correction de l'humain devenait simplement un autre exemple de la bonne façon de bouger, permettant au robot d'apprendre simultanément de ses propres essais et des directives humaines.
Les chercheurs ont constaté que l'apprentissage du robot n'était pas toujours une ligne droite. Dans la tâche d'ouverture de la boîte, la performance du robot a en fait chuté avant de s'améliorer, suggérant que le système explorait de nouvelles façons de bouger qui semblaient initialement moins bonnes avant de trouver la bonne voie. Cela indique que le robot apprenait véritablement à s'adapter plutôt que de simplement mémoriser un ensemble fixe de mouvements. Cependant, les chercheurs ont également noté les limites de leur approche. La capacité d'apprentissage du robot est toujours liée à la qualité de son cerveau pré-entraîné initial. Si le robot de base est fondamentalement confus face à une tâche, les petits ajustements effectués par ce système d'apprentissage peuvent ne pas suffire à régler le problème. De plus, le système repose sur le fait que les calculs du robot se terminent dans un délai strict ; si l'ordinateur devient trop lent, la synchronisation des mouvements peut se désynchroniser, déstabilisant l'ensemble du processus.
En fin de compte, ce travail démontre que pour que les robots deviennent véritablement utiles dans le monde réel, leurs algorithmes d'apprentissage doivent correspondre à la réalité désordonnée et imbriquée de leurs mouvements. En apprenant au robot à se concentrer uniquement sur les actions qu'il a réellement achevées et à ignorer celles qu'il a écartées, les chercheurs ont créé une voie pour que les machines apprennent des tâches complexes et rapides sans sacrifier la fluidité requise pour les exécuter. Le résultat est un robot capable de lancer, de coiffer et de couper avec un niveau de fiabilité et de fluidité qui était auparavant hors de portée, prouant que la clé d'un meilleur apprentissage robotique réside dans la compréhension du moment précis où un plan devient réalité.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.