Reinforcement Learning for Real-Time Vision-Language-Action Policies
Cet article introduit Real-Time EXPO-FT, un cadre d'apprentissage par renforcement qui découple la génération d'actions expressives et lentes de l'édition d'actions réactives et rapides afin de permettre une adaptation efficace en termes d'échantillonnage et de haute performance des grands modèles Vision-Langage-Action aux dynamiques du monde réel malgré la latence d'inférence.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les robots ont longtemps lutté pour se déplacer avec la fluidité des êtres vivants. Bien qu'ils puissent être programmés pour suivre un ensemble rigide d'instructions dans une usine, le monde réel est désordonné, imprévisible et évolue rapidement. Pour naviguer dans ce milieu, les chercheurs se sont tournés vers un type d'intelligence artificielle connu sous le nom de modèle vision-langage-action. Il s'agit de programmes informatiques massifs entraînés sur de vastes quantités de données, leur permettant de comprendre ce qu'ils voient à travers une caméra, de lire une instruction textuelle et de décider comment bouger un bras robotique. Ils sont puissants car ils ont vu de nombreux exemples du fonctionnement du monde, agissant comme une immense bibliothèque d'expérience. Cependant, il y a un inconvénient majeur : parce que ces modèles sont si grands et complexes, ils prennent un temps de réflexion notable. Dans la fraction de seconde qu'il faut à l'ordinateur pour traiter une image et décider d'un mouvement, le monde physique a déjà changé. Si un robot essaie d'attraper une balle ou de faire tenir un objet en équilibre, l'information qu'il a utilisée pour prendre sa décision est déjà obsolète au moment où il effectue réellement le mouvement, ce qui provoque souvent l'échec de l'action.
Une équipe de chercheurs de l'Université de Stanford a développé une nouvelle façon d'enseigner à ces grands modèles comment agir en temps réel, même lorsqu'ils sont lents à réfléchir. Leur approche, appelée Real-Time EXPO-FT, résout le problème du délai en divisant la prise de décision du robot en deux parties distinctes. Au lieu de forcer le modèle massif et lent à effectuer chaque petit ajustement de l'instant, ils le laissent effectuer le travail de fond consistant à planifier un chemin général, tandis qu'un programme informatique beaucoup plus petit et plus rapide gère les corrections immédiates. Imaginez un chef d'orchestre dirigeant un orchestre ; le chef définit le tempo et la mélodie générale, mais les musiciens individuels doivent ajuster leur jeu instantanément pour rester en rythme. Dans ce système, le grand modèle agit comme le chef d'orchestre, proposant une séquence de mouvements basée sur ce qu'il a vu un instant auparavant. Ensuite, un assistant léger observe l'état actuel du monde et apporte de minuscules et rapides modifications aux mouvements proposés pour s'assurer qu'ils sont toujours corrects pour l'instant précis où le robot doit agir. Cela permet au robot d'utiliser la connaissance profonde du grand modèle sans être freiné par sa vitesse de réflexion lente.
Les chercheurs ont testé cette méthode dans deux environnements très différents : un monde de physique simulé et le monde physique réel. Dans la simulation, ils ont mis le robot au défi avec dix tâches dynamiques différentes, telles que faire tenir une balle en équilibre sur une assiette, frapper un ballon de football en évitant un défenseur et attraper un objet en mouvement. Ils ont comparé leur nouvelle méthode à plusieurs techniques existantes qui tentaient de gérer les délais. Les résultats étaient clairs : la nouvelle approche a permis au robot de réussir presque tous les essais, surpassant toutes les autres méthodes, y compris celles qui n'avaient pas à gérer de délais du tout. Ce fut une découverte significative car elle a montré qu'en enseignant explicitement au système à tenir compte de sa propre lenteur, le robot pouvait devenir plus fiable que des systèmes théoriquement plus rapides mais moins adaptables.
Pour prouver que cela fonctionnait dans le monde réel, l'équipe a déplacé le robot dans un laboratoire et lui a confié quatre tâches exigeantes nécessitant une réaction constante et rapide. Celles-ci comprenaient maintenir une balle de ping-pong en équilibre sur une plaque rotative, ramasser un bloc sur une surface tournante, attraper un objet passé par un autre bras robotique et frapper un ballon dans un but pendant qu'un défenseur se déplace autour. Les chercheurs ont limité le temps d'entraînement à seulement dix minutes d'interaction du robot avec l'environnement, garantissant que le système puisse apprendre rapidement sans avoir besoin d'heures interminables de pratique. Avant d'appliquer leur méthode, le taux de réussite du robot sur ces tâches était assez bas, tournant autour de 42 pour cent. Après avoir utilisé ce nouveau cadre d'entraînement en temps réel, le taux de réussite a bondi à 97 pour cent. Le robot a appris à s'adapter aux mouvements chaotiques des objets et aux contraintes temporelles des tâches sans aucune intervention humaine durant le processus d'apprentissage.
L'étude a également exploré la capacité du système à résister à différentes conditions. Lorsque les chercheurs ont artificiellement augmenté le délai de réflexion du robot, la nouvelle méthode a maintenu son haut niveau de performance, alors que les autres méthodes ont échoué à mesure que le délai augmentait. De même, lorsque la vitesse des objets en mouvement augmentait, le robot utilisant ce nouveau cadre a continué à réussir, tandis que les autres approches peinaient à suivre. Cela démontre que le système ne fonctionne pas seulement pour une vitesse ou un délai spécifique, mais qu'il est suffisamment robuste pour gérer la nature imprévisible d'un environnement dynamique. Les chercheurs ont noté que, bien que leur système soit très efficace, il repose encore sur un humain pour réinitialiser le robot après la fin d'une tâche, et qu'il nécessite une définition spécifique du succès pour chaque tâche. Cependant, la réussite fondamentale est la démonstration que de grands et puissants modèles d'IA peuvent être rendus opérationnels en temps réel, comblant ainsi le fossé entre la planification lente et réfléchie de l'intelligence artificielle et les exigences de réaction rapide du monde physique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.