Learning Options for Compositional Motor Control with Adapter Banks
Cet article propose une nouvelle architecture utilisant un noyau récurrent partagé, modulé par une banque d'adaptateurs résiduels, pour apprendre des primitives motrices flexibles en tant que perturbations de faible rang émergentes, permettant à une politique de haut niveau gelée de séquencer ces adaptateurs pour une généralisation supérieure aux séquences motrices inédites par rapport aux modèles de base multitâches.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Le mouvement habile, qu'il s'agisse des gammes fluides d'un pianiste ou du saut complexe d'un gymnaste, repose sur une capacité cachée : le cerveau n'apprend pas chaque nouveau mouvement en partant de zéro. Au lieu de cela, il construit une bibliothèque de blocs de construction réutilisables, ou primitives, qui peuvent être mélangés, assortis et remodelés pour créer d'infinies nouvelles actions. Cette capacité à recombiner un ensemble fini de compétences en séquences novatrices est une caractéristique de la dextérité humaine. Pendant des décennies, les scientifiques ont tenté d'enseigner cette même flexibilité à des agents artificiels, espérant créer des robots capables de s'adapter à de nouvelles tâches sans avoir besoin d'être réentraînés depuis le début. Le défi consistait à trouver un moyen pour un système d'apprentissage de découvrir ces blocs de construction par lui-même, puis de les combiner sans que les anciennes compétences n'interfèrent avec les nouvelles. Des théories récentes en neurosciences suggèrent que le cerveau pourrait résoudre ce problème en utilisant un réseau de neurones partagé qui est légèrement ajusté par différentes entrées, permettant au même mécanisme central de produire des comportements très différents.
Une nouvelle étude menée par des chercheurs de l'Université Columbia et de l'Université de New York donne vie à cette théorie biologique à travers un modèle informatique, démontrant comment un système artificiel peut apprendre à composer des mouvements complexes à partir de rien. L'équipe a créé un cerveau numérique conçu pour contrôler un bras articulé à deux segments doté de six muscles, semblable à un membre humain. Ils ont demandé à ce système d'apprendre une variété de mouvements, notamment tendre le bras droit, se déplacer en cercles et tracer des motifs en forme de huit. Plutôt que de simplement mémoriser ces trajectoires, les chercheurs voulaient que le système découvre les parties sous-jacentes de chaque mouvement et apprenne à les assembler pour accomplir des tâches qu'il n'avait jamais vues auparavant. Pour ce faire, ils ont construit une architecture inspirée de la connexion entre le cortex moteur du cerveau et le thalamus, une structure cérébrale profonde qui aide à sélectionner et à basculer entre différents programmes moteurs.
Les chercheurs ont conçu un système doté d'un réseau « noyau » partagé qui gère la mécanique de base du mouvement, semblable au cortex moteur. Attaché à ce noyau se trouve une banque de modules spécialisés, ou adaptateurs, qui agissent comme de petits boutons de réglage pouvant ajuster le comportement du noyau. Dans le cerveau, ces adaptateurs correspondraient aux signaux du thalamus qui modifient légèrement l'activité du cortex moteur pour produire un mouvement spécifique. Les chercheurs n'ont pas programmé le système pour savoir quel adaptateur utiliser et quand ; ils ont plutôt laissé le système apprendre à identifier et à sélectionner le bon module en observant un enseignant expert réaliser les tâches. L'enseignant était un réseau distinct, pré-entraîné, qui savait exactement quelle règle suivre pour chaque mouvement. Le système étudiant, cependant, devait découvrir comment décomposer les actions de l'enseignant en segments et décider quel adaptateur activer à chaque instant, le tout sans que les règles ne lui soient explicitement dictées.
Alors que le système étudiant s'entraînait sur ces mouvements composés, quelque chose de remarquable s'est produit. Même si les adaptateurs étaient conçus pour être totalement flexibles et complexes, le système a naturellement appris à les utiliser comme des ajustements simples de faible rang (low-rank). En termes simples, le système a découvert qu'il n'avait pas besoin de réécrire l'intégralité du cerveau pour chaque nouvelle tâche ; il lui suffisait d'apporter de petits ajustements précis au noyau partagé. Cela a permis au système de factoriser les différents mouvements en espaces distincts et séparés au sein de son état interne. Tandis que le réseau de l'enseignant, qui reposait sur des entrées de règles explicites, gardait toutes ses représentations de tâches entremêlées dans un seul espace partagé, le système étudiant les a organisées en zones hautement séparées. Chaque type de mouvement, comme une extension droite ou un arc circulaire, occupait son propre coin distinct du paysage interne du système, ce qui facilitait grandement la transition entre eux sans confusion.
Le véritable test de cette approche est venu lorsque les chercheurs ont demandé au système d'effectuer une tâche totalement nouvelle : une trajectoire à deux pétales combinant des parties des mouvements appris d'une manière qu'il n'avait jamais vue auparavant. Ce nouveau chemin nécessitait d'assembler une extension droite à une rétraction courbe, puis une extension courbe à une rétraction droite, créant une discontinuité que ni l'étudiant ni l'enseignant n'avaient pratiquée. Les chercheurs ont gelé les réseaux internes des deux systèmes et ont tenté de trouver la meilleure façon de séquencer les blocs de construction disponibles pour correspondre à cette nouvelle cible. Le système étudiant, avec son architecture modulaire et séparée, a réussi avec une grande précision, suivant la nouvelle trajectoire avec une erreur d'environ 0,005 mètre. Le système enseignant, reposant sur son approche à sous-espace unique et entremêlé, a rencontré des difficultés importantes, plafonnant avec une erreur dix fois plus grande.
Les résultats suggèrent que la clé d'un contrôle moteur flexible ne réside pas seulement dans l'existence d'un réseau partagé, mais dans le fait que ce réseau soit modulé par des ajustements distincts de faible rang qui maintiennent les différentes tâches dans des espaces internes séparés. Cette séparation géométrique permet au système de mélanger et d'associer ses primitives apprises pour résoudre de nouveaux problèmes sans l'interférence qui entrave habituellement l'apprentissage artificiel. L'étude offre une démonstration concrète qu'une architecture inspirée par les boucles thalamo-corticales du cerveau peut apprendre à découvrir ses propres blocs de construction réutilisables et à les recombiner pour faire face à des défis hors distribution. En montant qu'un système peut apprendre à factoriser son comportement en sous-espaces distincts, cette recherche offre une voie prometteuse vers la création de machines capables de s'adapter à de nouvelles tâches physiques avec la même aisance et la même créativité qu'un athlète humain.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.