← Derniers articles
🤖 machine learning

Runtime-Incremental Transformer for Reinforcement-Learning-Based Adaptive Control

Cet article introduit un mécanisme de transformeur incrémentiel à l'exécution qui fait croître et élague dynamiquement les têtes d'attention pendant l'apprentissage par renforcement en fonction de la capacité de représentation du contexte et de la redondance des têtes, éliminant ainsi les défaillances catastrophiques dans le contrôle adaptatif à long horizon de manipulateurs robotiques avec une mémoire de friction non observable et supprimant la nécessité d'un réglage coûteux des hyperparamètres hors ligne.

Auteurs originaux : Giansalvo Cirrincione, Adriano Fagiolini

Publié 2026-09-15
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Giansalvo Cirrincione, Adriano Fagiolini

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots qui se déplacent avec précision, tels que les bras utilisés dans les usines pour assembler des voitures ou manipuler des matériaux délicats, s'appuient sur des mathématiques complexes pour savoir quelle force appliquer. Pendant des décennies, les ingénieurs ont utilisé une méthode appelée contrôle par couple calculé, qui calcule la poussée ou la traction exacte nécessaire pour déplacer une articulation vers un point souhaité. Cela fonctionne bien lorsque le mouvement du robot est prévisible, mais les machines du monde réel sont confrontées à un problème caché : la friction. Si une certaine friction est simple et constante, d'autres types, comme le comportement de frottement de Stribeck (adhérence-glissement), dépendent d'un état interne caché qui change au fil du temps. Comme les capteurs d'un robot ne peuvent pas voir directement cet état caché, le système perd sa capacité à prédire son propre comportement futur en se basant uniquement sur sa position actuelle. Pour résoudre cela, les chercheurs se sont tournés vers l'intelligence artificielle, plus précisément vers un type d'apprentissage appelé apprentissage par renforcement, où un programme informatique apprend par essais et erreurs. Cependant, ces programmes utilisent souvent une caractéristique architecturale spécifique appelée mécanisme d'attention, qui agit comme un projecteur, permettant à l'IA de se concentrer sur différentes parties de son histoire récente. Le nombre de ces projecteurs, ou « têtes », est généralement fixé avant le début de l'entraînement, choisi par un processus de recherche long et coûteux. Si le nombre choisi est trop petit, le robot échoue à apprendre ; s'il est trop grand, le système devient inefficace.

Les chercheurs derrière cette étude ont cherché à corriger cette rigidité en créant un système capable de changer d'avis pendant qu'il apprend. Ils ont développé un nouveau contrôleur qui ne décide pas du nombre de têtes d'attention à l'avance. Au lieu de cela, il observe sa propre performance pendant le processus d'entraînement et ajoute de nouvelles têtes lorsqu'il se sent submergé par la complexité de la tâche, ou en retire lorsqu'il réalise que certaines ne servent à rien. Cela se produit en temps réel, sans interrompre le processus d'apprentissage. Le système utilise deux signaux simples pour prendre ces décisions. Premièrement, il mesure la quantité de nouvelles informations provenant de l'historique du robot ; si l'information est trop complexe pour le nombre actuel de têtes, le système en fait croître une nouvelle. Deuxièmement, il vérifie la contribution de chaque tête à la décision finale ; si une tête ne fait presque aucun travail, le système la retire discrètement. Crucialement, les chercheurs ont conçu le système de sorte que l'ajout ou le retrait d'une tête n'entraîne pas de saut ou d'erreur soudain dans le comportement du robot. Lorsqu'une nouvelle tête est ajoutée, elle commence avec une influence nulle, garantissant que le mouvement du robot reste fluide. Lorsqu'une tête est retirée, le changement est si faible qu'il ne perturbe pas l'apprentissage.

L'équipe a testé cette approche sur un bras robotique simulé à deux articulations faisant face à différents niveaux de mémoire de friction, allant de délais à court terme à long terme. Dans des expériences précédentes utilisant des nombres fixes de têtes, le système échouait complètement dans les scénarios de mémoire longue les plus difficiles, provoquant souvent la perte de contrôle du robot ou l'ignorance de la charge qu'il transportait. Avec le nouveau système ajustable en cours d'exécution, le robot a réussi tous les tests, même dans les cas difficiles où l'ancienne méthode avait échoué. Les chercheurs ont constaté que le système n'avait pas découvert un nombre de têtes « naturel » spécifique intrinsèque à la tâche ; au contraire, il a saturé le plafond maximal de têtes dans chaque exécution de la campagne principale, et le déclencheur de l'élagage n'a jamais fonctionné pour retirer des têtes inutilisées. Curieusement, le bénéfice ne provenait pas de la taille finale du système, mais de la manière dont il a grandi. Le processus graduel d'ajout de têtes a agi comme un curriculum d'entraînement, aidant le robot à apprendre étape par étape plutôt que d'être jeté dans une tâche complexe d'un seul coup. Cela suggère que la capacité d'adapter l'architecture pendant l'apprentissage est plus importante que d'avoir une structure massive et pré-construite. Le résultat est une façon plus robuste et efficace d'enseigner aux robots comment gérer la friction désordonnée et imprévisible du monde réel, éliminant le besoin de recherches coûteuses par essais et erreurs pour trouver les bons réglages avant même que le robot ne bouge.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →