← Derniers articles
💻 computer science

Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers

Cet article introduit l'Optimisation Riemannienne Guidée (GuRO), un nouveau cadre qui intègre la commande prédictive de modèle avec les Decision Transformers et emploie une optimisation riemannienne sensible à la courbure pour parvenir à un entraînement plus rapide et plus robuste ainsi qu'à des performances supérieures dans les tâches de contrôle robotique hautement dimensionnelles et non linéaires.

Auteurs originaux : Hossein Abdi, Satya Prakash Dash, Mingfei Sun

Publié 2026-08-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hossein Abdi, Satya Prakash Dash, Mingfei Sun

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots qui se déplacent dans le monde réel sont confrontés à un équilibre constant et difficile. Ils doivent décider comment faire un pas, tourner ou grimper dans des environnements qui sont souvent irréguliers, glissants ou imprévisibles. Pour prendre ces décisions, les ingénieurs se sont traditionnellement appuyés sur deux approches principales. La première ressemble à un navigateur prudent qui vérifie constamment une carte et recalcule le meilleur chemin à suivre en fonction d'un modèle connu du monde. Cette méthode est efficace et facile à comprendre, mais elle peine lorsque la carte est erronée ou que le terrain change de manières que la carte n'avait pas prévues. La seconde approche ressemble davantage à un enfant qui apprend à marcher : elle essaie beaucoup de choses, tombe, se relève, et apprend lentement ce qui fonctionne par essais et erreurs. Cette méthode peut finir par maîtriser des mouvements très complexes, mais elle nécessite un temps et une pratique énormes, échouant souvent lorsque la tâche est trop difficile ou que les erreurs sont trop coûteuses.

Pendant des années, les chercheurs ont tenté de combiner le meilleur des deux mondes : la planification prudente du navigateur et l'adaptabilité de l'apprenant. Une idée plus récente a émergé, qui traite l'historique des mouvements et des récompenses d'un robot comme un récit, utilisant de puissants modèles informatiques initialement conçus pour lire le langage humain afin de prédire la meilleure action suivante. Bien que prometteurs, ces modèles de « lecture de récits » sont notoirement difficiles à entraîner. Ils se retrouvent souvent coincés dans un cycle d'apprentissage lent et instable, incapables de trouver le chemin le plus efficace vers une solution. Une équipe de chercheurs de l'Université de Manchester a maintenant développé une nouvelle façon de guider ces modèles, aidant ces derniers à apprendre des mouvements robotiques complexes beaucoup plus rapidement et plus de manière plus fiable qu'auparavant.

Les chercheurs se sont concentrés sur l'enseignement à un robot à quatre pattes, appelé quadrupède, pour naviguer dans des environnements difficiles. Ils voulaient que le robot marche sur un sol accidenté, monte des escaliers et ascende des pentes glissantes sans tomber. Pour ce faire, ils ont créé un système hybride qui comble le fossé entre le planificateur prudent et l'apprenant par essais et erreurs. Ils ont utilisé une technique appelée Contrôle Prédictif par Modèle, qui agit comme un guide en temps réel. À chaque instant, ce guide calcule un chemin localement parfait et de courte durée pour que le robot le su l' suivre, montant essentiellement au robot ce qu'est un bon mouvement à l'instant présent. Ce guide n'a pas besoin de connaître tout le futur ; il a seulement besoin de connaître les quelques étapes suivantes.

Ces chemins de haute qualité générés par le guide ont ensuite été injectés dans un Transformer de Décision, le modèle de « lecture de récits ». Au lieu que le robot doive tout apprendre à partir de zéro en errant et en faisant des erreurs, le modèle a appris en étudiant les excellents exemples fournis par le guide. Cela a éliminé la nécessité de quantités massives de données hors ligne ou d'heures interminables d'essais et d'erreurs dans le monde réel. Le robot pouvait apprendre des suggestions du guide, affinant sa propre compréhension de la manière de se déplacer efficacement. Cependant, l'entraînement de ces grands modèles reste un problème mathématique difficile. Le paysage des solutions possibles est rempli de pics acérés et de vallées profondes, ce qui peut facilement bloquer ou ralentir excessivement les algorithmes d'apprentissage standards.

Pour résoudre cela, les chercheurs ont introduit une nouvelle façon de naviguer dans le processus d'apprentissage lui-même. Ils ont traité l'espace mathématique où réside le cerveau du robot non pas comme une grille plate et simple, mais comme une surface courbe, semblable à la surface de la Terre. Les méthodes d'apprentissage standard se déplacent en ligne droite, ce qui peut être inefficace sur une surface courbe. La nouvelle méthode, que les auteurs appellent Optimisation Riemannienne Guidée, comprend la courbure de cet espace. Elle ajuste la direction de l'apprentissage pour suivre les contours naturels du problème, permettant au cerveau du robot de trouver la meilleure solution beaucoup plus rapidement. Cette approche est comparable à un randonneur qui connaît la topographie du terrain et prend la route la plus directe pour monter une colline, plutôt que de marcher en ligne droite, ce qui pourrait mener à une impasse ou à une falaise abrupte.

L'équipe a testé ce système sur un robot Unitree AlienGo, une machine à quatre pattes, dans un environnement simulé qui imite la physique du monde réel. Ils ont imposé au robot trois défis distincts : marcher sur un terrain accidenté, monter un escalier et gravir une surface inclinée à faible friction. Ils ont comparé leur nouvelle méthode à plusieurs techniques établies, y compris des algorithmes d'apprentissage par renforcement standard et d'autres versions du transformer de décision qui n'utilisaient pas l'approche d'apprentissage sur surface courbe. Les résultats ont montré un avantage clair pour le nouveau système. Dans chaque tâche, le robot entraîné avec la méthode guidée et sensible à la courbure a atteint un niveau de performance plus élevé et l'a fait avec moins de tentatives que les autres méthodes.

Les données ont révélé que le robot apprenait à marcher sur un sol accidenté, à monter des escaliers et à gravir des pentes glissantes avec une plus grande stabilité et une plus grande vitesse. Le processus d'apprentissage lui-même était nettement plus efficace, la fonction de perte — une mesure de l'erreur de prédiction du robot — chutant beaucoup plus rapidement qu'avec les méthodes traditionnelles. L'analyse statistique a confirmé que ces améliorations n'étaient pas dues au hasard. La nouvelle méthode a systématiquement surpassé les meilleures alternatives existantes, prouvant que la combinaison d'un planificateur en temps réel avec un modèle de lecture de récits, et l'optimisation du processus d'apprentissage grâce à la compréhension de la géométrie sous-jacente, crée un outil puissant pour le contrôle robotique.

Ce travail suggère que l'avenir de l'apprentissage robotique ne réside peut-être pas dans le choix entre la planification prudente et les essais et erreurs, mais dans leur entrelacement. En utilisant un planificateur pour fournir des exemples de haute qualité et une approche mathématique spécialisée pour naviguer dans le processus d'apprentissage, les robots peuvent maîtriser des tâches physiques complexes plus rapidement et plus solidement. Les chercheurs ont démontré que cette approche fonctionne efficacement en simulation, offrant une voie prometteuse pour le déploiement de robots intelligents et adaptables dans le monde réel, là où les conditions sont rarement parfaites et où le coût de l'échec est élevé.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →