← Derniers articles
💻 computer science

Approach to Robust Visual Relocalization for Humanoid Robots via Mixture-of-Experts with Hierarchical Distillation

Cet article propose un cadre de relocalisation visuelle robuste pour les robots humanoïdes qui intègre une architecture de mélange d'experts avec une distillation de connaissances hiérarchique afin de parvenir à une estimation de pose à 6 degrés de liberté précise, stable et efficace dans des conditions difficiles telles que des changements brusques de point de vue et l'auto-occlusion.

Auteurs originaux : Shichu Sun, Jingwen Luo

Publié 2026-09-07
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Shichu Sun, Jingwen Luo

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un robot qui marche sur deux jambes, imitant l'équilibre et le mouvement d'un humain. Pour qu'une telle machine puisse naviguer dans le monde réel, elle doit constamment savoir où elle se trouve et comment elle est orientée, une tâche connue sous le nom de relocalisation visuelle. Elle s'appuie sur sa caméra pour observer le monde, reconnaître des formes et des textures familières, et calculer sa position dans l'espace. Cependant, ce processus est incroyablement fragile. Lorsqu'un robot tourne la tête rapidement, lorsqu'une personne passe devant son objectif ou lorsque la lumière passe d'un soleil éclatant à une ombre profonde, le robot peut facilement perdre son chemin. Les méthodes traditionnelles peinent souvent à équilibrer le besoin d'une précision extrême avec le besoin de rapidité, surtout sur un robot qui dispose d'une puissance de calcul limitée et ne peut pas transporter de processeurs lourds et lents.

Des chercheurs de l'Université Normale de Yunnan ont développé une nouvelle approche pour résoudre ce problème, créant un système qui permet aux robots humanoïdes de trouver leur chemin de manière fiable, même dans des environnements chaotiques. Leurs travaux, publiés dans une étude récente, se concentrent sur l'apprentissage d'un « cerveau » de robot qui soit à la fois intelligent et efficace. Ils y sont parvenus en combinant deux concepts avancés : une méthode permettant au robot de choisir différentes stratégies mentales selon les scènes, et une technique qui réduit un modèle complexe et puissant en une version plus petite et plus rapide sans perdre sa capacité à réfléchir clairement. Le résultat est un système qui aide un robot nommé KUAVO-4pro à naviguer dans des couloirs intérieurs et des espaces extérieurs avec une précision centimétrique, maintenant son équilibre et sa direction même lorsque le monde autour de lui change rapidement.

Le défi central auquel les chercheurs ont été confrontés est qu'un ensemble unique de règles rigides ne peut pas gérer la diversité du monde réel. Un couloir aux murs lisses et répétitifs ressemble très différemment d'un bureau encombré avec de nombreux coins et objets. Les anciens systèmes tentaient souvent d'utiliser un seul modèle massif pour tout gérer, ce qui les rendait lents et sujets aux erreurs lorsque la scène changeait. Le nouveau cadre introduit un concept appelé « mélange d'experts » (mixture of experts). Au lieu de s'appuyer sur un seul cerveau géant, le système utilise une collection de sous-réseaux spécialisés, ou experts. Lorsque le robot observe une scène, une petite porte de décision sélectionne automatiquement l'expert le mieux adapté à cette vue spécifique. Si le robot voit un coin riche en textures, il peut activer un expert doué pour la reconnaissance des détails. S'il voit un long mur vide, il peut passer à un expert plus apte à comprendre les lignes droites. Cela permet au robot d'adapter sa pensée en temps réel, en utilisant le bon outil pour la tâche, sans avoir besoin de traiter toutes les possibilités à la fois.

Pour rendre ce système pratique pour un robot doté d'une batterie et d'une puissance de calcul limitées, les chercheurs ont dû faire face à un second obstacle : la version la plus puissante de ce système de « mélange d'experts » est trop volumineuse pour être exécutée directement sur le robot. Pour résoudre cela, ils ont employé une technique appelée distillation hiérarchique. Dans ce processus, ils ont d'abord entraîné un modèle « enseignant » large et complexe capable de gérer parfaitement tous les scénarios difficiles. Ensuite, ils ont entraîné un modèle « étudiant » beaucoup plus petit pour imiter l'enseignant. Cependant, ils n'ont pas simplement demandé à l'étudiant de copier la réponse finale. Au lieu de cela, ils ont appris à l'étudiant à copier le processus de pensée interne de l'enseignant. L'étudiant a appris comment l'enseignant décidait quel expert utiliser, comment il interprétait les formes de l'image, et comment il connectait les points et les lignes pour comprendre la structure 3D de la pièce. En alignant ces étapes internes, le petit modèle étudiant a hérité de la robustesse et de l'intelligence de l'enseignant, devenant assez précis pour une utilisation réelle tout en restant assez petit pour fonctionner rapidement.

Les chercheurs ont testé leur système à travers une variété de scénarios exigeants. Ils ont lancé des simulations sur des ensembles de données publics incluant des pièces avec des textures faibles, des changements de luminosité sévères et des objets en mouvement. Lors de ces tests, le système a systématiquement surpassé les méthodes précédentes, maintenant une précision élevée même lorsque la vue du robot était partiellement obstruée ou que la lumière changeait radicalement. L'équipe a également mené des expériences en conditions réelles à l'aide du robot humanoïde KUAVO-4pro, qui mesure environ 1,66 mètre de haut. Ils ont guidé le robot à travers des environnements intérieurs et de longs couloirs, des zones connues pour confondre les robots en raison de leurs motifs répétitifs et de leur manque de caractéristiques distinctes. Le robot a navigué avec succès dans ces espaces, son chemin estimé restant remarquablement proche du chemin réel. Dans les tests intérieurs, l'erreur moyenne était d'environ 2,1 centimètres, et même dans le couloir difficile, l'erreur est restée dans une plage gérable, ne devenant jamais incontrôlable.

Une découverte clé de l'étude a été la manière dont le système a géré la transition entre différents types d'environnements. Lorsqu'un robot passait d'une zone lumineuse et ouverte à un coin faiblement éclairé, ou lorsqu'une personne passait devant la caméra, le système n'a pas paniqué et n'a pas perdu sa position. Les experts spécialisés au sein du modèle s'activaient et se désactivaient de manière fluide, garantissant que la compréhension de l'environnement par le robot restait stable. Le petit modèle étudiant, qui est environ 70 % plus petit en termes de paramètres que l'enseignant original, a performé presque aussi bien que la version plus grande. Cela a prouvé que le processus de distillation a réussi à transférer le raisonnement géométrique complexe du grand modèle dans un package compact. Le robot pouvait calculer sa position en environ 33 millisecondes, une vitesse suffisante pour suivre les mouvements rapides d'un humanoïde en marche.

Le succès de cette approche suggère une voie viable pour les robots autonomes qui doivent opérer dans des environnements humains dynamiques et non structurés. En combinant la flexibilité du choix de différents experts avec l'efficacité d'un modèle étudiant distillé, les chercheurs ont créé un système qui n'a pas à sacrifier la précision pour la vitesse. Le robot peut désormais gérer l'imprévisibilité du monde réel, des ombres soudaines aux personnes en mouvement, sans avoir besoin d'un supercalculateur sur son dos. Bien que les chercheurs notent que les travaux futurs pourraient impliquer l'ajout de données provenant d'autres capteurs comme les gyroscopes pour améliorer davantage la stabilité, ce travail actuel démontre qu'un robot peut être à la fois léger et hautement fiable. Il représente une étape significative vers des machines capables de se déplacer dans notre monde avec la même confiance et la même adaptabilité que les humains, trouvant leur chemin même lorsque la vue est obscurcie ou que le passage est incertain.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →