← Derniers articles
💻 computer science

GLAM: Training a latent world model over global spatiotemporal memory for active exploration and navigation

L'article présente GLAM, un modèle de monde latent conditionné par des objectifs et entraîné sur une mémoire spatio-temporelle globale qui prédit les représentations de cartes futures et les points de passage de navigation pour permettre une exploration active et une navigation sémantique améliorées, démontrées par le système GLAM NAV surpassant la référence BSC-Nav sur les tâches HM3D-ObjectNav.

Auteurs originaux : I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

Publié 2026-09-16
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un robot entrant dans une pièce qu'il n'a jamais vue, chargé de trouver un objet spécifique, comme une chaise rouge, qu'il ne peut pas voir depuis l'endroit où il se trouve. Pour réussir, le robot ne peut pas simplement réagir à ce qui se trouve immédiatement devant sa caméra. Il doit construire une image mentale de l'espace à mesure qu'il se déplace, se souvenir d'où il est passé et deviner ce qui se trouve derrière le prochain coin. Cette capacité à conserver une carte en mémoire, à anticiper comment cette carte changera à mesure que le robot avance, et à utiliser cette anticipation pour planifier l'étape suivante est le défi central de l'exploration active. Pendant des années, les chercheurs ont tenté d'enseigner cette compétence aux machines en leur faisant reconstruire le monde avec un niveau de détail élevé, pixel par pixel, ou en s'appuyant sur des cartes préétablies. Cependant, une nouvelle approche suggère qu'un robot n'a pas besoin de voir chaque brique et chaque ombre pour naviguer ; il a seulement besoin de comprendre la structure de l'espace et le chemin probable vers son objectif.

Une équipe de chercheurs a développé un système appelé GLAM, qui signifie « goal-conditioned latent world model trained over global spatiotemporal memory » (modèle de monde latent conditionné par un objectif et entraîné sur une mémoire spatio-temporelle globale). En termes plus simples, il s'agit d'un système de navigation qui apprend à prédire la configuration future d'une pièce et le meilleur chemin vers une destination sans avoir besoin de recréer le monde visuel dans ses moindres détails. Au lieu d'essayer de générer une nouvelle image vidéo de ce à quoi ressemblera la pièce dans la seconde suivante, le système prédit une représentation compressée et abstraite de la carte ainsi qu'un plan caché pour la suite du trajet. Cette approche est inspirée par la façon dont les cerveaux biologiques, particulièrement l'hippocampe, organisent les souvenirs spatiaux et les utilisent pour simuler des scénarios futurs. Les chercheurs ont construit un système de navigation complet autour de ce modèle, nommé GLAM NAV, qui combine la cartographie en ligne, la récupération de la mémoire et la planification prédictive en une seule boucle.

Le système fonctionne en mettant constamment à jour une mémoire numérique parcimonieuse de l'environnement à mesure que le robot se déplace. Cette mémoire n'est pas une photographie 3D complète, mais une collection de points de repère clés et de relations spatiales. Lorsque le robot doit trouver une cible, il utilise sa position actuelle et le souvenir de ce qu'il a déjà vu pour poser une question simple : « Si je me déplace dans cette direction, à quoi ressemblera la carte, et serai-je plus proche de mon objectif ? » Le modèle GLAM répond à cela en prédisant deux choses simultanément. Premièrement, il prévoit comment les jetons de la carte — les blocs de construction abstraits de sa mémoire — évolueront à mesure que le robot explore. Deuxièmement, il prédit un point de passage latent (waypoint), qui est une représentation cachée de la prochaine étape que le robot devrait franchir. Ces prédictions se produisent dans un espace partagé, ce qui signifie que le modèle apprend à lier la modification de la carte directement au mouvement nécessaire, le tout sans jamais essayer de reconstruire les images visuelles brutes du futur.

Pour entraîner ce système, les chercheurs ne les ont pas envoyés dans le monde réel pour commettre des erreurs. À la place, ils ont utilisé un simulateur de haute fidélité appelé Habitat, qui contient des centaines de scans 3D détaillés d'environnements intérieurs réels tels que des appartements et des bureaux. Ils ont rejoué des trajectoires d'experts — des chemins empruntés par un agent parfait contrôlé par ordinateur qui sait exactement où se trouvent les objets — et ont découpé ces chemins en milliers d'échantillons d'entraînement. Le modèle a appris à observer un historique de jetons de carte et un objectif, puis à prédire la carte future et le prochain point de passage. Crucialement, le système a été enseigné pour ignorer la tâche de recréation du monde visuel. Il s'est concentré entièrement sur la prédiction de la structure de l'espace et du plan de navigation. Avant l'entraînement du modèle principal, les chercheurs ont également pré-entraîné un composant séparé pour comprendre comment traduire ces plans de passage latents en mouvements physiques réels, garantissant que les prédictions puissent être transformées en commandes concrètes.

Lors des tests dans le simulateur, les résultats ont montré que cette approche prédictive fonctionnait mieux que les méthodes précédentes reposant sur différents types de structures de mémoire. Sur un ensemble spécifique de cinquante pour cent des scènes de test, le nouveau système, GLAM NAV, a trouvé l'objet cible avec succès dans 86,89 % des tentatives, une amélioration significative par rapport au taux de réussite de 78,50 % du système de référence auquel il a été comparé. Il a également réussi à atteindre la cible plus efficacement, avec une métrique appelée « Success weighted by Path Length » (succès pondéré par la longueur du chemin) passant de 47,70 % à 48,35 %. Ces chiffres suggèrent qu'en prédisant conjointement la structure future de la carte et le chemin, le robot est devenu plus fiable pour trouver son chemin, même lorsque la cible était initialement hors de vue. Le système n'a pas seulement mémorisé un itinéraire ; il a appris à anticiper la disposition de l'environnement et à ajuster son plan en fonction de cette anticipation.

Pour prouver qu'il ne s'agissait pas simplement d'un résultat lié au simulateur, les chercheurs ont déployé le système sur un robot physique, un humanoïde à roues doté de deux bras, dans un environnement de bureau réel. Lors de son premier test en conditions réelles, le robot a dû trouver une plante en pot dans une pièce qu'il n'avait jamais vue, sans aucune carte pré-établie fournie. À mesure qu'il se déplaçait, il construisait sa propre mémoire de l'espace, connectant les nouvelles observations visuelles à sa carte croissante. Il a navigué avec succès jusqu'à la plante, démontrant que le système pouvait construire une mémoire spatiale utile à partir de zéro dans un cadre physique réel. Dans un second test, le robot a dû se rappeler où il avait vu la plante après que l'objet soit sorti de sa vue. Le système a récupéré l'emplacement stocké dans sa mémoire et a navigué avec succès vers cet endroit. Ces démonstrations ont confirmé que les prédictions abstraites faites par le modèle pouvaient guider un vrai robot à travers un environnement réel, utilisant la mémoire pour combler le fossé entre ce qui est vu et ce qui est nécessaire.

Malgré ces succès, les chercheurs veillent à noter les limites de leurs travaux. Le système apprend à partir des chemins empruntés par des agents experts dans le simulateur, il est donc plus efficace lorsque le comportement du robot reste dans les schémas observés durant l'entraînement. Ce n'est pas un simulateur général capable de prédire le résultat de n'importe quelle action aléatoire ; c'est plutôt un outil orienté vers un objectif qui estime la carte et le chemin les plus probables pour un objectif spécifique. Le modèle produit également une prédiction unique et définie plutôt qu'une gamme de possibilités, ce qui signifie qu'il ne calcule pas explicitement l'incertitude de ses suppositions. Si le robot rencontre une configuration très différente de ce qu'il a appris, ou si ses capteurs dérivent et qu'il perd la trace de sa position, le système peut éprouver des difficultés. Les chercheurs soulignent que le robot s'appuie toujours sur des observations en temps réel pour vérifier sa position et éviter les collisions, utilisant les prédictions uniquement pour guider sa recherche.

Ce travail représente un changement dans notre façon de concevoir la navigation robotique. Au lieu de chercher à construire une réplique parfaite et haute résolution du monde à l'intérieur d'un ordinateur, le système apprend à travailler avec une version fonctionnelle et abstraite de la carte, suffisante pour la planification. En traitant la prédiction de la carte future et la planification du prochain mouvement comme une tâche unique et connectée, les chercheurs ont créé un système qui est à la fois plus fiable pour trouver des cibles et capable de fonctionner dans des environnements réels. Les conclusions suggèrent que pour qu'un robot explore efficacement, il n'a pas besoin de tout voir ; il doit comprendre la structure de l'espace suffisamment bien pour imaginer ce qui vient ensuite.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →