← Últimos artículos
💻 computer science

GLAM: Training a latent world model over global spatiotemporal memory for active exploration and navigation

El artículo presenta GLAM, un modelo de mundo latente condicionado por objetivos entrenado en memoria espaciotemporal global que predice representaciones de mapas futuros y puntos de ruta de navegación para permitir una exploración activa y navegación semántica mejoradas, demostrado por el sistema GLAM NAV superando al baseline BSC-Nav en las tareas de HM3D-ObjectNav.

Autores originales: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

Publicado 2026-09-16
📖 7 min de lectura🧠 Análisis profundo

Autores originales: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina a un robot entrando en una habitación que nunca ha visto, con la tarea de encontrar un objeto específico, como una silla roja, que no puede ver desde donde se encuentra. Para tener éxito, el robot no puede simplemente reaccionar a lo que tiene inmediatamente frente a su cámara. Debe construir una imagen mental del espacio a medida que se mueve, recordar por dónde ha pasado y adivinar qué hay alrededor de la siguiente esquina. Esta capacidad de mantener un mapa en la memoria, anticipar cómo cambiará ese mapa a medida que el robot avance y utilizar esa anticipación para planificar el siguiente paso es el núcleo del desafío de la exploración activa. Durante años, los investigadores han intentado enseñar esta habilidad a las máquinas haciendo que reconstruyan el mundo con gran detalle, píxel por píxel, o recurriendo a mapas preexistentes. Sin embargo, un nuevo enfoque sugiere que un robot no necesita ver cada ladrillo y sombra para navegar; solo necesita comprender la estructura del espacio y la trayectoria probable hacia su objetivo.

Un equipo de investigadores ha desarrollado un sistema llamado GLAM, que significa un modelo de mundo latente condicionado por objetivos entrenado sobre una memoria espaciotemporal global. En términos más sencillos, este es un sistema de navegación que aprende a predecir la disposición futura de una habitación y la mejor ruta hacia un destino sin necesidad de recrear el mundo visual con un detalle perfecto. En lugar de intentar generar un nuevo fotograma de vídeo de cómo será la habitación en el próximo segundo, el sistema predice una representación comprimida y abstracta del mapa y un plan oculto de hacia dónde ir a continuación. Este enfoque está inspirado en cómo los cerebros biológicos, particularmente el hipocampo, organizan las memorias espaciales y utilizan simulaciones de escenarios futuros. Los investigadores construyeron un sistema de navegación completo alrededor de este modelo, llamado GLAM NAV, que combina el mapeo en línea, la recuperación de memoria y la planificación predictiva en un solo ciclo.

El sistema funciona actualizando constantemente una memoria digital dispersa del entorno a medida que el robot se desplaza. Esta memoria no es una fotografía tridimensional completa, sino una colección de puntos de referencia clave y relaciones espaciales. Cuando el robot necesita encontrar un objetivo, utiliza su posición actual y la memoria de lo que ya ha visto para hacerse una pregunta simple: "Si me muevo en esta dirección, ¿cómo será el mapa y estaré más cerca de mi objetivo?". El modelo GLAM responde a esto prediciendo dos cosas simultáneamente. Primero, pronostica cómo evolucionarán los tokens del mapa —los bloques de construcción abstractos de su memoria— a medida que el robot explora. Segundo, predice un punto de paso latente (waypoint), que es una representación oculta del siguiente paso que el robot debe dar. Estas predicciones ocurren en un espacio compartido, lo que significa que el modelo aprende a vincular el cambio del mapa directamente con el movimiento necesario, todo ello sin intentar jamás reconstruir las imágenes visuales puras del futuro.

Para entrenar este sistema, los investigadores no enviaron robots al mundo real para que cometieran errores. En su lugar, utilizaron un simulador de alta fidelidad llamado Habitat, que contiene cientos de escaneos 3D detallados de entornos interiores reales, como apartamentos y oficinas. Reprodujeron trayectorias de expertos —rutas tomadas por un agente controlado por computadora que sabía exactamente dónde estaban los objetos— y dividieron estas rutas en miles de muestras de entrenamiento. El modelo aprendió a observar un historial de tokens de mapa y un objetivo, y luego a predecir el mapa futuro y el siguiente punto de paso. Crucialmente, se le enseñó al sistema a ignorar la tarea de recrear el mundo visual. Se centró enteramente en predecir la estructura del espacio y el plan para navegarlo. Antes de entrenar el modelo principal, los investigadores también preentrenaron un componente separado para entender cómo traducir estos planes de puntos de paso ocultos en movimientos físicos reales, asegurando que las predicciones pudieran convertirse en comandos reales.

Al probarlo en el simulador, los resultados mostraron que este enfoque predictivo funcionaba mejor que otros métodos que dependían de diferentes tipos de estructuras de memoria. En un conjunto específico del cincuenta por ciento de las escenas de prueba, el nuevo sistema, GLAM NAV, encontró el objeto objetivo con éxito en el 86,89 por ciento de los intentos, una mejora significativa respecto la tasa de éxito del 78,50 por ciento del sistema base con el que se comparó. También logró alcanzar el objetivo de manera más eficiente, con una métrica llamada Éxito ponderado por la Longitud del Camino (Success weighted by Path Length) que aumentó del 47,70 por ciento al 48,35 por ciento. Estas cifras sugieren que, al predecir conjuntamente la estructura futura del mapa y la ruta, el robot se volvió más fiable para encontrar su camino, incluso cuando el objetivo estaba inicialmente fuera de la vista. El sistema no solo memorizó una ruta; aprendió a anticipar la disposición del entorno y a ajustar su plan basándose en esa anticipación.

Para demostrar que esto no era simplemente un resultado del simulador, los investigadores implementaron el sistema en un robot físico, un humanoide con ruedas y brazos duales, en un entorno de oficina real. En la primera prueba en el mundo real, se le pidió al robot que encontrara una planta en una habitación que nunca había visto, sin que se le proporcionara un mapa previo. A medida que se movía, construía su propia memoria del espacio, conectando las nuevas observaciones visuales con su mapa en crecimiento. Navegó con éxito hasta la planta, demostrando que el sistema podía construir una memoria espacial útil desde cero en un entorno físico real. En una segunda prueba, se le pidió al robot que recordara dónde había visto la planta después de que el objeto hubiera quedado fuera de la vista. El sistema recuperó la ubicación almacenada de su memoria y navegó con éxito de vuelta a ese punto. Estas demostraciones confirmaron que las predicciones abstractas realizadas por el modelo podían guiar a un robot real a través de un entorno real, utilizando la memoria para cerrar la brecha entre lo que se ve y lo que se necesita.

A pesar de estos éxitos, los investigadores tienen cuidado en señalar los límites de su trabajo. El sistema aprende de las rutas tomadas por agentes expertos en el simulador, por lo que es más efectivo cuando el comportamiento del robot se mantiene dentro de los patrones que ha visto durante el entrenamiento. No es un simulador general que pueda predecir el resultado de cualquier acción aleatoria; más bien, es una herramienta dirigida a objetivos que estima el mapa y la ruta más probables para un objetivo específico. El modelo también produce una predicción única y definida en lugar de un rango de posibilidades, lo que significa que no calcula explícitamente la incertidumbre de sus conjeturas. Si el robot encuentra una disposición muy diferente de la que aprendió, o si sus sensores derivan y pierde el rastro de su posición, el sistema podría tener dificultades. Los investigadores enfatizan que el robot todavía depende de las observaciones en tiempo real para verificar su ubicación y evitar colisiones, utilizando las predicciones únicamente para guiar su búsqueda.

Este trabajo representa un cambio en nuestra forma de entender la navegación de robots. En lugar de intentar construir una réplica perfecta y de alta resolución del mundo dentro de una computadora, el sistema aprende a trabajar con una versión funcional y abstracta del mapa que es suficiente para la planificación. Al tratar la predicción del mapa futuro y la planificación del siguiente movimiento como una única tarea conectada, los investigadores han creado un sistema que es tanto más fiable para encontrar objetivos como capaz de operar en entornos del mundo real. Los hallazgos sugieren que, para que un robot explore eficazmente, no necesita verlo todo; necesita comprender la estructura del espacio lo suficientemente bien como para imaginar qué vendrá después.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →