← Últimos artículos
💻 computer science

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

MemVLN es un marco de navegación de visión y lenguaje en tiempo real que logra un rendimiento de vanguardia y 14 FPS de inferencia mediante la integración de una memoria episódica piramidal para la retención eficiente de historial de largo alcance con una memoria procedimental que utiliza acciones atómicas de nivel medio para evitar la latencia de la decodificación autorregresiva.

Autores originales: Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

Publicado 2026-07-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de enseñarle a un robot a caminar a través de una casa que nunca ha visto, guiado únicamente por una voz que dice: "Ve a la cocina, gira a la izquierda en el jarrón azul y detente junto a la nevera". Este es el mundo de la Navegación de Visión y Lenguaje (VLN, por sus siglas en inglés). Es una rama de la robótica y la inteligencia artificial donde un agente informático debe comprender instrucciones habladas y observar el mundo a través de una cámara para determinar hacia dónde moverse a continuación. La parte difícil es que el robot no puede simplemente saltar de un lugar a otro como en un videojuego; tiene que realizar acciones reales, paso a paso, en un espacio continuo. Para hacer esto bien, el robot necesita dos superpoderes: una memoria a largo plazo para recordar dónde empezó y hacia dónde se dirige (para no perderse), y reflejos rápidos para reaccionar instantáneamente a lo que ve en este momento. Si el robot es demasiado lento para pensar, choca contra las paredes; si olvida el pasado, deambula en círculos. Los científicos han intentado construir robots que puedan hacer ambas cosas al mismo tiempo, pero generalmente, tienen que elegir entre ser inteligentes o ser rápidos.

Presentamos MemVLN, un nuevo cerebro robótico diseñado para tenerlo todo sin renunciar a nada. Los investigadores detrás de este proyecto se dieron cuenta de que los robots actuales tienen dificultades porque intentan recordar cada detalle de su viaje con la misma calidad, lo que los ralentiza hasta dejarlos a paso de tortuga. MemVLN resuelve esto imitando cómo funciona la memoria humana. Divide su memoria en dos tipos especiales: Memoria Episódica y Memoria Procedimental. Piensa en la Memoria Episódica como un álbum de fotos donde las fotos más recientes están en alta definición, pero las fotos más antiguas se han reducido a miniaturas diminutas. Esto permite que el robot mantenga una imagen clara de dónde está ahora mismo, mientras sigue recordando la forma general del camino que recorrió hace horas, sin verse agobiado por un exceso de datos. Luego, está la Memoria Procedimental, que es como la memoria muscular de conducir o escribir a máquina. En lugar de que el robot se detenga a redactar cuidadosamente una frase larga como "Ahora giraré a la izquierda y caminaré hacia adelante", tiene un vocabulario de acceso directo de "tokens de acción" predefinidos. Esto le permite tomar decisiones en un solo destello, saltándose el proceso de pensamiento lento y paso a paso que suele causar retrasos.

El artículo presenta a MemVLN como un marco de trabajo que combina con éxito estos dos estilos de memoria para navegar en entornos continuos a una velocidad de 14 FPS (fotogramas por segundo). Este es un salto significativo en velocidad en comparación con los métodos anteriores, que los autores señalan que a menudo luchan por equilibrar la necesidad de un historial visual prolongado con la necesidad de un control en tiempo real. Al utilizar una estrategia de "resolución piramidal" para su memoria episódica, el sistema procesa las vistas inmediatas a una resolución completa de 512 × 512, las vistas a corto plazo a 256 × 256 y el historial a largo plazo de forma comprimida a 128 × 128. Esto asegura que el robot se mantenga enfocado en lo que tiene justo delante, mientras mantiene un resumen comprimido del pasado. Para su memoria procedimental, el equipo reemplazó la forma estándar y lenta de generar acciones (que toma más de 300 ms para una secuencia) con un mecanismo de "acción rápida" que utiliza un solo token para representar un movimiento complejo, reduciendo el tiempo a unos 70 ms.

Los resultados de las pruebas de MemVLN en los estándares de referencia de navegación, específicamente R2R-CE y RxR-CE, sugieren que este enfoque funciona muy bien. Los autores encontraron que su modelo, MemVLN-4B, superó a la arquitectura base Qwen3-VL-4B en un 5.8% en la tasa de éxito en el conjunto de datos R2R y en un 9.7% en el conjunto de datos RxR. Quizás lo más impresionante es que el nuevo sistema logró una aceleración de en la latencia de inferencia, lo que le permite operar en tiempo real. El artículo argumenta explícitamente contra la idea de que la fusión de tokens (un método utilizado por otros sistemas para comprimir datos) es la mejor solución, señalando que destruye la cuadrícula espacial necesaria para un posicionamiento avanzado. En su lugar, su resolución piramidal mantiene la estructura de la cuadrícula mientras sigue comprimiendo los datos. Los autores también probaron diferentes "formas" para su pirámide de memoria y descubrieron que un diseño "ascendente", que otorga a las vistas más recientes la mayor resolución, funcionó mejor. Aunque el modelo depende únicamente de video RGB estándar (tal como un ojo humano) y lenguaje natural, sin sensores adicionales como cámaras de profundidad, esto sugiere que un sistema de memoria inteligente puede compensar la limitación de los datos visuales. El estudio confirma que, al equilibrar las observaciones recientes de alta fidelidad con un historial comprimido, y al utilizar un vocabulario de acción rápida, los robots pueden navegar espacios complejos y desconocidos de manera más efectiva y rápida que nunca.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →