← Últimos artículos
💻 computer science

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN aborda el problema de la "amnesia de navegación" en la navegación de visión y lenguaje de código abierto de cero disparos mediante la introducción de un Sistema de Memoria Jerárquica que mejora significamente la localización a largo plazo y el recuerdo visual, logrando casi el doble de rendimiento de los métodos de código abierto de vanguardia existentes.

Autores originales: Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

Publicado 2026-07-21
📖 3 min de lectura☕ Lectura para el café

Autores originales: Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un robot que pueda entender tu voz y ver el mundo tal como lo haces tú. Este es el sueño de la "IA con cuerpo" (Embodied AI), un campo donde las computadoras no solo charlan o calculan; ellas se mueven físicamente a través de habitaciones, siguen instrucciones como "ve a la cocina y toma una taza", y navegan por espacios complejos sin chocar contra las paredes. Durante mucho tiempo, estos robots necesitaron cantidades masivas de datos de entrenamiento escritos por humanos para aprender a moverse, lo que los hacía lentos para adaptarse a nuevas casas u oficinas. Recientemente, los científicos comenzaron a utilizar modelos de "cerebro" gigantes llamados Modelos de Lenguaje Extensos (LLM) para dotar a los robots de sentido común, permitiéndoles resolver la navegación sobre la marcha sin entrenamiento previo. Sin embargo, hay un inconveniente: los cerebros más inteligentes están bajo puertas costosas y basadas en la nube que cuestan dinero usar y plantean preocupaciones de privacidad porque envían la transmisión de video de tu hogar a un servidor. Si bien existen modelos de código abierto (cerebros locales y gratuitos), a menudo se confunden, olvidan dónde están o deambulan en círculos, dejando una gran brecha entre lo que pueden hacer y lo que pueden lograr los modelos cerrados y costosos.

Presentamos HiMemVLN, un nuevo enfoque que enseña a los cerebros robóticos de código abierto a recordar dónde han estado y hacia dónde van, curando efectivamente su "amnesia de navegación". Los investigadores descubrieron que estos robots de código abierto sufren de dos tipos de olvido: amnesia a corto plazo, donde pierden el rastro de los alrededores inmediatos y terminan caminando en bucles, y amnesia a largo plazo, donde olvidan el objetivo original y se desvían del curso tras unos pocos pasos. Para solucionar esto, el equipo construyó un "sistema de memoria jerárquico" inspirado en cómo funcionan los cerebros humanos. Crearon un Short-Term Localer (Localizador de Corto Plazo) que actúa como un cuaderno de bocetos visual, dibujando constantemente un mapa de las habitaciones que acaba de visitar para detectar si está caminando en círculos. También construyeron un Long-Term Globaler (Globalizador de Largo Plazo) que actúa como una brújula y un controlador de misiones, recordándole constantemente al robot el panorama general: "Empezaste en el dormitorio, necesitas ir a la cocina y actualmente te diriges en la dirección equivocada".

Al combinar estos dos sistemas de memoria, HiMemVLN permite que los robots de código abierto naveguen con un nivel de confiabilidad que anteriormente solo se veía en los modelos cerrados y costosos. En las pruebas, este método no solo ayudó a los robots a evitar bucles; casi duplicó su tasa de éxito en comparación con los mejores métodos de código abierto anteriores. En entornos simulados, el nuevo sistema logró una tasa de éxito del 30% y una longitud de trayectoria ponderada por el éxito (SPL) de 26.85, superando significativamente al líder anterior de código abierto, OpenNav, que solo logró un 16% de éxito. Los investigadores también lo probaron en un robot con ruedas real en habitaciones reales, donde nuevamente superó a la competencia, logrando una tasa de éxito del 32% frente al 18% de OpenNav. El estudio sugiere que, al dar a los robots una forma estructurada de recordar tanto sus alrededores visuales inmediatos como sus objetivos a largo plazo, podemos construir agentes de navegación seguros, privados y altamente capaces que no necesitan depender de la nube.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →