← Últimos artículos
💻 computer science

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

El artículo propone VLN-AVP, un marco de navegación zero-shot para el estacionamiento autónomo de valet que combina la percepción de vista aérea (Bird's-Eye-View) con modelos de lenguaje-visión y un sistema de memoria híbrido para eliminar la dependencia de mapas, interpretar instrucciones de lenguaje natural y lograr un rendimiento superior tanto en simulación como en entornos de estacionamiento subterráneo del mundo real.

Autores originales: Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

Publicado 2026-07-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a conducir. Durante mucho tiempo, la única forma de enseñar a un robot a estacionar un auto era darle un mapa perfecto y pre-dibujado de todo el estacionamiento, como un mapa del tesoro con cada giro y obstáculo marcado en tinta. Esto funciona de maravilla si conoces el edificio, pero si entras en un garaje nuevo y desconocido, el robot se queda bloqueado porque no tiene su mapa. Este es el mundo del "Estacionamiento Valet Autónomo" (AVP, por sus siglas en inglés), donde los autos se estacionan solos para ti. Pero, ¿qué pasaría si el robot pudiera simplemente mirar a su alrededor, leer los letreros y entender a un humano diciendo: "Busca un lugar cerca del elevador", sin necesidad de un mapa? Aquí es donde entra la "Navegación de Visión y Lenguaje" (VLN). Piensa en la VLN como enseñar a un robot a comprender el mundo a través de una combinación de sus ojos (visión) y la capacidad de su cerebro para leer y razonar con palabras (lenguaje). La gran pregunta que los investigadores se hacen es: ¿Podemos hacer que un auto autónomo sea lo suficientemente inteligente como para navegar por un extraño estacionamiento subterráneo simplemente escuchándonos y mirando los letreros, sin haber visto nunca un mapa pre-construido antes?

Este artículo presenta un nuevo sistema llamado VLN-AVP, que intenta resolver exactamente ese problema. Los autores proponen un marco de navegación "zero-shot" (de cero conocimiento), que es una forma elegante de decir que el sistema puede manejar un estacionamiento completamente nuevo que nunca ha visto, utilizando únicamente instrucciones de lenguaje natural de un humano. En lugar de depender de un mapa pre-construido, el sistema utiliza un potente "Modelo de Visión y Lenguaje" (VLM)—piensa en esto como un cerebro robótico súper inteligente que puede mirar una imagen y leer una oración para descifrar qué hacer. Sin embargo, los autores descubrieron que el simple hecho de darle al robot un cerebro inteligente no es suficiente; necesita una mejor memoria para evitar confundirse.

Para solucionar esto, el equipo construyó un sistema de memoria híbrido con dos partes distintas. Primero, hay una Memoria a Corto Plazo, que actúa como la "memoria de trabajo" inmediata del robot. Dado que el cerebro inteligente (el VLM) no observa el mundo de forma muy rápida, podría perderse un letrero que pasa rápidamente. La Memoria a Corto Plazo mantiene una lista reciente de letreros y pistas visuales, para que el robot no olvide que acaba de ver un letrero de "Salida" hace tres segundos. Segundo, existe una Memoria Topológica a Largo Plazo, que es como un boceto mental que el robot dibuja del estacionamiento mientras conduce. Cada vez que el robot encuentra con éxito una ruta o un punto de referencia (como un elevador específico), lo añade a este boceto. Si el robot tiene que navegar por el mismo estacionamiento nuevamente, puede usar este boceto para moverse más rápido y de manera más eficiente, en lugar de pedirle al cerebro inteligente que lo resuelva todo desde cero cada vez.

Los investigadores probaron esta idea de dos maneras: en una simulación computacional de alta fidelidad y en un auto real en un estacionamiento subterráneo real. Crearon un nuevo conjunto de datos llamado VLN-AVP, que cuenta con 10 escenas de estacionamiento 3D de alta calidad y más de 1,000 episodios de navegación, que es la colección más grande de escenas de garajes subterráneos jamás creada para este tipo de investigación.

Los resultados fueron prometedores. En las simulaciones, el sistema VLN-AVP fue significativamente mejor que otros métodos. Logró una tasa de éxito que fue más de un 25% mayor que otros métodos de Navegación de Visión y Lenguaje y más de un 15% mayor que otros métodos de conducción autónoma. En las pruebas del mundo real con el auto real, el sistema también funcionó bien, navegando con éxito instrucciones complejas como "busca un lugar cerca del vestíbulo del elevador" e incluso corrigiendo su curso cuando un humano le dijo: "No, ese es el elevador equivocado, sigue adelante". El estudio sugiere que, al combinar un cerebro de lenguaje inteligente con un ingenioso sistema de memoria de dos partes, podemos hacer autos que se estacionan solos que sean mucho más flexibles y que no necesiten un mapa pre-dibujado para cumplir con su tarea.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →