← Últimos artículos
💻 computer science

VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

VerNav es un marco de trabajo centrado en el verificador para la Navegación de Visión y Lenguaje que reduce significativamente la latencia en la etapa de decisión al reemplazar la generación autorregresiva paso a paso con una verificación de acciones por lotes y un generador adaptativo basado en la entropía, mientras emplea un esquema de alineación de dos etapas para mantener un rendimiento de navegación competitivo en el benchmark R2R.

Autores originales: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

Publicado 2026-09-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina a un robot intentando encontrar su camino a través de una casa que nunca ha visto, guiado únicamente por una frase hablada como "ve a la cocina, gira a la izquierda en la silla azul y detente". Este es el desafío de la navegación de visión y lenguaje. El robot debe observar su entorno, comprender las palabras del humano y decidir exactamente hacia dónde moverse a continuación. Durante mucho tiempo, los investigadores han intentado resolver esto dándole al robot un cerebro potente que se hable a sí mismo en cada uno de sus pasos. Antes de realizar un movimiento, el robot generaría un largo flujo de pensamientos, explicando su razonamiento, comprobando su entorno y planificando su próximo giro. Si bien este pensamiento explícito ayuda al robot a comprender instrucciones complejas, es increíblemente lento. Al igual que un humano que verbaliza cada paso de una caminata se movería mucho más lento que uno que simplemente camina, un robot que genera un párrafo completo de razonamiento antes de cada paso individual tarda demasiado en tomar una decisión. En el mundo real, donde la velocidad importa, este retraso hace que la tecnología sea poco práctica.

Un equipo de investigadores de la Universidad de Ciencia y Tecnología Electrónica de China ha propuesto una forma diferente de pensar en este problema. Sugieren que, en lugar de obligar al robot a escribir una larga historia antes de cada movimiento, este debería primero revisar rápidamente una lista de posibles movimientos y elegir el mejor. Llaman a su nuevo sistema VerNav. La idea central es reemplazar la lenta generación de pensamientos paso a paso con un proceso rápido de verificación. En lugar de pedirle al cerebro del robot que invente un nuevo camino desde cero, el sistema presenta un conjunto de direcciones disponibles —como "avanzar", "girar a la izquierda" o "detenerse"— y le pide al cerebro que simplemente diga "sí" o "no" a cada una. Esto permite que el robot evalúe todas sus opciones a la vez, en lugar de una por una. Al hacer esto, el sistema reduce el tiempo que tarda en tomar una decisión en más de diez veces en comparación con los métodos tradicionales, manteniendo al mismo tiempo al robot en el camino correcto.

Sin embargo, el simple hecho de comprobar las opciones rápidamente no es suficiente. Los investigadores descubrieron que si solo utilizaban este método de comprobación rápida, el robot se confundiría y cometería errores, especialmente en situaciones complicadas. El comprobador rápido es bueno descartando malas ideas, pero a veces tiene dificultades para elegir la mejor idea única cuando las opciones son muy similares. Para solucionar esto, el equipo añadió una red de seguridad inteligente. Construyeron un sistema que vigila la confianza del robot. Si el robot está seguro de hacia dónde ir, se mantiene en el método de comprobación rápida. Pero si el robot no está seguro —indicado por un alto nivel de confusión entre las posibles opciones—, el sistema hace una pausa y pide a un motor de pensamiento más potente y lento que proporcione un resumen breve y enfocado de la situación. Este resumen actúa como una pista rápida para ayudar al comprobador rápido a tomar la decisión correcta. De esta manera, el robot solo utiliza la potencia de pensamiento lenta y costosa cuando es absolutamente necesario, manteniendo todo el proceso rápido y eficiente.

Para asegurarse de que este sistema de comprobación rápida realmente funciona bien para la navegación, los investigadores tuvieron que enseñarle cómo juzgar los movimientos correctamente. Desarrollaron un proceso de entrenamiento de dos pasos. Primero, enseñaron al sistema a reconocer qué movimientos inmediatos son mejores que otros, ayudándolo a aprender a preferir acciones que lo acerquen al objetivo. Luego, dejaron que el sistema practicara la navegación de trayectos enteros, recompensándolo no solo por el destino final, sino por cada pequeño paso que supuso un progreso. Este entrenamiento aseguró que el comprobador rápido no solo eligiera movimientos al azar, sino que aprendiera a seguir las instrucciones con precisión a través de largas distancias. Al ser probado en un conjunto estándar de tareas de navegación, el nuevo sistema funcionó tan bien como los mejores robots existentes que utilizan un pensamiento pesado y lento, pero tomó decisiones en una fracción del tiempo. Los resultados muestran que, al comprobar las opciones rápidamente y solo recurrir al pensamiento profundo cuando es necesario, los robots pueden navegar por entornos complejos mucho más rápido sin perder el rumbo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →