← Últimos artículos
🤖 AI

RTNav: Towards Real-Time Zero-Shot Object Navigation

El artículo presenta RTNav, una arquitectura de navegación en tiempo real que considera explícitamente la latencia de inferencia y el paso asíncrono del entorno para superar la degradación del rendimiento de los métodos existentes de navegación de objetos zero-shot bajo restricciones temporales realistas, logrando mejoras significativas en las tasas de éxito en los bancos de pruebas HM3D.

Autores originales: Easop Lee, Lingyu Zhang, Boyuan Chen

Publicado 2026-08-28
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Easop Lee, Lingyu Zhang, Boyuan Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un robot enviado a una casa desconocida para encontrar un objeto específico, como una taza roja, sin haber recibido entrenamiento previo en esa habitación en particular. Para tener éxito, el robot debe mirar a su alrededor, comprender lo que ve, decidir a dónde ir después y mover sus ruedas o piernas, todo esto mientras el mundo a su alrededor continúa cambiando. Este es el desafío de la navegación de objetos de disparo cero (zero-shot): utilizar inteligencia artificial potente para guiar a una máquina a través de lo desconocido. Durante años, los investigadores han probado estos sistemas en simulaciones por computadora donde el mundo virtual se pausa mientras el cerebro del robot piensa. En este estado congelado, el robot puede tardar todo el tiempo que necesite para procesar una imagen o tomar una decisión, y el reloj no avanza. Esta configuración ha permitido a los científicos construir agentes de navegación cada vez más complejos y capaces, pero oculta un fallo crítico. En el mundo real, el tiempo nunca se detiene. Mientras un robot calcula su siguiente movimiento, pasan segundos, el robot se queda quieto y el presupuesto de la tarea —el tiempo permitido para terminar el trabajo— se reduce. Si un robot tarda demasiado en pensar, simplemente no puede completar la tarea, sin importar cuán inteligente sea su razonamiento.

Un equipo de investigadores de la Universidad de Duke ha expuesto ahora este costo oculto y ha propuesto una nueva forma de construir sistemas de navegación que respeten el tictac del reloj. Descubrieron que los agentes de navegación más avanzados, que dependen de modelos de IA grandes y potentes para comprender el lenguaje y la visión, sufren una caída dramática en su rendimiento cuando se ven obligados a operar en tiempo real. En su estudio, crearon un nuevo entorno de prueba donde la simulación se ejecuta continuamente, tal como una habitación real, mientras la computadora del robot trabaja para decidir su siguiente paso. Cuando ejecutaron los métodos de navegación estándar en este entorno, los agentes se volvieron lentos e ineficientes. El tiempo dedicado a esperar que la computadora terminara sus cálculos significaba que el robot pasaba una parte significativa de su tiempo inmóvil, perdiendo a menudo oportunidades de alcanzar su objetivo antes de que se agotara el tiempo. Los investigadores midieron esto utilizando una nueva métrica que recompensa no solo encontrar el objeto, sino hacerlo rápidamente, penalizando cualquier segundo desperdiciado.

Para resolver esto, el equipo introdujo una nueva arquitectura llamada RTNav, que trata el flujo del tiempo como una parte fundamental del diseño en lugar de una ocurrencia tardía. En lugar de obligar al robot a detenerse y esperar a que cada parte de su cerebro termine un único pensamiento antes de moverse, RTNav permite que diferentes partes del sistema trabajen a sus propias velocidades naturales. La parte del sistema que detecta objetos funciona constantemente, escaneando el entorno muchas veces por segundo. La parte que planifica la ruta se ejecuta con menos frecuencia, actualizándose solo cuando es necesario. La parte que controla las ruedas se mueve continuamente, reaccionando al último plan sin esperar a que uno nuevo se haya formado completamente. Esto es similar a cómo un humano podría caminar por una calle concurrida: no te detienes por completo a pensar en cada paso; sigues moviéndote mientras tus ojos escanean obstáculos y tu mente actualiza tu trayectoria. Al permitir que estos procesos ocurran simultáneamente en lugar de en una línea estricta, el robot se mantiene en movimiento y utiliza su tiempo de manera eficiente.

Los resultados de este enfoque fueron sorprendentes. Al ser probado en evaluaciones de navegación estándar, el nuevo sistema superó significamente a los métodos anteriores. En pruebas donde el robot tenía que encontrar objetos en entornos complejos de múltiples habitaciones, el nuevo sistema mejoró la tasa de éxito hasta en un 11 por ciento en comparación con los mejores métodos existentes. Más importante aún, completó las tareas mucho más rápido. Los investigadores midieron una métrica llamada éxito ponderado por el tiempo de finalización, que combina si el robot encontró el objeto con cuánto tiempo le tomó. El nuevo sistema obtuvo hasta 5.1 puntos más en esta métrica, lo que indica que no solo fue más exitoso, sino también mucho más eficiente. El estudio mostró que los métodos antiguos, que fueron diseñados para el mundo de la simulación congelada, desperdiciaban una gran cantidad de tiempo esperando a que terminaran los cálculos. En contraste, el nuevo sistema mantuvo al robot en movimiento, reduciendo el tiempo que pasaba ocioso en más de un 14 por ciento en comparación con sus competidores.

Los investigadores también probaron qué tan robusto es este sistema ejecutándolo en diferentes tipos de hardware de computadora, desde potentes tarjetas gráficas de escritorio hasta chips más pequeños y de bajo consumo diseñados para dispositivos de borde (edge devices). El sistema funcionó de manera consistente en todos ellos, manteniendo altas tasas de éxito incluso cuando la potencia de cómputo se reducía. Esto sugiere que el diseño es lo suficientemente flexible como para trabajar en varios robots sin necesidad del hardware más caro disponible. El equipo también experimentó con diferentes tamaños de los modelos de inteligencia artificial utilizados para el razonamiento. Encontraron que, si bien no era estrictamente necesario un modelo muy grande, un modelo de tamaño medio proporcionaba el mejor equilibrio entre velocidad y precisión, permitiendo que el robot tomara buenas decisiones sin estancarse por un procesamiento lento.

Este trabajo destaca un cambio crucial en la forma en que debemos construir robots para el mundo real. La vieja forma de probar, donde el mundo espera a que el robot piense, ya no refleja la realidad del despliegue. El estudio demuestra que, para que los robots sean prácticos en entornos cotidianos, su software debe estar diseñado para manejar las restricciones de la ejecución en tiempo real. Al desacoplar las diferentes tareas de percepción, planificación y movimiento, y permitir que funcionen en paralelo, los robots pueden volverse mucho más receptivos y efectivos. Los investigadores concluyen que ignorar el costo del tiempo de computación conduce a sistemas que se ven bien en simulación pero fallan en la práctica. Su nuevo enfoque ofrece un camino a seguir, mostrando que con la arquitectura adecuada, los robots pueden navegar por el mundo desconocido de manera rápida y confiable, convirtiendo la promesa teórica de la inteligencia artificial en una realidad práctica.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →