Robostral Navigate
Robostral Navigate es un modelo de lenguaje-visión de 8B que logra el estado del arte en navegación monocular a través de diversos encarnamientos robóticos mediante el aprovechamiento de una receta de entrenamiento escalable con 2.4 millones de trayectorias simuladas, eficiencia de caché de prefijo y predicción de puntos de ruta en el espacio de la imagen para eliminar la necesidad de sensores de profundidad o mapas preconstruidos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás enseñando a un robot a ser un guía turístico. En el mundo de la robótica, esto se llama "navegación encarnada" (embodied navigation): la capacidad de una máquina para entender un comando hablado como "ve a la cocina" y realmente caminar hacia allí sin chocar con las paredes. Durante mucho tiempo, los mejores guías turísticos fueron como astronautas de alta gama: necesitaban equipo costoso y pesado para hacer su trabajo. Usaban gafas 3D especiales (sensores de profundidad), cargaban con múltiples cámaras como un equipo de seguridad o dependían de mapas pre-dibujados de todo el edificio. Aunque estos robots eran buenos, también eran caros, frágiles y difíciles de adaptar a un simple dron de entrega o a una rueda de almacén pequeña. La gran pregunta que los científicos se han estado haciendo es: ¿Podemos construir un robot que sea igual de inteligente pero que utilice la herramienta más simple y común disponible? La respuesta reside en una única cámara estándar —el tipo de cámara que se encuentra en casi todos los teléfonos y robots de hoy en día— y un cerebro lo suficientemente potente como para descifrar el resto.
Este artículo presenta Robostral Navigate, un nuevo tipo de cerebro robótico diseñado para resolver el rompecabezas de la navegación utilizando únicamente esa cámara estándar. Piensa en él como un robot que no necesita un mapa 3D o un escáner láser; en su lugar, aprende a "señalar" el siguiente paso en un viaje con solo mirar una imagen. Los investigadores construyeron un "modelo de visión y lenguaje" de 8 mil millones de parámetros (una IA superinteligente que puede leer y ver) y le enseñaron a navegar mostrándole millones de ejemplos en una simulación similar a un videojico. En lugar de calcular matemáticas complejas sobre cuántos metros moverse, el modelo simplemente señala hacia donde quiere ir a continuación en la pantalla. Si el destino está oculto detrás de una esquina, cambia a un plan de respaldo de avanzar una cantidad específica.
El equipo descubrió que este enfoque simple es increíblemente poderoso. Al entrenar el modelo en 2.4 millones de trayectos simulados a través de 350,000 escenas diferentes, crearon un sistema que no solo es más barato y fácil de construir, sino también más inteligente que muchos robots con sensores sofisticados. En las pruebas estándar, Robostral Navigate logró una tasa de éxito del 77.4% al encontrar su camino, superando por un amplio margen a los mejores robots de una sola cámara previos e incluso superando a algunos robots que utilizaban sensores de profundidad o múltiples cámaras. El ingrediente secreto no fue solo el señalar; fue un nuevo truco de entrenamiento que hizo que el proceso de aprendizaje fuera 22 veces más rápido y una fase de aprendizaje por refuerzo que le enseñó al robot cómo recuperarse cuando se perdía. El resultado es un robot que puede saltar de un carro con ruedas a una máquina caminante o a un dron volador sin necesidad de ser reentrenado, demostando que no se necesita un conjunto de sensores de un millón de dólares para construir un robot verdaderamente de propósito general.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.