Reinforcement Learning for Real-Time Vision-Language-Action Policies
Este artículo presenta Real-Time EXPO-FT, un marco de aprendizaje por refuerzo que desacopla la generación de acciones expresivas y lentas de la edición de acciones reactiva y rápida para permitir una adaptación eficiente en muestras y de alto rendimiento de los grandes modelos de Visión-Lenguaje-Acción a la dinámica del mundo real a pesar de la latencia de inferencia.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Los robots han luchado durante mucho tiempo por moverse con la fluidez de los seres vivos. Si bien pueden ser programados para seguir un conjunto rígido de instrucciones en una fábrica, el mundo real es desordenado, impredecible y se mueve rápido. Para navegar esto, los investigadores han recurrido a un tipo de inteligencia artificial conocida como un modelo de visión-lenguaje-acción. Estos son programas informáticos masivos entrenados con enormes cantidades de datos, lo que les permite entender lo que ven a través de una cámara, leer una instrucción de texto y decidir cómo mover un brazo robótico. Son poderosos porque han visto tantos ejemplos de cómo funciona el mundo, actuando como una vasta biblioteca de experiencia. Sin embargo, hay un inconveniente significativo: debido a que estos modelos son tan grandes y complejos, tardan un tiempo notable en pensar. En el split segundo que la computadora tarda en procesar una imagen y decidir un movimiento, el mundo físico ya ha cambiado. Si un robot intenta atrapar una pelota o equilibrar un objeto, la información que utilizó para tomar su decisión ya es vieja para cuando realmente actúa, lo que a menudo causa que la acción falle.
Un equipo de investigadores de la Universidad de Stanford ha desarrollado una nueva forma de enseñar a estos grandes modelos a actuar en tiempo real, incluso cuando son lentos para pensar. Su enfoque, llamado Real-Time EXPO-FT, resuelve el problema del retraso dividiendo la toma de decisiones del robot en dos partes distintas. En lugar de obligar al modelo masivo y lento a realizar cada uno de los ajustes de cada split segundo, permiten que este realice el trabajo pesado de planificar una trayectoria general, mientras que un programa informático mucho más pequeño y rápido se encarga de las correcciones inmediatas. Imagine a un director dirigiendo una orquesta; el director establece el tempo y la melodía general, pero los músicos individuales deben ajustar su ejecución instantáneamente para mantenerse en sincronía. En este sistema, el modelo grande actúa como el director, proponiendo una secuencia de movimientos basada en lo que vio un momento antes. Luego, un asistente ligero observa el estado actual del mundo y realiza pequeñas y rápidas ediciones a esos movimientos propuestos para asegurar que sigan siendo correctos para el momento exacto en que el robot necesita actuar. Esto permite que el robot utilice el profundo conocimiento del modelo grande sin verse frenado por su velocidad de pensamiento lenta.
Los investigadores probaron este método en dos entornos muy diferentes: un mundo simulado de física y el mundo físico real. En la simulación, desafiaron al robot con diez tareas dinámicas diferentes, tales como equilibrar una pelota sobre un plato, patear una pelota de fútbol evitando a un defensor y atrapar un objeto en movimiento. Compararon su nuevo método contra varias técnicas existentes que intentaban manejar los retrasos. Los resultados fueron claros: el nuevo enfoque permitió al robot tener éxito en casi todos los ensayos, superando a todos los demás métodos, incluyendo aquellos que no tenían que lidñar con retrasos en absoluto. Este fue un hallazgo significativo porque demostró que, al enseñar explícitamente al sistema a tener en cuenta su propia lentitud, el robot podía volverse más confiable que los sistemas que eran teóricamente más rápidos pero menos adaptables.
Para demostrar que esto funcionaba en el mundo real, el equipo trasladó al robot a un entorno de laboratorio y le asignó cuatro tareas desafiantes que requerían una reacción constante y rápida. Estas incluían mantener una pelota de ping-pong equilibrada sobre un plato giratorio, recoger un bloque de una superficie giratoria, atrapar un objeto pasado por otro brazo robótico y patear una pelota hacia una portería mientras un defensor se movía alrededor. Los investigadores limitaron el tiempo de entrenamiento a solo diez minutos de interacción del robot con el entorno, asegurando que el sistema pudiera aprender rápidamente sin necesitar horas interminables de práctica. Antes de aplicar su método, la tasa de éxito del robot en estas tareas era bastante baja, promediando alrededor del 42 por ciento. Después de usar este nuevo marco de entrenamiento en tiempo real, la tasa de éxito saltó al 97 por ciento. El robot aprendió a adaptarse a los movimientos caóticos de los objetos y a las restricciones de tiempo de las tareas sin ninguna intervención humana durante el proceso de entrenamiento.
El estudio también exploró qué tan bien se mantenía el sistema bajo diferentes condiciones. Cuando los investigadores aumentaron artificialmente el retraso en el proceso de pensamiento del robot, el nuevo método mantuvo su alto nivel de desempeño, mientras que otros métodos fallaron a medida que el retraso crecía. Del mismo modo, cuando la velocidad de los objetos en movimiento aumentó, el robot que utilizaba este nuevo marco continuó teniendo éxito, mientras que otros enfoques tuvieron dificultades para seguir el ritmo. Esto demuestra que el sistema no solo funciona para una velocidad o retraso específicos, sino que es lo suficientemente robusto como para manejar la naturaleza impredecible de un entorno dinámico. Los investigadores señalaron que, si bien su sistema es altamente efectivo, todavía depende de un humano para reiniciar el robot después de que se termina una tarea, y requiere una forma específica de definir el éxito para cada tarea. Sin embargo, el logro central es una demostración de que los modelos de IA grandes y poderosos pueden hacerse trabajar en tiempo real, cerrando la brecha entre la planificación lenta y reflexiva de la inteligencia artificial y las demandas rápidas y reactivas del mundo físico.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.