Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
El artículo presenta VLAct, un enfoque de preentrenamiento continuo centrado en la representación para modelos de Visión-Lenguaje-Acción que aprovecha datos de múltiples embodiment heterogéneos para lograr una transferencia y un rendimiento superiores en diversas tareas y robots no vistos, incluso con presupuestos de cómputo modestos y datos de seguimiento limitados.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Los robots han luchado durante mucho tiempo para aprender de la experiencia de la misma manera que lo hacen los humanos. Mientras que un niño puede observar a un padre verter un vaso de agua y comprender el movimiento, un robot normalmente requiere miles de instrucciones específicas y codificadas a mano para realizar la misma tarea. Durante años, los científicos han intentado resolver esto alimentando a los robots con cantidades masivas de datos, con la esperanza de que el puro volumen les enseñara cómo moverse. Este enfoque se basa en modelos de Visión-Lenguaje-Acción, que son sistemas informáticos capaces de ver una imagen, comprender una frase y decidir un movimiento físico. La creencia predominante ha sido que, si simplemente se recolectan suficientes movimientos robóticos, el sistema se volverá naturalmente lo suficientemente inteligente como para manejar cualquier situación. Sin embargo, recopilar datos de robots es increíblemente difícil y costoso; a diferencia de las fotos o el texto en internet, los movimientos de los robots deben registrarse en el mundo físico real, a menudo por humanos que guían a las máquinas. Esta escasez significa que incluso los conjuntos de datos robóticos más grandes son diminutos y dispersos en comparación con la vastedad del mundo físico.
Un equipo de investigadores ha propuesto ahora un camino diferente hacia adelante, sugiriendo que la calidad de lo que un robot aprende es más importante que la cantidad de datos que ve. Argumentan que, en lugar de simplemente memorizar movimientos específicos, el cerebro de un robot necesita aprender una comprensión profunda y flexible de cómo los objetos y las acciones se relacionan entre sí. Al centrarse en esta "representación" —el mapa interno que el robot construye del mundo—, han creado un nuevo método de entrenamiento que permite a los robots generalizar mucho mejor. Su trabajo demuestra que, con una forma más inteligente de enseñar el cerebro central del robot, un sistema puede aprender a realizar tareas complejas en robots que nunca ha visto antes, utilizando solo una fracción de los datos que se creía necesarios anteriormente.
Los investigadores, trabajando bajo el nombre de VLAct, partieron de una pregunta fundamental: ¿por qué fallan los robots al generalizar? Cuando un robot es entrenado en un conjunto específico de movimientos, a menudo se vuelve demasiado especializado, aprendiendo a imitar los patrones exactos que vio en lugar de comprender la física subyacente de la tarea. Para investigar esto, el equipo observó cómo diferentes formas de enseñar a un robot afectaban su comprensión interna. Descubrieron que si un robot es entrenado para predecir acciones usando solo un método específico, queda "bloqueado" en ese método. Es como un estudiante que aprende a resolver problemas matemáticos usando solo una fórmula específica; si el examen cambia el formato de la pregunta, el estudiante falla porque nunca aprendió el concepto en sí. Los investigadores descubrieron que este "bloqueo" ocurre cuando el cerebro del robot es forzado a ajustar su conocimiento en una estructura única y rígida durante el entrenamiento.
Para solucionar esto, el equipo desarrolló una nueva receta de entrenamiento que mantiene el cerebro del robot flexible. Comenzaron con un potente modelo de visión-lenguaje, un tipo de inteligencia artificial ya entrenada en vastas cantidades de imágenes y texto de internet, lo que le otorza una comprensión amplia del mundo. En lugar de permitir que el entrenamiento del robot sobrescriba este conocimiento amplio, protegieron las capas inferiores del cerebro que manejan el reconocimiento visual básico. Luego introdujeron una técnica de entrenamiento única donde se le pedía al robot que predijera los mismos movimientos físicos utilizando tres métodos matemáticos diferentes simultáneamente. Al obligar al robot a satisfacer los tres métodos a la vez, los investigadores evitaron que se especializara en uno solo. Este enfoque aseguró que el robot aprendiera una comprensión universal de la acción, en lugar de una habilidad estrecha ligada a una única forma de calcular el movimiento.
Además, el equipo abordó el problema de los diferentes cuerpos robóticos. Un robot con dos brazos se mueve de forma distinta a uno con un solo brazo, y un robot con una pinza se mueve de forma distinta a uno con una mano. Los métodos anteriores solían tratar estas diferencias como problemas separados, entrenando un cerebro único para cada tipo de robot. El equipo de VLAct, en cambio, creó un lenguaje compartido para el movimiento. Enseñaron al robot que abrir una pinza en una máquina es el mismo concepto que abrir una pinza en otra, incluso si la mecánica física difiere. Lograron esto alineando las partes de la acción que son físicamente similares, como el abrir y cerrar de una mano, mientras dejaban las partes únicas de cada cuerpo robótico por separado. Esto permitió que el robot transfiriera lo aprendido de un tipo de máquina a un tipo de máquina completamente diferente que nunca había encontrado.
Los resultados de este enfoque fueron impactantes. Cuando se probó en una amplia gama de tareas, el nuevo sistema superó consistentemente a los modelos existentes, incluyendo aquellos entrenados con conjuntos de datos mucho más grandes. En un benchmark de simulación llamado LIBERO-Plus, que pone a prueba qué tan bien un robot maneja cambios en la iluminación, ángulos de cámara y colocación de objetos, el nuevo sistema alcanzó una tasa de éxito del 82.6 por ciento. Esto fue significativamente superior a otros sistemas líderes, demostrando que el robot había aprendido una comprensión robusta de la tarea en lugar de solo memorizar un escenario específico. En otro benchmark llamado RoboTwin 2.0, que involucra a dos brazos robóticos trabajando juntos, el sistema alcanzó una tasa de éxito del 92.5 por ciento, superando a sistemas industriales a gran escala que dependen de datos propietarios y una capacidad de cómputo masiva.
Quizás la evidencia más convincente del poder de este método provino de una prueba que involucró a un robot humanoide completamente nuevo para los datos de entrenamiento. Los investigadores entrenaron su sistema con datos de brazos robóticos estándar y luego le pidieron que controlara un robot humanoide con piernas y torso, una máquina que nunca había visto. Usando solo el 20 por ciento de los datos típicamente requeridos para entrenar a un robot para ese cuerpo específico, el sistema funcionó mejor que un modelo base entrenado con el 100 por ciento de los datos. Esto sugiere que el robot había aprendido un concepto fundamental de "cómo moverse" que podía aplicarse a cualquier cuerpo, en lugar de solo memorizar los movimientos específicos de los brazos sobre los que fue entrenado.
Los investigadores también probaron su sistema en el mundo real, utilizando brazos robóticos físicos para realizar tareas como apilar bloques, limpiar mesas y doblar ropa. En estos experimentos del mundo real, el sistema continuó superando al modelo base, mostrando mayor estabilidad y precisión. Manejó con éxito objetos novedosos que nunca había visto, como recoger un pimiento en lugar de una zanahoria, y gestionó tareas complejas de múltiples pasos como recoger frijoles y verterlos en un tazón sin saltarse pasos. El sistema también destacó en la coordinación de dos brazos para trabajar juntos, como sostener un enchufe mientras se tira de un cable, demostiendo un nivel de sincronización que los modelos previos tenían dificultades para lograr.
Lo que hace que este trabajo sea particularmente significativo es que se logró utilizando únicamente datos de código abierto y una cantidad modesta de potencia de cómputo, específicamente una configuración con 16 unidades de procesamiento gráfico. Esto contrasta con muchos de los sistemas con mejor desempeño en el campo, que dependen de conjuntos de datos propietarios y recursos de computación a escala industrial masiva. Los investigadores demostraron que, al centrarse en cómo el robot representa el mundo internamente, en lugar de solo escalar la cantidad de datos, es posible construir robots más capaces y adaptables. Sus hallazgos sugieren que el futuro del aprendizaje robótico no reside en la recolección de flujos interminables de datos, sino en el diseño de métodos de entrenamiento que ayuden al robot a construir una comprensión más profunda y flexible del mundo físico.
El estudio concluye que la forma en que se enseña a un robot es tan importante como lo que se le enseña. Al preservar el conocimiento amplio de un cerebro preentrenado y fomentar que aprenda acciones de una manera que no esté ligada a un solo método o tipo de cuerpo, los investigadores pueden crear sistemas que sean mucho más capaces de manejar la naturaleza impredecible del mundo real. Este enfoque ofrece un camino prometedor hacia robots de propósito general que pueden aprender nuevas tareas rápidamente y adaptarse a nuevos entornos sin requerir cantidades masivas de nuevos datos. El trabajo ha sido puesto a disposición del público, permitiendo que otros científicos construyan sobre estos hallazgos y exploren más a fondo cómo enseñar a las máquinas a moverse con la misma flexibilidad y comprensión que los seres vivos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.