Riemann-1.0: An Embodied World Action Model for Physical AI
Riemann-1.0 es un modelo de acción mundial autorregresivo causal y unificado que integra observaciones multivista, estados robóticos y acciones en un único marco de trabajo, aprovechando una estrategia de preentrenamiento progresivo en más de 200,000 horas de datos corporales diversos para lograr un rendimiento de vanguardia tanto en simulación como en tareas de manipulación de largo horizonte en el mundo real.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La inteligencia artificial ha sido durante mucho tiempo una maestra del reino digital, leyendo texto, reconociendo imágenes y resolviendo acertijos dentro de los confines de una pantalla de computadora. Pero para que las máquinas se unan verdaderamente a nosotros en el mundo físico, deben hacer más que solo entender lo que ven; deben aprender a actuar dentro de él. Este es el desafío de la inteligencia encarnada: enseñar a los robots a percibir su entorno, razonar sobre la causa y el efecto, y ejecutar movimientos físicos con la misma fluidez que un humano usa para recoger una taza o doblar una camisa. Para que una máquina tenga éxito, necesita un modelo del mundo que comprenda no solo cómo se ven los objetos, sino cómo se mueven y cambian cuando se les toca. Debe aprender que empujar un bloque hace que este se deslice, y que levantar una tapa revela lo que hay dentro. Hasta ahora, crear un único sistema que pueda tanto planificar estas acciones físicas como predecir las consecuencias visuales de esas acciones ha sido un obstáculo difícil, que a menudo requería sistemas separados para pensar y para moverse.
Un equipo de investigadores ha presentado un nuevo sistema llamado Riemann-1.0, diseñado para cerrar esta brecha tratando las acciones de un robot y los cambios resultantes en el mundo como una historia única y continua. En lugar de construir herramientas separadas para decidir qué hacer y herramientas para imaginar qué pasará después, este modelo aprende a hacer ambas cosas a la vez. Opera bajo un principio simple pero poderoso: en el mundo real, una acción siempre ocurre antes de que se vea el resultado. Si un robot alcanza una cuchara, el movimiento ocurre primero, y el cambio visual —el movimiento de la cuchara— le sigue. Riemann-1.0 está construido para respetar este orden, aprendiendo de una enorme colección de datos de video y movimiento para predecir exactamente qué debe hacer un robot a continuación y cómo se verá el mundo después de que lo haga.
Para enseñar este sistema, los investigadores reunieron una vasta biblioteca de experiencias, sumando más de 200,000 horas de interacción. Esta colección no era solo un montón de videos de robots; era una mezcla cuidadosamente curada de tres tipos diferentes de material de aprendizaje. Primero, incluyeron miles de horas de videos grabados desde el punto de vista de un humano, mostrando a personas realizando tareas cotidianas como cocinar o limpiar. Estos videos proporcionaron una comprensión amplia de cómo interactúan los objetos y cómo se desarrollan las tareas a lo largo del tiempo, aunque carecían de los datos mecánicos específicos de un robot. Segundo, añadieron demostraciones de pinzas robóticas sostenidas a mano y dispositivos portátiles, que sirven como un puente, mostrando cómo los movimientos de la mano humana se traducen en controles de tipo mecánico. Finalmente, incluyeron grabaciones precisas de movimientos reales de robots, que proporcionaron las instrucciones exactas y ejecutables necesarias para enseñar a la máquina cómo mover sus propias extremidades. Al combinar estas fuentes, los investigadores crearon un conjunto de datos unificado que permitió al modelo aprender de la amplia sabiduría de la experiencia humana mientras fundamentaba ese conocimiento en la mecánica precisa del control robótico.
El proceso de entrenamiento para Riemann-1.0 fue estructurado como un currículo escolar, pasando de la observación general a la ejecución específica. En la primera etapa, el modelo estudió la vasta biblioteca de videos humanos. Dado que estos videos no tenían datos de movimiento robótico, el sistema utilizó una herramienta auxiliar para estimar las "acciones" invisibles que debieron causar los cambios visuales vistos en pantalla. Esto permitió al modelo aprender la dinámica básica de cómo se mueve el mundo sin necesidad de datos robóticos perfectos. En la segunda etapa, el modelo fue introducido con los datos mixtos de manos humanas y pinzas robóticas, aprendiendo a alinear su comprensión del movimiento con controles físicos reales. Finalmente, en la tercera etapa, el modelo se centró exclusivamente en grabaciones de alta calidad de robots realizando tareas. Esta fase final perfeccionó su capacidad para generar comandos precisos y ejecutables, asegurando que las acciones que planificaba fueran no solo visualmente plausibles, sino físicamente posibles de realizar para una máquina real.
Los resultados de este enfoque fueron sorprendentes. Cuando se probó en una amplia variedad de tareas, tanto en simulaciones por computadora como en robots reales, Riemann-1.0 superó a los métodos anteriores por un margen significativo. En una simulación diseñada para probar tareas largas y complejas que involucran muchos pasos, el modelo tuvo éxito el 62.6% de las veces, una mejora notable respecto a los mejores sistemas existentes. En otra simulación enfocada en robots de dos brazos, alcanzó una tasa de éxito del 94.3%. Quizás lo más impresionante es que, al ser desplegado en robots del mundo real para realizar tareas como apilar bloques de colores, doblar ropa, organizar un escritorio desordenado o arreglar artículos de cocina, el sistema completó las tareas con éxito el 85% de las veces. También mostró una capacidad notable para adaptarse a situaciones nuevas que no había visto antes, como colocar un cubo de Rubik en una caja o poner una toalla en un recipiente, teniendo éxito en el 85% de estos ensayos novedosos.
Más allá de actuar simplemente como un controlador de robots, Riemann-1.0 también puede funcionar como un simulador. Debido a que comprende el vínculo causal entre una acción y el resultado visual, los investigadores pueden preguntarle qué sucedería si un robot realizara un movimiento específico. El modelo puede generar un video del futuro, mostrando exactamente cómo se moverían los objetos y dónde terminarían, basándose en la acción proporcionada. Esta capacidad dual significa que el sistema puede servir tanto como el cerebro que decide qué hacer como la imaginación que verifica si el plan funcionará antes de que el robot se mueva. Esta capacidad de predecir el futuro del mundo físico, fundamentada en la realidad de cómo las acciones causan cambios, representa un paso significativo hacia la creación de una inteligencia artificial que sea un compañero confiable en el mundo físico. El trabajo sugiere que, al unificar el aprendizaje de cómo actuar con el aprendizaje de cómo responde el mundo, las máquinas pueden desarrollar una comprensión más robusta y generalizable de las tareas que realizamos cada día.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.