← Últimos artículos
💻 computer science

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

GE-Act 2.0 es un modelo de acción-mundo novedoso entrenado desde cero con datos de manipulación que integra un autoencoder orientado al control, un planificador visual de un solo paso y un modelo de dinámica inversa con optimización selectiva alineada con el conocimiento, logrando un éxito significativo en cero pasos a través de diversas tareas y encarnaciones mediante un escalado extensivo y transferencia entre encarnaciones.

Autores originales: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xion
Publicado 2026-09-09
📖 6 min de lectura🧠 Análisis profundo

Autores originales: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xiong, Linqing Zhong, Yifei Wei, Feng Han, Long Zhang, Da Huang, Nanshu Zhao, Chenghao Yin, Mo Wu, Zhaodong Yan, Kongtao Hu, Yuxiang Yan, Aogelijiang Niyazi, Yu Fang, Jia Zeng, Lizhu Meng, Daizhen Lv, Haoyu Cao, Zhiwen Hou, Lianjin Ye, Yuehan Niu, Zhikai Cai, Xuan Hu, Hui Min, Xiongfeng Cai, Yue Liao, Jing Wu, Soujanya Poria, Ye Li, Sanping Zhou, Maoqing Yao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots han sido durante mucho tiempo maestros en la planta de producción, repitiendo el mismo movimiento preciso miles de veces sin error. Pero si los introduces en una cocina, en una sala de estar o en un taller desordenado, a menudo se quedan paralizados. El desafío no es solo mover una mano; es comprender cómo cambia el mundo cuando esa mano toca algo. Para navegar esto, una nueva generación de inteligencia artificial está aprendiendo a imaginar el futuro. En lugar de simplemente reaccionar a lo que ve en este momento, estos sistemas intentan predecir qué sucederá después si realizan una acción específica. Este enfoque, conocido como un modelo de mundo-acción, permite que un robot simule una secuencia de eventos en su mente antes de mover un solo músculo, comprobando si el resultado coincide con su objetivo. Durante años, los investigadores han intentado construir estos sistemas tomando generadores de video existentes —programas entrenados para crear películas falsas— y obligándolos a comprender los movimientos robóticos. Sin embargo, este método a menudo deja al robot con una comprensión vaga de la física, ya que el generador de video nunca fue diseñado verdamente para controlar un cuerpo físico.

Un equipo de AgiBot ha introducido ahora un enfoque diferente, uno que construye la imaginación del robot desde cero utilizando únicamente datos de interacción del mundo real. Crearon un sistema llamado GE-Act 2.0, que aprende a predecir el futuro y a decidir acciones simultáneamente, pero con un giro crucial: cada parte del sistema es entrenada desde el principio con datos recolectados de robots y humanos manipulando objetos. Los investigadores no dependieron de modelos de video prefabricados. En su lugar, enseñaron al sistema un lenguaje comprimido de movimiento, una forma de ver el mundo que elimina los detalles innecesarios para enfocarse en lo que importa para el control. Esto permitió que el robot aprendiera de una biblioteca vasta y variada de datos, incluyendo horas de demostraciones exitosas, intentos fallidos e incluso videos de humanos trabajando sin ninguna instrucción registrada. Al combinar estos diferentes tipos de aprendizaje, el sistema aprendió a generalizar, lo que significa que pudo aplicar lo aprendido en una situación a una completamente nueva que nunca había visto antes.

El núcleo de este logro reside en cómo los investigadores manejaron la realidad desordenada del mundo físico. Cuando un robot intenta aprender, a menudo enfrenta un problema confuso: la misma instrucción puede completarse de muchas maneras diferentes. A un robot se le podría decir "levanta la taza roja", y podría acercarse por la izquierda, por la derecha, o agarrarla por el asa o por el borde. Si los datos de entrenamiento solo muestran una forma, pero la imaginación del robot predice otra, las dos partes del sistema pueden desincronizarse. Los investigadores identificaron este desajuste como una "brecha de validez", donde la predicción del futuro del robot no se alinea con la acción que debe realizar. Para solucionar esto, desarrollaron un proceso de selección que actúa como un filtro. Antes de que el robot aprenda de un futuro predicho, comprueba si ese futuro es compatible con la acción que necesita realizar. Genera varios futuros posibles, los pone a prueba contra la acción requerida y solo aprende de aquellos que tienen sentido juntos. Esto asegura que el robot no desdibuje su comprensión de cómo diferentes acciones conducen a diferentes resultados.

Los resultados de este entrenamiento son impactantes, particularmente cuando se prueban en tareas que el robot nunca ha practicado. Los investigadores evaluaron el sistema en cien tareas de manipulación distintas, que van desde apilar bloques y verter líquidos hasta doblar toallas e insertar enchufes. Estas pruebas se realizaron en robots reales en entornos con diferentes iluminaciones, fondos y disposiciones de objetos distintos a los utilizados durante el entrenamiento. Cuando el sistema fue entrenado con un conjunto pequeño de datos de 300 horas, tuvo éxito en solo el 17.1% de las tareas en un modelo de robot. Sin embargo, a medida que los investigadores escalaron el entrenamiento a 30,000 horas, la tasa de éxito aumentó constantemente hasta el 44.1%. Esta mejora ocurrió sin ningún ajuste específico para las tareas individuales; el robot simplemente aplicó las habilidades generales que había aprendido a los nuevos desafíos. Incluso más sorprendente, el sistema mostró fuertes capacidades en un segundo modelo de robot diferente que representaba menos del 2% de los datos de entrenamiento, lo que sugiere que las habilidades aprendidas del conjunto de datos más grande se transfirieron eficazmente a una nueva forma física.

La capacidad del sistema para seguir instrucciones también fue probada bajo condiciones difíciles. En muchas pruebas, se le pidió al robot que realizara una acción que conflictuaba con lo que podría haber esperado basándose en la escena o en un hábito previo. Por ejemplo, si un robot estaba en medio de un movimiento, aún podía detenerse y seguir una nueva orden explícita para cambiar su trayectoria. En más del 90% de estas pruebas, el robot identificó correctamente el objeto, color, forma o posición específica mencionada en la instrucción, incluso cuando esos detalles eran sutiles o el contexto era confuso. Los investigadores encontraron un fuerte vínculo entre la variedad de habilidades que el robot aprendió durante el entrenamiento y su capacidad para tener éxito en nuevas tareas. Cuanto más diversos eran los datos de entrenamiento, más probable era que el robot manejara una situación novedosa. Esto sugiere que el camino hacia robots más capaces no reside solo en mejores algoritmos, sino en el volumen y la variedad pura de los datos que consumen.

Este trabajo marca un paso significativo hacia robots que pueden aprender de los mismos datos ricos y no estructurados que los humanos utilizan para comprender el mundo. Al construir un sistema que predice el futuro y planifica acciones de manera unificada, y al enseñarle a seleccionar las predicciones correctas de entre muchas posibilidades, los investigadores han creado un modelo que es robusto y adaptable. Los hallazgos sugieren que, con suficiente experiencia diversa, un robot puede desarrollar una comprensión profunda e intuitiva de cómo se comportan los objetos y cómo interactuar con ellos, pasando de una programación rígida hacia una forma de inteligencia más flexible. El éxito de este enfoque en hardware real, sin necesidad de reentrenar para cada nuevo trabajo, apunta a un futuro donde los robots puedan ser desplegados en entornos dinámicos e impredecibles y aprender a prosperar en ellos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →