← Últimos artículos
💻 computer science

WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors

El artículo presenta WholeBodyWAM, un modelo de acción-mundo humanoide que aprovecha un corpus de movimiento heterogéneo a gran escala (UniMotion-4K) para preentrenar un prior de movimiento transferible, lo cual mejora significamente la eficiencia de datos y el rendimiento de manipulación descendente cuando se integra con expertos de video y acción mediante atención de Mezcla de Transformers asimétrica.

Autores originales: Bowei Zhang, Qiyao Zhang, Shuanghao Bai, Xinhua Wang, Meng Li, Yilei Wang, Leiwang Zhang, Jian Tang, Lu Zhou, Lei Sun, Zhengping Che

Publicado 2026-09-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Bowei Zhang, Qiyao Zhang, Shuanghao Bai, Xinhua Wang, Meng Li, Yilei Wang, Leiwang Zhang, Jian Tang, Lu Zhou, Lei Sun, Zhengping Che

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Para que un robot se mueva como un humano, los ingenieros se enfrentan a un problema fundamental: enseñar a una máquina a coordinar todo su cuerpo es increíblemente difícil. Un ser humano no piensa en mover cada músculo individual al alcanzar una taza o caminar por una habitación; el cuerpo se mueve como una unidad única y fluida. Para los robots, sin embargo, cada articulación y extremidad debe ser comandada por separado, y recopilar los millones de horas de datos de práctica necesarios para enseñar este conocimiento a un robot específico es lento, costoso y, a menudo, imposible. Si bien los científicos han construido modelos potentes que pueden entender el lenguaje y ver el mundo, estos sistemas suelen tener dificultades para predecir cómo se moverá el propio cuerpo de un robot en el futuro, basándose en su lugar en reaccionar a lo que está sucediendo en ese mismo instante. Esta limitación dificulta que los robots realicen tareas complejas que requieren planificar con antelación, como cargar una caja pesada mientras navegan por un terreno irregular o arrodillarse para recoger un objeto sin perder el equilibrio.

Un equipo de investigadores ha abordado este desafío enseñando a un robot a aprender de la vasta y gratuita biblioteca de movimiento humano disponible en internet, en lugar de depender únicamente de demostraciones costosas del propio robot. Crearon un nuevo sistema llamado WHOLEBODYWAM, que actúa como un motor predictivo para el cuerpo del robot. En lugar de simplemente observar un video y adivinar qué hacer a continuación, este sistema aprende la física subyacente de cómo se mueven los cuerpos a través del tiempo. Fue entrenado con una colección masiva de datos de movimiento llamada UniMotion-4K, que incluye más de 4,100 horas de movimiento registradas a partir de videos humanos, conjuntos de datos especializados de captura de movimiento 3D y otros robots humanoides. Al convertir todas estas diferentes fuentes en un único lenguaje compartido de movimiento, el sistema aprendió una "intuición" general de cómo un cuerpo debe transicionar de una pose a otra. Esta intuición fue transferida a un robot humanoide real, permitiéndole anticipar sus propios movimientos futuros y ejecutar tareas de cuerpo completo con mucha mayor destreza y eficiencia que los métodos anteriores.

El núcleo de este trabajo reside en un proceso de entrenamiento de dos etapas que separa el aprendizaje de las reglas generales de movimiento del aprendizaje de cómo aplicarlas a una máquina específica. En la primera etapa, el sistema estudió el enorme conjunto de datos de movimiento humano y robótico sin haber visto ni un solo ejemplo de los comandos reales del robot objetivo. Aprendió a predecir qué haría un cuerpo basándose en una descripción de texto simple de una tarea, como "recoger el juguete" o "arrodillarse". Esto creó una base poderosa, un prior predictivo que comprendía la danza coordinada de extremidades y el equilibrio requeridos para el movimiento humano. En la segunda etapa, este conocimiento preentrenado se combinó con un módulo de comprensión de video y un generador de acciones. Al sistema se le mostraron un pequeño número de demostraciones del robot específico, el TianGong 3.0, para aprender a traducir su comprensión general del movimiento en los comandos motores específicos que las articulaciones de ese robot necesitan ejecutar. Crucialmente, el sistema no solo reacciona a la escena actual; utiliza su conocimiento aprendido para imaginar el estado futuro de su propio cuerpo, utilizando esa predicción para guiar sus acciones en tiempo real.

Cuando se probó en seis tareas difíciles del mundo real, los resultados fueron impactantes. Se le pidió al robot que realizara acciones como recoger juguetes, cargar ropa en una lavadora, transferir una almohada a un sofá y llevar una caja hacia una mesa. Estas tareas requerían que el robot se agachara, caminara, se arrodillara y manipulara objetos, todo al mismo tiempo. El nuevo sistema superó a los mejores métodos existentes, logrando una tasa de éxito significativamente más alta en todas las tareas. Por ejemplo, en la tarea de transferencia de una caja, donde el robot tenía que levantar una caja, caminar hacia una mesa lateral y colocarla, el nuevo sistema tuvo éxito el 73.3% de las veces, en comparación con tasas mucho más bajas de otros enfoques. Los investigadores descubrieron que cuanto más datos de movimiento utilizaban para entrenar al "experto en movimiento" inicial, mejor era el desempeño del robot, lo que sugiere que el sistema realmente aprendió una habilidad escalable en lugar de simplemente memorizar ejemplos específicos. Más importante aún, el sistema demostró ser altamente eficiente con los datos; cuando los investigadores redujeron a la mitad la cantidad de demostraciones del robot específico disponibles para el entrenamiento, el robot que había sido preentrenado con el masivo conjunto de datos de movimiento seguía rindiendo mejor que otros robots entrenados con el conjunto completo de demostraciones.

Este enfoque también demostró una capacidad notable para manejar cambios en el entorno. Cuando los investigadores movieron ligeramente la cesta de destino o cambiaron el color y la forma de los juguetes que el robot debía recoger, el sistema se adaptó rápidamente, manteniendo un alto rendimiento donde otros modelos tuvieron dificultades. El sistema logró esto sin necesidad de generar un video del futuro, lo cual sería computacionalmente costoso y lento. En su lugar, predijo las posiciones futuras de sus propias articulaciones directamente, lo que le permitió tomar decisiones en aproximadamente 363 milisegundos, una velocidad lo suficientemente rápida para el control en tiempo real. El estudio confirma que, si bien un robot no puede simplemente copiar los movimientos humanos porque su cuerpo es diferente, puede aprender de los vastos patrones del movimiento humano para desarrollar una comprensión predictiva y robusta de cómo mover su propio cuerpo. Al aprovechar la abundancia de datos de movimiento humano disponibles en el mundo, este método proporciona un nuevo camino hacia la creación de robots humanoides que no solo son capaces de realizar tareas complejas, sino que también pueden aprenderlas con muchas menos demostraciones de lo que se pensaba anteriormente posible.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →