← Últimos artículos
💻 computer science

MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation

MotionWAM es un modelo de acción de mundo fundacional en tiempo real que unifica el control de loco-manipulación de cuerpo completo para humanoides mediante el aprovechamiento de características intermedias de eliminación de ruido de video para predecir tokens de movimiento coordinados, superando así las limitaciones de velocidad y consistencia de las políticas jerárquicas tradicionales y superando significativamente a las líneas base de Visión-Lenguaje-Acción en tareas complejas.

Autores originales: Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot a ser un ayudante con apariencia humana. Normalmente, enseñamos a los robots en dos pasos separados: primero, enseñamos a su "cerebro" (la parte superior del cuerpo) cómo agarrar cosas, y luego enseñamos a sus "piernas" (la parte inferior del cuerpo) cómo caminar y mantener el equilibrio. El problema es que estas dos partes no se comunican bien entre sí. El cerebro dice: "Agarra esa taza", y las piernas solo dicen: "Está bien, caminaré hacia adelante para evitar que te caigas". No pueden hacer cosas como patear un balón o pisar un pedal porque a las piernas solo se les permite hacer "cosas de equilibrio".

MotionWAM es un nuevo cerebro robótico que soluciona esto tratando a todo el cuerpo como un equipo único y coordinado. Así es como funciona, utilizando algunas analogías sencillas:

1. El "Director de Cine" frente al "Guionista"

La mayoría de los cerebros de robots son como guionistas. Observan una imagen y una frase (como "recoger la caja") e intentan adivinar el siguiente movimiento basándose en lo que han visto antes. Realmente no entienden cómo funciona la física o cómo se mueven las cosas a través del tiempo.

MotionWAM es diferente. Es como un Director de Cine que ha visto miles de horas de películas. Antes de decirle al robot qué hacer, realiza una rápida "simulación mental" de cómo se verá la siguiente escena de la película en los próximos segundos.

  • El truco: En lugar de esperar a que toda la escena de la película esté completamente dibujada (lo cual toma demasiado tiempo), MotionWAM observa el boceto de la escena mientras se está dibujando. Captura la "esencia" del movimiento futuro de ese boceto e inmediatamente le dice al robot cómo moverse. Por esto es capaz de pensar lo suficientemente rápido como para funcionar en tiempo real.

2. El "Control Remoto Unificado"

En los sistemas antiguos, el robot tenía dos controles remotos: uno para los brazos y uno para las piernas. El control de las piernas era muy simple y solo sabía caminar recto o girar.

  • La innovación de MotionWAM: Utiliza un solo control remoto para todo el cuerpo. Cuando el robot necesita patear un balón de fútbol, la orden de "patear" no es solo para la pierna; es una instrucción única que le dice a los brazos que se equilibren, al torso que se incline y al pie que se balancee, todo al mismo tiempo. Esto permite que el robot haga cosas como pisar un pedal o patear un balón, algo que los antiguos sistemas de "dos controles remotos" no podían hacer porque no entendían que las piernas podían ser parte de la tarea, no solo del equilibrio.

3. El "Campamento de Entrenamiento de Tres Etapas"

Enseñar a un robot de esta manera es difícil, por lo que los investigadores utilizaron un campamento de entrenamiento de tres pasos:

  • Etapa 1 (El cinéfilo): Le mostraron al robot miles de horas de videos desde el punto de vista de un humano (como una GoPro en la cabeza). El robot aún no aprendía a moverse; solo aprendió cómo se ve el mundo cuando te mueves a través de él. Aprendió la "física de la visión".
  • Etapa 2 (El traductor): Enseñaron al robot cómo traducir esas habilidades cinematográficas en movimientos reales de robot. Utilizaron datos de diferentes tipos de cuerpos de robots para asegurar que el robot entendiera la idea general de "moverse", no solo una forma de cuerpo específica.
  • Etapa 3 (Las fuerzas especiales): Finalmente, le dieron al robot tareas de práctica específicas (como cargar un carrito o limpiar una pizarra) utilizando a un operador humano guiándolo con gafas de realidad virtual. Aquí es donde el robot aprendió a aplicar su conocimiento cinematográfico a trabajos reales y complicados.

Los Resultados

Cuando probaron MotionWAM en nueve tareas difíciles (como patear un balón de fútbol, cargar un carrito o lavar la ropa), fue un gran éxito:

  • Velocidad: Piensa lo suficientemente rápido como para funcionar en tiempo real (unas 5 veces por segundo), lo cual es necesario para que un robot se mantenga erguido sin caerse.
  • Tasa de éxito: Tuvo éxito en el 76% de las tareas, mientras que los mejores cerebros robóticos anteriores solo tenían éxito aproximadamente el 44% de las veces.
  • El factor "Patada": La mayor victoria fue en las tareas que requerían interacción con los pies. Los robots antiguos intentaban caminar alrededor del balón; MotionWAM realmente lo pateó.

La Conclusión

MotionWAM demuestra que si le das a un robot un cerebro de "director de cine" que entiende cómo se mueve el mundo, y le permites controlar todo su cuerpo con un plan unificado, puede realizar trabajos complejos y humanos mucho mejor que los robots que tratan el caminar y el agarrar como problemas separados.

Limitaciones: El artículo señala que esto se probó en un modelo de robot específico (el Unitree G1) y que si el robot pierde la vista del objeto que sostiene (debido a que la cámara está en su cabeza), podría confundirse y dejar de funcionar. Aún no ha sido probado en otros cuerpos de robots.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →