← Últimos artículos
💻 computer science

Multi-Domain Motion Embedding: Expressive Real-Time Mimicry for Legged Robots

Este artículo presenta el Embebedido de Movimiento Multidominio (MDME, por sus siglas en inglés), una novedosa representación de movimiento que unifica características periódicas estructuradas y aperiódicas no estructuradas mediante un codificador basado en wavelets y un embebido probabilístico para permitir una imitación de movimiento expresiva, en tiempo real y de aprendizaje cero a través de diversos robots humanoides y cuadrúpedos sin requerir el ajuste por movimiento o el retargeting en línea.

Autores originales: Matthias Heyrman, Chenhao Li, Victor Klemm, Dongho Kang, Stelian Coros, Marco Hutter

Publicado 2026-09-16
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Matthias Heyrman, Chenhao Li, Victor Klemm, Dongho Kang, Stelian Coros, Marco Hutter

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots han luchado durante mucho tiempo por moverse con la fluidez natural de los seres vivos. Si bien los ingenieros pueden programar máquinas para que caminen en línea recta o suban escaleras, enseñarles a imitar los gestos complejos y expresivos de un humano o la marcha única de un animal ha seguido siendo un desafío obstinado. La dificultad central reside en la traducción: un cuerpo humano y un cuerpo robótico están construidos de manera diferente, con diferentes números de articulaciones y diferentes límites físicos. Tradicionalmente, para que un robot copiara a un humano, los investigadores tenían que reescribir manualmente los movimientos del humano en un código que el robot pudiera entender, un proceso similar a traducir un poema palabra por palabra a un idioma con una gramática completamente diferente. Esta traducción manual es lenta, a menudo rompe el flujo del movimiento y falla cuando el robot se encuentra con un nuevo tipo de movimiento que no ha visto antes.

Un equipo de investigadores de la ETH Zúrich ha desarrollado un nuevo enfoque que evita esta traducción manual por completo. Crearon un sistema que permite a los robots con patas observar cómo se mueve un humano o un animal e inmediatamente comprender cómo replicar ese movimiento en sus propios cuerpos, sin necesidad de un guion preescrito. Al enseñar al robot a reconocer el ritmo y la estructura subyacente del movimiento en lugar de solo copiar ángulos de articulación específicos, los investigadores permitieron que las máquinas aprendieran de videos y datos de movimiento brutos en tiempo real. Este trabajo sugiere un futuro donde los robots puedan aprender nuevas habilidades simplemente observándolas, adaptándose instantáneamente a sus propias formas físicas únicas.

Los investigadores, liderados por Matthias Heyrman y colegas, se centraron en un problema que ha desconcertado al campo durante años: cómo representar el movimiento de una manera que capture tanto los patrones constantes y repetitivos como los cambios repentinos e impredecibles de un gesto. Los métodos anteriores a menudo trataban estos dos aspectos por separado o intentaban forzar todo el movimiento en un molde matemático único y rígido. El equipo se dio cuenta de que el movimiento natural es una mezcla de dos cosas: patrones estructurados y periódicos, como el balanceo rítmico de las piernas durante una caminata, y variaciones no estructuradas y aperiódicas, como un giro repentino o un movimiento de brazo. Para resolver esto, construyeron un sistema llamado Incrustación de Movimiento de Multidominio (Multi-Domain Motion Embedding), que actúa como una cámara de doble lente para el movimiento. Una lente se enfoca en los patrones de movimiento repetitivos y similares a ondas, mientras que la otra captura los detalles caóticos y únicos que hacen que cada movimiento sea distinto.

En lugar de traducir manualmente la postura de un humano en comandos para el robot, los investigadores alimentaron los datos de movimiento brutos directamente en su sistema. Estos datos procedían de dos fuentes: grabaciones de actores humanos moviéndose de diversas maneras y videos de perros corriendo y caminando. El sistema procesa esta información a través de dos vías paralelas. La primera vía utiliza una herramienta matemática conocida como transformada de wavelet para descomponer el movimiento en sus componentes de frecuencia. Esto permite al robot ver el "latido" del movimiento, identificando los ciclos constantes de una marcha o el ritmo de un baile. La segunda vía utiliza un codificador probabilístico para capturar los detalles desordenados y no repetitivos, como la forma específica en que una persona se inclina en un giro o un perro ajusta su equilibrio en un terreno irregular. Estos dos flujos de información se combinan en una descripción única y rica del movimiento que el robot puede entender.

La verdadera prueba de este sistema fue si podía funcionar en el mundo real sin intervención humana. Los investigadores entrenaron a sus robots en un entorno simulado utilizando aprendizaje por refuerzo, un método donde el robot aprende mediante ensayo y error para maximizar una recompensa. Enseñaron a un robot humanoide, el Fourier N1, a imitar movimientos humanos y a un robot cuadrúpedo, el ANYmal D, a imitar movimientos de perros. Crucialmente, no proporcionaron a los robots ninguna instrucción preprocesada y traducida. Los robots tuvieron que descubrir cómo mapear el movimiento humano o animal bruto en sus propios cuerpos enteramente por su cuenta. Los resultados fueron sorprendentes. En simulaciones, los robots rastrearon con éxito una amplia variedad de movimientos, desde caminatas simples hasta gestos complejos y expresivos, con un nivel de precisión que superó los métodos anteriores.

Para demostrar que el sistema funcionaba fuera de la computadora, el equipo implementó las políticas entrenadas en el hardware real. El robot humanoide observó un video de un actor humano e inmediatamente comenzó a imitar los movimientos, incluyendo caminar, girar y gesticular, sin ningún ajuste manual al código. Del mismo modo, el robot cuadrúpedo observó imágenes de un perro y reprodujo con éxito la marcha del animal. Aún más impresionante, el sistema demostró una forma de aprendizaje de disparo cero (zero-shot learning), lo que significa que podía manejar movimientos que nunca había visto. Cuando se le presentó un nuevo tipo de marcha de perro que no estaba en sus datos de entrenamiento, el robot no falló; en su lugar, adaptó el movimiento a una versión estable y factible que funcionaba para su propio cuerpo. Esta capacidad de generalización sugiere que el sistema ha aprendido los principios fundamentales del movimiento en lugar de solo memorizar una lista de poses específicas.

Los investigadores también compararon su nuevo método con técnicas más antiguas que dependían del retargeting manual. Encontraron que, si bien los métodos antiguos podían ser ligeramente más precisos al copiar un movimiento que era exactamente lo que habían sido entrenados para hacer, fallaban estrepitosamente cuando se enfrentaban a movimientos nuevos o inesperados. El nuevo sistema, por el contrario, mantuvo su rendimiento a través de una amplia gama de movimientos no vistos. El estudio sugiere que, al dejar que el robot aprenda la estructura del movimiento directamente de los datos brutos, en lugar de forzarlo a través de un filtro de traducción rígido, la máquina obtiene una comprensión mucho más profunda de cómo moverse. Este enfoque elimina la necesidad de que los ingenieros diseñen manualmente las reglas para cada nuevo movimiento, abriendo la puerta para que los robots aprendan de la vasta diversidad de movimiento que se encuentra en el mundo natural.

Uno de los hallazgos más significativos fue cómo el sistema manejaba las diferencias entre el robot y el actor. Los investigadores descubrieron que el robot no intentaba forzar su cuerpo a una forma imposible para coincidir exactamente con el humano. En su lugar, interpretó el movimiento de una manera que fuera físicamente posible para su propia estructura. Por ejemplo, cuando un actor humano realizó un movimiento que sería inestable para un robot, el sistema ajustó el movimiento para mantener el equilibrio del robot, "reinterpretando" efectivamente la intención del movimiento en lugar de copiar la geometría exacta. Esta flexibilidad permitió que los robots se mantuvieran estables y funcionales incluso cuando imitaban a actores de diferentes tamaños o realizaban acciones dinámicas complejas.

El estudio también destacó la importancia de la arquitectura de doble codificación. Cuando los investigadores probaron el sistema eliminando una de las dos lentes, el rendimiento disminuyó significamente. El robot tuvo dificultades para capturar la gama completa de movimiento, ya fuera perdiendo la estabilidad rítmica de la marcha o fallando al adaptarse a los matices únicos del gesto. Esto confirmó que tanto los patrones estructurados y similares a ondas como los detalles no estructurados y caóticos son esenciales para una comprensión completa del movimiento. El sistema funciona porque trata estos dos aspectos como complementarios, utilizando uno para proporcionar la base y el otro para añadir el detalle necesario.

Al final, este trabajo representa un cambio en la forma en que los robots aprenden a moverse. En lugar de depender de que los ingenieros traduzcan el movimiento humano al código del robot, los investigadores han demostrado que los robots pueden aprender a entender el movimiento directamente. Al combinar un método para capturar patrones rítmicos con un método para capturar variaciones únicas, crearon un sistema que es tanto robusto como flexible. Los robots demostrados en el estudio no solo siguieron un guion; aprendieron a interpretar el lenguaje del movimiento y a hablarlo con su propia voz. Esta capacidad sugiere un futuro donde los robots puedan aprender nuevas habilidades sobre la marcha, adaptándose a nuevos entornos y tareas con un nivel de naturalidad que antes era inalcanzable. Los investigadores concluyen que este enfoque proporciona una base sólida para la próxima generación de control robótico, donde la capacidad de aprender por observación se convierta en una característica estándar en lugar de una excepción rara.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →