← Últimos artículos
⚡ electrical engineering

OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction

OmniRetarget es un motor de generación de datos que preserva la interacción y que aprovecha una malla de interacción para superar las brechas de encarnación y preservar las relaciones críticas entre humanos, objetos y el entorno, permitiendo la creación eficiente de datos de entrenamiento de alta calidad para habilidades robustas de loco-manipulación humanoide y parkour de largo horizonte sin currículos de aprendizaje complejos.

Autores originales: Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

Publicado 2026-06-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que quieres enseñarle a un robot a hacer parkour, cargar una silla pesada cuesta arriba o escalar una pared. Podrías intentar programar cada movimiento muscular a mano, pero eso es como intentar enseñarle a alguien a nadar escribiendo un libro de texto de física sobre la resistencia del agua. Es demasiado difícil y lento.

En su lugar, los investigadores detrás de OmniRetarget decidieron dejar que el robot aprenda observando a un humano realizar los movimientos. Pero aquí está el truco: los humanos y los robots se ven muy diferentes. Si solo copias los movimientos de un humano en un robot, el robot podría terminar con los pies deslizándose por el suelo (como si patinara sobre hielo), las piernas atravesando una silla, o las articulaciones retorciéndose de formas imposibles.

OmnimRetarget es un nuevo "traductor mágico" que soluciona este problema. Así es como funciona, utilizando analogías sencillas:

1. La "Malla de Interacción" (La Telaraña Invisible)

Imagina que el humano, el robot, la silla y el suelo están conectados por una telaraña invisible y elástica.

  • El Problema: Cuando un humano se mueve, la telaraña se estira naturalmente. Si solo copias la postura del humano en un robot, la telaraña se rompe o se desgarra porque las partes del cuerpo del robot están en lugares diferentes.
  • La Solución: OmniRetarget construye una "malla de interacción" digital (una red 3D) que conecta las articulaciones del humano con los objetos que toca. Al convertir el movimiento humano al robot, el sistema estira y encoge esta red para adaptarse al cuerpo del robot, pero mantiene la red intacta.
  • El Resultado: Si la mano del humano está tocando una silla, la mano del robot debe tocar la silla en la nueva versión. Si el pie del humano está firmemente plantado en el suelo, el pie del robot se mantiene plantado. Esto evita que el robot "atraviese fantasmalmente" los objetos o se resbale.

2. El "Entrenador Estricto" (Restricciones Duras)

En el pasado, estos sistemas de traducción eran como un entrenador que decía: "Intenta parecerte al humano, pero no pasa nada si atraviesas el suelo un poquito".
OmniRetarget es un entrenador estricto. Utiliza un conjunto de reglas inquebrantables (restricciones matemáticas) que dicen:

  • "Tus pies no pueden deslizarse".
  • "Tu cuerpo no puede atravesar la silla".
  • "Tus articulaciones no pueden doblarse hacia atrás".
    Resuelve un rompecabezas complejo para encontrar una forma de que el robot se mueva de manera que se parezca al humano pero obedezca todas las leyes de la física.

3. La Fotocopiadora "Uno a Muchos" (Aumento de Datos)

Normalmente, para enseñarle a un robot a recoger una caja roja, necesitas que un humano demuestre cómo recoger una caja roja. Para enseñarle a recoger una caja azul, necesitas una nueva demostración.
OmniRetarget es como una fotocopiadora inteligente.

  • Le muestras una demostración humana (por ejemplo, recoger una caja).
  • El sistema genera automáticamente cientos de nuevas variaciones: recoger una caja alta, una caja corta, una caja en un lugar diferente, o incluso escalar una plataforma más alta.
  • Hace esto remodelando matemáticamente la "telaraña" para adaptarse a estos nuevos escenarios mientras mantiene intacta la lógica central del movimiento. Esto crea una biblioteca masiva de datos de entrenamiento a partir de solo unos pocos videos humanos.

El Gran Triunfo: De la Simulación a la Realidad

Los investigadores utilizaron este sistema para entrenar a un robot (el humanoide Unitree G1) utilizando Aprendizaje por Refuerzo (un método de aprendizaje por ensayo y error).

  • El Entrenamiento: Debido a que los datos eran tan limpios y físicamente correctos, el robot solo necesitó 5 reglas simples (recompensas) para aprender. No necesitó instrucciones complejas y desordenadas para corregir errores.
  • El Resultado: El robot aprendió a realizar un circuito de parkour de 30 segundos que incluía cargar una silla, pisarla, saltar de ella y rodar.
  • Transferencia Zero-Shot: Esta es la parte más impresionante. El robot aprendió enteramente en una simulación por computadora utilizando estos movimientos traducidos. Cuando lo encendieron en el mundo real, funcionó de inmediato sin necesidad de ajustes adicionales. No necesitó "reaprender" cómo caminar sobre concreto real; simplemente sabía qué hacer.

Resumen

En resumen, OmniRetarget resuelve la "brecha de encarnación" entre humanos y robots. Toma los movimientos humanos, los envuelve en una "red" protectora y compatible con la física que asegura que tengan sentido para un robot, y luego utiliza eso para generar infinitos escenarios de práctica. Esto permite que los robots aprendan habilidades complejas y ágiles, como el parkour y la manipulación de objetos, rápidamente y transfieran esas habilidades con éxito desde la computadora al mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →