← Últimos artículos
💻 computer science

Humanoid-DART: Humanoid Loco-Manipulation using Diffusion-guided Augmentation through Relabeling and Tracking

Humanoid-DART es un marco de trabajo auto-supervisado que combina la generación de trayectorias basada en difusión con el aprendizaje por refuerzo para permitir que los robots humanoides aprendan diversas habilidades de loco-manipulación a partir de demostraciones dispersas mediante la exploración automática del espacio de objetivos con una supervisión experta mínima.

Autores originales: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

Publicado 2026-06-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina enseñarle a un robot humanoide a realizar tareas complejas, como recoger una caja y moverla a un lugar específico, o patear un balón. Normalmente, para enseñarle esto a un robot, es necesario grabar cientos de horas de humanos realizando estas tareas a la perfección. Pero eso es costoso, lento y difícil de hacer para cada posible variación (¿qué pasa si la caja es más pesada? ¿Qué pasa si el objetivo está más lejos?).

El artículo presenta Humanoid-DART, un sistema ingenioso que enseña al robot a dominar estas tareas comenzando con solo un puñado mínimo de ejemplos (tan pocos como cuatro). Lo logra actuando como un entrenador creativo que no solo repite lo que ha visto, sino que imagina nuevas formas de hacer las cosas y luego las practica hasta que funcionan.

Así es como funciona el sistema, desglosado en partes simples:

1. La estrategia de los dos equipos

En lugar de intentar enseñarle todo al robot en un solo cerebro gigante, Humanoid-DART divide el trabajo en dos equipos especializados que se ayudan mutuamente:

  • El "Soñador" (El Modelo de Difusión): Este es el planificador creativo. Su trabajo es imaginar un camino para que el robot lo siga. Observa los pocos ejemplos que tiene y comienza a "soñar" nuevos caminos, ligeramente diferentes, para alcanzar nuevas metas. Piensa en ello como un artista que esboza nuevas rutas en un mapa. Al principio, estos bocetos podrían ser físicamente imposibles (como caminar a través de una pared o deslizarse por el suelo), pero son excelentes para explorar hacia dónde podría ir el robot.
  • El "Atleta" (La Política de Aprendizaje por Refuerzo): Este es el ejecutor físico. Su trabajo es tomar el boceto del "Soñador" y realmente intentar ejecutarlo en el robot. Actúa como un entrenador estricto. Si el Soñador dibuja un camino donde el pie del robot se desliza o este se cae, el Atleta dice: "No, eso no funcionará", y corrige el movimiento para hacerlo físicamente posible.

2. El "Ciclo de Práctica" (El Currículo)

La magia ocurre en cómo estos dos equipos se comunican entre sí a lo largo del tiempo. El sistema funciona en ciclos, como un campamento de entrenamiento:

  1. Elegir una meta: El sistema elige un objetivo (por ejemplo, "Mover la caja a este nuevo lugar").
  2. Soñar: El "Soñador" crea un plan aproximativo para llegar allí.
  3. Probar: El "Atleta" intenta ejecutar el plan en un simulador de física.
  4. Filtrar y Etiquetar:
    • Si el robot se cae o falla, el plan se descarta.
    • El ingrediente secreto: Si el robot casi lo logra (un "casi acierto"), el sistema no lo trata como un error. En su lugar, dice: "Está bien, no llegaste al punto previsto, pero llegaste con éxito a este punto". Reetiqueta el intento como un éxito para el nuevo punto que realmente alcanzó.
  5. Aprender: El "Soñador" aprende de estos intentos exitosos (o casi exitosos) para mejorar en la creación de planes para esos puntos específicos. El "Atleta" mejora en la ejecución de los mismos.
  6. Repetir: El sistema elige nuevas metas, ligeramente más difíciles, basadas en lo que acaba de aprender, expandiendo sus habilidades como una bola de nieve rodando colina abajo.

3. La arquitectura de "Doble Cerebro"

Para que el "Soñador" sea realmente bueno manejando tanto el caminar como el sujetar objetos, el artículo le otorga una estructura de cerebro especial de dos partes:

  • El Navegador: Se enfoca en el panorama general (hacia dónde van los pies del robot).
  • El Localizador: Se enfoca en los detalles (cómo se mueven las manos y las articulaciones en relación con el objeto).
    Al separar esto, el robot aprende a coordinar todo su cuerpo sin confundirse, asegurando que, cuando camina hacia una caja, su mano esté lista para agarrarla.

4. Los Resultados

Los investigadores probaron esto en un robot real (un Unitree G1) y en simulación. Comenzaron con solo cuatro ejemplos básicos de un robot empujando, pateando, entregando algo o recogiendo una caja.

  • El Resultado: El sistema no solo copió esos cuatro ejemplos. Aprendió a realizar estas tareas para metas que estaban de 4 a 5 veces más lejos que los ejemplos originales.
  • Cobertura: Para la tarea de "recoger y colocar", el robot aprendió a cubrir el 96% de las áreas de destino posibles, mientras que otros métodos solo cubrían una fracción mínima.

Resumen

Humanoid-DART es como un estudiante que comienza con unos pocos ejemplos de libros de texto, pero aprende a resolver miles de problemas nuevos al:

  1. Imaginar nuevas soluciones.
  2. Probarlas y ver qué es lo que realmente funciona.
  3. Celebrar los "casi aciertos" como nuevas oportunidades de aprendizaje.
  4. Construir lentamente una enorme biblioteca de habilidades sin necesidad de que un humano registre cada una de las variaciones.

El artículo concluye que este enfoque permite que los robots aprendan tareas compleas de cuerpo completo a partir de datos muy escasos, haciendo que el proceso de enseñar a los robots sea mucho más rápido y eficiente que antes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →