← Últimos artículos
🤖 machine learning

Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object Interactions

Weave es un marco unificado que aprende la locomoción-manipulación diestra de cuerpo completo para robots humanoides a partir de demostraciones humanas mediante la conversión de estas en referencias ejecutables vía el retargeting sensible al contacto y empleando una política sensible a la geometría para lograr altas tasas de éxito tanto en escenarios de interacción entrenados como no vistos.

Autores originales: Liu Cao, Xingze Wu, Jingzhi Cui, Botian Xu, Mingzhi Pei, Ruoqu Chen, Mengdi Xu

Publicado 2026-09-16
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Liu Cao, Xingze Wu, Jingzhi Cui, Botian Xu, Mingzhi Pei, Ruoqu Chen, Mengdi Xu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Para construir un robot que pueda moverse a través de un mundo humano, los ingenieros se enfrentan a un problema de coordinación que es mucho más complejo que simplemente enseñar a una máquina a caminar o a recoger cosas. Un robot debe hacer ambas cosas a la vez, a menudo sosteniendo un objeto que desplaza su peso y cambia cómo se equilibra. Esto se conoce como loco-manipulación, un término que describe la difícil tarea de mover el cuerpo mientras se manipula simultáneamente un objeto con las manos. Para que un robot tenga éxito, no puede tratar el caminar y el agarrar como tareas separadas; si alcanza una silla sin ajustar sus pies, se caerá. Si camina hacia una mesa sin planificar cómo sus dedos tocarán la superficie, fallará al intentar levantarla. El desafío radica en enseñar a una máquina a comprender que todo su cuerpo, desde sus pies hasta la punta de sus dedos, debe trabajar como una unidad única y equilibrada para interactar con el mundo físico.

Los investigadores han intentado durante mucho tiempo enseñar a los robots mediante la observación de movimientos humanos, un proceso llamado aprendizaje por imitación. Sin embargo, copiar directamente a un humano a menudo falla porque los robots y las personas tienen diferentes formas corporales y diferentes maneras de mover sus articulaciones. Un humano puede girar su muñeca de una manera que un robot no puede, o los dedos de un robot podrían ser demasiado rígidos para imitar el tacto suave de un humano. Además, la mayoría de los intentos previos para enseñar a los robots a manipular objetos se centraron ya fuera en los movimientos grandes del cuerpo o en los movimientos finos de las manos, pero rara vez en ambos juntos en un único sistema unificado. Esta brecha significaba que, si bien los robots podían aprender a caminar o aprender a sostener una taza, les costaba realizar la compleja tarea cotidiana de caminar hacia un objeto pesado, agarrarlo con seguridad y transportarlo a otro lugar sin soltarlo o caerse.

Un equipo de investigadores ha presentado un nuevo sistema llamado WEAVE para resolver este problema específico. Su enfoque comienza registrando a humanos reales interactuando con objetos cotidianos como sillas, cajas y mesas. Estas grabaciones capturan el movimiento completo de la persona mientras se acerca, agarra y mueve el artículo. Los investigadores toman estos movimientos humanos y los traducen a un formato que un robot pueda entender y ejecutar. Esta traducción no es un simple copiar y pegar; es una reconstrucción cuidadosa que respeta los límites físicos del robot. El sistema primero completa las partes faltantes del movimiento, como los pasos que el robot necesita dar para acercarse al objeto, que no estaban presentes en la grabación humana original. Luego, ajusta los movimientos de las manos humanas para que se adapten a los dedos específicos del robot, asegurando que el agarre del robot sea físicamente posible y lo suficientemente fuerte como para sostener el objeto. Crucialmente, el sistema presta mucha atención a exactamente dónde tocan los dedos el objeto, preservando los puntos de contacto que hacen que el agarre sea estable.

Una vez creados estos movimientos de referencia, los investigadores entrenan un único programa informático, o política, para aprender de ellos. Este programa está diseñado para controlar cada articulación del cuerpo del robot, incluyendo las veintinueve articulaciones de su torso y piernas y las doce articulaciones de sus dos manos. En lugar de entrenar un programa separado para cada tipo de objeto, los investigadores entrenaron este único programa en una gran variedad de artículos y estilos de interacción al mismo tiempo. El robot aprende en un entorno simulado, un mundo digital donde puede practicar miles de veces sin romper nada. Aprende a observar el movimiento de referencia e intentar igualarlo, ajustando su equilibrio y la presión de sus dedos en tiempo real para mantener el objeto seguro. El entrenamiento es riguroso, involucrando cambios aleatorios en la fricción y el peso del robot para asegurar que pueda manejar condiciones inesperadas.

Los resultados de este entrenamiento son impresionantes. Cuando se probó en los objetos y movimientos específicos que había visto durante el entrenamiento, el robot tuvo éxito en completar la tarea el 92.5% de las veces. Más importante aún, el sistema mostró una fuerte capacidad de generalización. Cuando los investigadores probaron al robot en secuencias de movimientos que nunca había visto antes, utilizando los mismos objetos pero abordados desde ángulos diferentes o con movimientos distintos, todavía tuvo éxito el 65.0% de las veces sin ningún entrenamiento adicional. Esto sugiere que el robot aprendió una estrategia general para interactuar con los objetos en lugar de simplemente memorizar movimientos específicos. Los investigadores también publicaron un gran conjunto de datos de estos movimientos exitosos, que totaliza unas 23 horas de actividad grabada del robot, para ayudar a otros científicos a estudiar cómo los robots pueden aprender a interactuar con el mundo físico.

El estudio destaca que aprender a manipular objetos es más efectivo cuando el robot aprende a coordinar todo su cuerpo a la vez. Al entrenar en muchos objetos diferentes simultáneamente, el robot descubrió patrones comunes, como cómo equilibrar su peso al levantar una caja pesada o cómo posicionar sus pies al alcanzar una lámpara alta. Este enfoque unificado resultó ser más exitoso que entrenar especialistas separados para cada objeto. Los investigadores encontraron que, si bien un especialista podría ser ligeramente mejor imitando la pose exacta para un artículo específico, el robot generalista era mucho mejor completando la tarea en una amplia gama de situaciones. Esto indica que la capacidad de adaptarse a nuevas formas y situaciones es más valiosa que la imitación perfecta de un solo movimiento.

A pesar de estos éxitos, los investigadores son claros sobre los límites de su trabajo. Todo el estudio se llevó a cabo en una simulación informática, lo que significa que el robot nunca tocó físicamente el mundo real. El sistema dependía del conocimiento perfecto de dónde se encontraban el robot y el objeto, lo cual no siempre está disponible en el mundo real donde los sensores pueden tener ruido. Además, el robot utilizado en la simulación tiene manos que no son totalmente flexibles, lo que limita la complejidad de los agarres que puede realizar. Los investigadores también señalan que su sistema requiere una secuencia de acciones preplanificada a seguir; todavía no tiene la capacidad de decidir por sí mismo qué recoger o hacia dónde llevarlo. Estos son los próximos pasos para el campo, donde los sistemas futuros deberán combinar esta habilidad física con la capacidad de comprender instrucciones complejas y navegar por la naturaleza impredecible del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →