← Últimos artículos
💻 computer science

SEED-UMI: Sharing the Exoskeleton between human and robot for onE-to-one Dexterous demonstration

SEED-UMI es un novedoso marco de aprendizaje por imitación que permite un entrenamiento eficiente de robótica diestra al hacer que tanto el humano como el robot utilicen el mismo exoesqueleto, creando así mediciones articulares y vistas de la cámara de la muñeca compartidas que eliminan la necesidad de una transferencia de movimiento propensa a errores y permiten que las políticas aprendan directamente de demostraciones directas y ricas en contactos.

Autores originales: Tengbo Yu, Jiahao Wu, Daohan Li, Bingxu Chen, Hao Liu, Xiaojian Ma, Hangxin Liu

Publicado 2026-09-11
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Tengbo Yu, Jiahao Wu, Daohan Li, Bingxu Chen, Hao Liu, Xiaojian Ma, Hangxin Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Enseñar a un robot a usar sus manos como un humano es uno de los rompecabezas más difíciles en la robótica moderna. Si bien las máquinas se han convertido en maestras al caminar o mover sus brazos, el trabajo delicado y con mucho contacto de los dedos sigue siendo esquivo. La dificultad central no radica solo en la complejidad de la mano en sí, sino en cómo se le enseña. Para aprender, un robot necesita observar a un humano realizar una tarea y luego intentar copiar ese movimiento. Sin embargo, las manos humanas y las manos robóticas están construidas de forma diferente; tienen distintos números de articulaciones, diferentes tamaños y se mueven de formas distintas. Cuando un humano toca un objeto, su piel se comprime y sus articulaciones se doblan de una manera específica que una mano de metal rígido no puede imitar perfectamente. Los métodos actuales intentan cerrar esta brecha utilizando cámaras para observar al humano o guantes para registrar sus movimientos, pero estos enfoques suelen fallar cuando la mano realmente toca algo. Los datos se vuelven desordenados, la traducción del humano al robot se rompe y el robot tiene dificultades para replicar la presión sutil y el tiempo requeridos para tareas como atornillar un perno o lanzar una pelota.

Un equipo de investigadores ha propuesto una solución diferente que evita la necesidad de una traducción compleja por completo. En lugar de intentar convertir matemáticamente los movimientos humanos en comandos robóticos, construyeron un sistema donde el humano y el robot usan exactamente el mismo dispositivo mecánico. Este dispositivo es un exoesqueleto especializado, una estructura ligera que se ajusta a la mano y los dedos. Los investigadores diseñaron este armazón para que coincida perfectamente en tamaño y colocación de articulaciones con la mano del robot. Cuando un humano se lo pone, el armazón se mueve con sus dedos. Cuando el robot se lo pone, el armazón se mueve con sus motores. Debido a que la estructura física es idéntica, los sensores dentro del dispositivo registran exactamente los mismos datos, ya sea que lo lleve un humano o un robot. Este cambio simple convierte un difícil problema de traducción en un problema de observación directa.

Los investigadores, liderados por Tengbo Yu y colegas, desarrollaron un marco que llaman SEED-UMI para poner esta idea en práctica. El sistema se basa en una medición física compartida. El exoesqueleto está equipado con sensores en cada articulación que miden cuánto se dobla cada dedo. También lleva una cámara montada en la muñeca, apuntando hacia la mano y los objetos que esta toca. Cuando un operador humano usa el dispositivo para realizar una tarea, los sensores registan los ángulos de las articulaciones y la cámara registra la vista. Debido a que el robot usa el mismo dispositivo, ve la misma vista y mide los mismos ángulos de articulación cuando realiza la misma acción. Esto significa que el robot no necesita adivinar cómo traducir un gesto humano; simplemente aprende a mover sus propias articulaciones para coincidir con las lecturas de los sensores que ve, utilizando el desempeño del humano como una guía directa.

Para que esto funcionara, el equipo utilizó un proceso de aprendizaje de dos pasos. Primero, hicieron que el robot usara el exoesqueleto y moviera sus articulaciones de forma aleatoria, un proceso que llaman "balbuceo motor" (motor babbling). Esto ayudó al robot a comprender la relación básica entre sus propios comandos de motor y las lectas de los sensores que producía. A continuación, introdujeron los datos emparejados. Un humano usaría el dispositivo y realizaría una tarea, como tomar un estuche de AirPods o atornillar un tornillo. Luego, el robot reproduciría ese movimiento usando el mapeo inicial. Crucialmente, el sistema comparaba las lecturas de los sensores del intento del humano con las lecturas de los sensores del intento del robot. Si los dedos del robot se movían de forma diferente a los del humano, el sistema utilizaba esa diferencia para ajustar el mapeo. Esto permitió al robot aprender cómo manejar la fricción y la resistencia adicionales que ocurren cuando los dedos presionan contra objetos reales, una situación en la que los métodos anteriores solían fallar.

El equipo probó este enfoque en cinco tareas desafiantes que requerían un contacto y una sincronización precisos. Estas incluían atornillar un tornillo en una tabla, insertar un AirPod en su estuche de carga, lanzar una pelota a una cesta, limpiar una mesa con un paño y rociar un ambientador. En estas pruebas, los investigadores compararon su nuevo método contra la teleoperación tradicional, donde un humano controla al robot en tiempo real, y contra métodos que no utilizan el paso de ajuste fino emparejado. Los resultados mostraron que el enfoque SEED-UMI fue altamente efectivo. Los robots entrenados con este método alcanzaron una tasa de éxito del 70.0% en todas las tareas. Este desempeño fue casi idéntico a la tasa de éxito del 71.7% alcanzada por los robots entrenados con datos recolectados a través de la teleoperación directa, pero con una ventaja significativa en velocidad.

El hallazgo más sorprendente fue la eficiencia en la recolección de datos. Debido a que el operador humano no necesita controlar al robot en tiempo real, puede realizar las tareas de forma natural y rápida. Los investigadores descubrieron que podían recolectar datos tres veces más rápido con SEED-UMI que con la teleoperación tradicional. En una ventana de treinta minutos, un solo operador recolectó 52 demostraciones exitosas usando el nuevo sistema, comparado con solo 18 usando el método antiguo. Esta ganancia de velocidad no se produjo a costa de la calidad. Los robots entrenados con estos datos más rápidos fueron capaces de manejar tareas delicadas, como la precisión temporal necesaria para lanzar una pelota o la presión constante requerida para limpiar una mesa, tan bien como aquellos entrenados con los datos más lentos en tiempo real. El sistema demostró ser particularmente fuerte en tareas donde el robot tenía que reaccionar a la resistencia física de un objeto, un escenario en el que los métodos previos de lazo abierto solían tener dificultades.

El éxito de este trabajo sugiere que el cuello de botella para enseñar habilidades diestras a los robots puede no ser mejores algoritmos, sino la interfaz entre el humano y la máquina. Al hacer que el humano y el robot compartan la misma herramienta de medición física, los investigadores eliminaron la necesidad de un software complejo para traducir movimientos. El robot aprende directamente de la experiencia compartida del dispositivo, observando el mismo mundo y sintiendo las mismas restricciones mecánicas que el humano. Aunque el sistema actualmente requiere un exoesqueleto construido a medida para cada mano robótica específica, los resultados indican un camino prometedor. Ofrece una forma de reunir grandes cantidades de datos de alta calidad y ricos en contacto, sin los retrasos y errores del control en tiempo real, acelerando potencialmente el desarrollo de robots que puedan verdaderamente dominar las habilidades finas y táctiles de la mano humana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →