← Últimos artículos
💻 computer science

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

El artículo presenta FetchMan, un flujo de trabajo de sim-to-real de extremo a extremo que supera las limitaciones de rendimiento del clonación de comportamiento sintético mediante el refinamiento de políticas con aprendizaje por refuerzo Flow-GRPO, permitiendo que un humanoide Unitree G1 logre un éxito zero-shot del 73.3% en tareas de loco-manipulación a través de escenas no vistas.

Autores originales: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

Publicado 2026-09-01
📖 4 min de lectura☕ Lectura para el café

Autores originales: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El sueño de un robot que pueda entrar en una habitación, detectar un objeto específico y recogerlo ha sido durante mucho tiempo un objetivo central en la robótica. Durante décadas, los investigadores han luchado por enseñar a las máquinas este tipo de comportamiento complejo porque requiere que dos habilidades difíciles trabajen juntas a la vez: mover el cuerpo a través del espacio y usar las manos para interactuar con el mundo. Aunque los robots se han vuelto bastante buenos caminando por su cuenta, añadir la capacidad de alcanzar y agarrar cosas mientras se mantiene el equilibrio sobre dos piernas crea una mezcla caótica de física que es increíblemente difícil de programar a mano. Recopilar los datos necesarios para enseñar a un robot de esta manera también es un obstáculo masivo; que un humano demostrara cada posible forma de caminar hacia un tazón y recogerlo en cada habitación posible tomaría años y correría el riesgo de romper al robot. Para resolver esto, los científicos han recurrido a simulaciones por computadora, creando mundos digitales donde los robots pueden practicar millones de veces sin temor a sufrir daños. Sin embargo, una gran pregunta ha permanecido: ¿puede un robot entrenado enteramente en un mundo digital manejar realmente la realidad desordenada e impredecible de una casa real?

Un equipo de investigadores de la Universidad de California, Los Ángeles, junto con colaboradores del Allen Institute for AI y la Universidad de Washington, ha abordado este desafío con un nuevo sistema que llaman FetchMan. Su trabajo se centra en un robot humanoide, el Unitree G1, que se ve y se mueve de forma muy similar a una persona. El equipo quería saber si podían enseñar a este robot a navegar por una habitación y agarrar un objeto objetivo simplemente mostrándole miles de ejemplos en una simulación por computadora, y luego hacer que realizara la tarea perfectamente en el mundo real sin ningún entrenamiento adicional. Descubrieron que simplemente mostrarle al robot más y más ejemplos de la tarea no era suficiente. Incluso después de entrenar en más de 150,000 escenas diferentes, el rendimiento del robot alcanzó un techo difícil. Podía imitar al maestro digital, pero no podía aprender la sutil sincronización requerida para la transición suave de caminar a alcanzar. El robot a menudo intentaba agarrar el objeto demasiado pronto o dejaba de caminar demasiado pronto, fallando porque estaba tratando de copiar a un maestro que estaba usando información secreta que el robot no podía ver.

Para romper esta barrera, los investigadores añadieron una segunda etapa al proceso de entrenamiento. En lugar de solo copiar al maestro digital, dejaron que el robot practicara por su cuenta en la simulación y lo recompensaron solo cuando completaba con éxito toda la tarea de caminar hacia el objeto y recogerlo. Este método, que utiliza una técnica llamada aprendizaje por refuerzo, permitió al robot descubrir la sincronización y el movimiento correctos por sí mismo. Aprendió a caminar más cerca del objeto antes de estirarse, corrigiendo los errores que cometía cuando solo estaba imitando. Cuando el equipo probó este robot refinado en el mundo real, los resultados fueron sorprendentes. El robot, habiendo visto nunca una habitación real o un objeto real durante su entrenamiento, fue capaz de caminar en espacios desconocidos, identificar un tazón objetivo y agarrarlo con una tasa de éxito de más del 73 por ciento. Este fue un avance significativo sobre el método de entrenamiento inicial, que solo logró tener éxito aproximadamente el 57 por ciento de las veces en las pruebas en el mundo real.

Los investigadores también exploraron si este enfoque podría funcionar para muchos tipos diferentes de objetos, no solo tazones. Entrenaron una versión del sistema para reconocer y recoger artículos como pan, botellas y libros dándole al robot el nombre del objeto como una pista. Aunque esta versión multi-objeto no fue tan exitosa como la versión de un solo objeto, aun así logró realizar la tarea en una variedad de situaciones, demostrando que el método puede escalarse. El estudio destaca que, si bien copiar a un maestro es un buen punto de partida, no es suficiente para dominar tareas físicas complejas. El robot necesita la libertad de explorar y aprender de sus propios éxitos y fracasos para comprender verdaderamente cómo moverse a través del mundo. Al combinar una cantidad masiva de práctica simulada con una etapa final de autocorrección, el equipo ha mostrado un camino claro hacia la creación de robots que puedan adaptarse a nuevos entornos sin necesidad de que un humano les lleve de la mano en cada paso del camino.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →