← Últimos artículos
💻 computer science

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

El artículo presenta AnyWorld, un marco de modelado de mundo factorizado que sintetiza experiencias robóticas diversas y de múltiples morfologías a partir de videos egocéntricos humanos únicos mediante el desacoplamiento de los factores de acción, cámara y morfología, permitiendo así una generación de datos controlable que mejora significativamente las políticas de manipulación tanto en robots humanoides simulados como reales.

Autores originales: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

Publicado 2026-09-02
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots están aprendiendo a hacer más que solo moverse en líneas rectas; están aprendiendo a manipular el mundo que los rodea, recogiendo objetos, abriendo puertas y ensamblando piezas. Para aprender estas habilidades, un robot necesita experiencia. Debe ver miles de ejemplos de cómo una mano alcanza una taza, cómo una pinza aprieta una esponja y cómo una herramienta se desliza sobre una mesa. Durante mucho tiempo, la única forma de obtener esta experiencia era hacer que un robot realizara la tarea por sí mismo, una y otra vez. Esto es lento, costoso y está limitado por cuántos robots puede permitirse construir un laboratorio y cuántas horas pueden funcionar sin romperse.

Una alternativa prometedora ha surgido de una fuente inesperada: los videos humanos. Cada día, las personas se graban a sí mismas cocinando, limpiando y construyendo cosas. Estos videos están llenos de ricas interacciones físicas de las que los robots podrían aprender. Sin embargo, hay un problema importante. Un video de un humano cocinando muestra una mano humana, un cuerpo humano y un punto de vista humano. Un robot no tiene un cuerpo humano y no ve el mundo desde una cabeza humana. Si un robot intenta copiar directamente un video humano, podría fallar porque el brazo del humano es más largo, la cámara del robot está en un lugar diferente o el funcionamiento de su pinza es distinto. El desafío para los científicos es descubrir cómo tomar la "historia" útil de lo que sucede en un video humano y volver a contarla de una manera que tenga sentido para un robot.

Un equipo de investigadores ha desarrollado un nuevo sistema llamado AnyWorld para resolver este problema. En lugar de intentar copiar un video humano exactamente, el sistema descompone el video en tres ingredientes separados: la acción que se realiza, la forma en que se mueve la cámara y el cuerpo y la escena que realizan el trabajo. Piense en la acción como el guion de lo que está sucediendo, el movimiento de la cámara como la dirección de la toma, y el cuerpo y la escena como los actores y el decorado. Al separar estos elementos, los investigadores pueden tomar un solo video de un humano realizando una tarea y recombinar esos ingredientes para crear un video completamente nuevo. En este nuevo video, el "actor" es un robot, el "decorado" es el entorno de un robot, y la "cámara" es el ojo de un robot, pero el "guion" de la acción permanece igual.

Los investigadores entrenaron su sistema utilizando una colección masiva de videos humanos donde las personas interactuaban con objetos. Enseñaron al modelo a entender la diferencia entre el movimiento de la tarea y el cuerpo específico que la realiza. Una vez que el modelo aprendió esto, lo probaron alimentándolo con un video humano y pidiéndole que generara una versión de esa misma tarea realizada por un robot. No necesitaron ningún video que mostrara a un humano y a un robot realizando la misma tarea lado a lado. El sistema simplemente tomó los movimientos del humano y la trayectoria de la cámara, y luego sustituyó el cuerpo y la escena del humano por un cuerpo y una escena de un robot. El resultado fue un video que parecía un robot realizando la tarea, con la perspectiva y las limitaciones físicas correctas de esa máquina específica.

El equipo probó esta capacidad de cambiar el cuerpo, el ángulo de la cámara y la escena. Demostraron que el sistema podía tomar un video humano y generar una versión donde un robot llamado RoboCasa GR1 realizaba la tarea, y otra versión donde un robot diferente llamado IRON la realizaba. También demostraron que podían mantener el robot y la tarea iguales pero cambiar el ángulo de la cámara, creando una vista desde una perspectiva diferente. Crucialmente, el sistema preservó la lógica de la interacción. Si un humano en el video original recogía una taza y la movía a un estante, el video del robot generado mostraba al robot realizando exactamente la misma secuencia de movimientos, solo que adaptada a su propia forma corporal y posición de cámara.

Para demostrar que estos videos generados eran realmente útiles, los investigadores los utilizaron para entrenar robots reales. Tomaron un sistema de aprendizaje de robots estándar y le dieron entrenamiento adicional utilizando los videos creados por AnyWorld. Probaron esto en una simulación de un brazo robótico y en un robot humanoide físico real. En la simulación, la tasa de éxito del robot al recoger y colocar objetos mejoró significamente tras el entrenamiento con los datos generados. En el robot real, la mejora fue incluso más dramática. Un robot que solo era capaz de agarrar un plátano con éxito en el 20 por ciento de los intentos pasó a una tasa de éxito del 55 por ciento tras ser entrenado con los videos de humano a robot. Esto demostró que el sistema no solo estaba creando imágenes bonitas, sino que estaba creando datos de entrenamiento válidos que ayudaban al robot a aprender mejor.

Los investigadores también investigaron exactamente por qué funcionó esto. Querían saber si simplemente decirle al robot qué acción realizar era suficiente, o si ver la escena visual también era necesario. Realizaron una prueba en la que dieron las órdenes de acción correctas pero mantuvieron los datos de entrenamiento visual de los videos originales del robot sin modificar. Este enfoque falló al intentar enseñar al robot cómo seguir instrucciones específicas, como elegir el plátano de la izquierda en lugar del de la derecha. Sin embargo, cuando utilizaron el sistema completo para generar tanto la nueva escena visual como la acción correcta, el robot aprendió a seguir las instrucciones de manera fiable. Esto demostró que la recomposición visual era esencial. El robot necesitaba ver el mundo desde su propia perspectiva para entender cómo aplicar la acción.

El estudio sugiere que este método de descomponer las interacciones en factores separados permite que una sola experiencia humana sea reutilizada muchas veces. Un video humano que antes estaba limitado a un cuerpo humano y una cámara humana puede convertirse en una fuente de datos de entrenamiento para muchos tipos diferentes de robots, en muchos entornos diferentes. Los investigadores señalaron que, aunque el sistema es potente, tiene límites. Todavía no puede capturar la sensación del tacto o la fuerza exacta necesaria para apretar un objeto blando, ya que esto requiere sensores físicos que la generación de video no proporciona. Además, el sistema depende de la capacidad de rastrear los movimientos humanos con claridad; si el video es demasiado inestable o la persona está oculta detrás de un objeto, el sistema tiene dificultades.

A pesar de estas limitaciones, este trabajo ofrece un nuevo camino para el aprendizaje de los robots. Sugiere que la vasta biblioteca de videos humanos en internet, que ha sido difícil de utilizar para los robots debido a las diferencias en cuerpos y puntos de vista, ahora puede ser aprovechada. Al utilizar un modelo que entiende cómo separar la acción del actor, los científicos pueden convertir las experiencias humanas en experiencias robóticas sin necesidad de grabar cada tarea con cada robot. Esto podría permitir que los robots aprendan habilidades complejas mucho más rápido, utilizando la abundante data de la vida cotidiana humana como base para sus propias capacidades.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →