← Últimos artículos
🤖 machine learning

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

Motus2 es un modelo de mundo general autoevolutivo para la manipulación diestra que unifica la política, la simulación y la evaluación en un bucle cerrado de decisión y aprendizaje, aprovechando arquitecturas de modelos escalados y conjuntos de datos multimodales progresivamente expandidos para permitir una mejora continua tanto a través de demostraciones de expertos como de datos de interacción autogenerados.

Autores originales: Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiab
Publicado 2026-09-01
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Para construir un robot que pueda manejar verdaderamente el mundo desordenado e impredecible de las tareas humanas, los científicos han buscado durante mucho tiempo un sistema que haga más que simplemente seguir una lista de instrucciones. El objetivo es crear una máquina que pueda percibir su entorno, imaginar qué podría pasar después, realizar una acción y luego aprender del resultado para hacerlo mejor la próxima vez. Este concepto, conocido como un "modelo de mundo", actúa como un simulador interno para el robot. En lugar de solo reaccionar a lo que ve en este momento, el robot ejecuta simulaciones mentales para adivinar el resultado de sus movimientos antes de realizarlos realmente. Aunque las versiones anteriores de estos sistemas podían predecir el futuro o sugerir un movimiento, a menudo operaban en línea recta: ver, adivinar, actuar y detenerse. Carecían de una forma de mirar hacia atrás a sus propias predicciones, juzgar si eran buenas o malas, y usar ese juicio para mejorar sus propias habilidades de toma de decisiones sin necesidad de que un humano les muestre el camino correcto cada vez.

Un equipo de investigadores ha presentado ahora un sistema llamado Motus2, un cerebro robótico autoevolutivo diseñado específicamente para tareas delicadas y complejas, como usar herramientas o manipular objetos con manos de apariencia humana. Este sistema representa un paso significativo hacia adelante porque cierra el ciclo entre el pensamiento y el aprendizaje. En lugar de ser solo un observador pasivo o un simple seguidor, Motus2 actúa como su propio maestro. Propone una serie de movimientos posibles, simula cómo se verían esos movimientos en el futuro y luego evalúa si esos resultados imaginados conducirían al éxito. Si la simulación muestra un fallo, el robot aprende de ese error. Si muestra éxito, refuerza ese camino. Este ciclo permite al robot mejorar su propia política, o su conjunto de reglas para actuar, al probar y refinar constantemente sus propias ideas, incluso cuando no tiene a un humano que lo guíe en cada paso.

La base de este sistema se construye sobre una enorme cantidad de datos recopilados de manos humanas. Los investigadores comenzaron enseñando al robot a comprender cómo los humanos interactúan con el mundo utilizando videos grabados desde una perspectiva de primera persona, como si la cámara estuviera montada en la cabeza de la persona. Comenzaron con videos simples de una sola lente que mostraban una gran variedad de tareas, desde cocinar hasta organizar, y luego pasaron a videos estéreo sincronizados más avanzados que proporcionan una sensación de profundidad, muy similar a la visión binocular humana. Esto permitió al robot aprender la física sutil de cómo las manos agarran, levantan y manipulan objetos. Sin embargo, simplemente observar a los humanos no es suficiente para un robot con un cuerpo diferente. Los investigadores luego guiaron el sistema a través de una etapa intermedia de entrenamiento donde aprendió a traducir esos movimientos humanos a la mecánica específica de sus propios brazos y manos robóticas. Este proceso implicó mostrar al robot miles de horas de datos humanos, seguido de ejemplos específicos de cómo los humanos y los robots pueden trabajar juntos, tendiendo eficazmente un puente entre la intuición humana y la ejecución robótica.

Lo que hace que Motus2 sea único es cómo utiliza este conocimiento. El sistema está construido alrededor de un modelo único y unificado que usa tres sombreros diferentes simultáneamente. Primero, actúa como una política, sugiriendo qué acción tomar a continuación. Segundo, actúa como un simulador, prediciendo cómo se verá el mundo después de que se tome esa acción. Tercero, actúa como un evaluador, juzgando si ese futuro predicho es bueno o malo. En los sistemas tradicionales, estas funciones suelen estar separadas o desconectadas, pero aquí están estrechamente entrelazadas. Cuando el robot considera un movimiento, ejecuta instantáneamente una simulación mental para ver las consecuencias. Luego se pregunta a sí mismo si esa consecuencia es deseable. Si la respuesta es no, descarta ese camino y prueba otro. Si la respuesta es sí, se compromete con la acción. Este diálogo interno ocurre tan rápido que el robot puede planificar varios pasos por delante, eligiendo el mejor camino a seguir antes de mover un solo músculo.

Los investigadores probaron este sistema en una plataforma totalmente robótica equipada con dos brazos, dos manos diestras y sensores que pueden sentir el tacto, similares a las yemas de los dedos humanos. Desafiaron al robot con una serie de tareas difíciles, como colocar una pelota en un lugar específico, enroscar una bombilla en un casquillo o unir un borrador a un bolígrafo. En estas pruebas, la capacidad del robot para aprender de sus propias simulaciones resultó crucial. Cuando se le permitió al sistema utilizar su evaluador interno para seleccionar las mejores opciones durante una tarea, su tasa de éxito mejoró significamente. Aún más impresionante, cuando se le permitió al sistema utilizar sus propias predicciones para actualizar sus propias reglas de aprendizaje, se volvió aún mejor en la tarea. El robot no solo tuvo suerte; realmente aprendió a evitar los errores que había simulado y a repetir las acciones que había simulado como exitosas.

Una parte clave de este éxito fue la capacidad del robot para recordar lo que sucedió anteriormente en una tarea, incluso si esa información estaba temporalmente oculta de la vista. En muchos trabajos complejos, una mano puede bloquear la vista de un objeto, o un paso crítico puede ocurrir mucho antes de que se vea el resultado final. Para manejar esto, los investigadores dotaron al robot de una forma de memoria de trabajo que podía retener detalles visuales importantes del pasado. Probaron diferentes formas de gestionar esta memoria, desde mantener una ventana corta y rotativa de eventos recientes hasta mantener un historial más largo y detallado. Los resultados mostraron que tener acceso a este historial más largo permitía al robot resolver tareas que requerían recordar una secuencia de eventos durante un periodo más largo, demostrando que la capacidad de recordar el pasado es tan importante como predecir el futuro.

El sistema también incorporó un módulo especializado para el tacto. Si bien la visión es poderosa, no siempre puede decir si un agarre se está resbalando o si una superficie es demasiado blanda. El robot fue equipado con un sistema experto ligero dedicado a procesar la retroalimentación táctil. Esto le permitió refinar sus movimientos en tiempo real, ajustando su agarre en el momento en que sentía un deslizamiento o un cambio en la presión. Esta combinación de ver, sentir, pensar y aprender creó un sistema robusto capaz de manejar la incertidumbre del mundo real.

Los hallazgos sugieren que el camino hacia robots verdaderamente capaces no reside solo en la recolección de más datos, sino en la construcción de sistemas que puedan cuestionarse y mejorarse a sí mismos utilizando esos datos. Al combinar datos de interacción humana a gran escala con un bucle de autocrítica de predicción y evaluación, Motus2 demostró que los robots pueden aprender a manipular el mundo físico con un nivel de adaptabilidad que antes era inalcanzable. Los investigadores encontraron que, a medida que aumentaban la cantidad de datos de video estéreo utilizados para el entrenamiento, la capacidad del robot para predecir las acciones humanas mejoraba de una manera constante y predecible. Esta escalabilidad sugiere que, con aún más datos, estos sistemas podrían volverse aún más proficientes. En última instancia, el trabajo muestra que un robot no necesita ser programado con cada solución posible para cada problema posible. En cambio, si puede simular el futuro, juzgar el resultado y aprender de la diferencia, puede evolucionar sus propias habilidades para enfrentar los desafíos de un mundo complejo y diestro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →