← Últimos artículos
💻 computer science

EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy

EMERGE-Policy introduce un marco agéntico de estructura de grafo donde un Agente Principal central coordina Sub Agentes especializados para la percepción, el razonamiento y la verificación dentro de contextos aislados, permitiendo un rendimiento robótico robusto y sin necesidad de ajuste fino mediante la colaboración emergente a nivel de sistema y la corrección de bucle cerrado.

Autores originales: Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan L
Publicado 2026-09-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan Li, Ziwei Wang, Weijian Deng, Xiu Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots han sido durante mucho tiempo expertos en repetir un único movimiento perfecto, como un soldador en una línea de montaje o un brazo que apila cajas idénticas. Pero dotar a un robot de una mente capaz de manejar un mundo real desordenado e impredecible ha resultado ser mucho más difícil. Durante décadas, los investigadores intentaron resolver esto construyendo un único y masivo programa informático —un "cerebro"— que pudiera ver un objeto, comprender una orden y mover el brazo, todo a la vez. Aunque estos sistemas se han vuelto impresionantes, a menudo tropiezan cuando algo sale mal. Si una taza se resbala o la luz cambia, el cerebro único puede confundirse porque intenta hacer todo en un solo salto gigante. El nuevo pensamiento en robótica sugiere que la inteligencia podría no necesitar vivir en un solo lugar. En cambio, la mente de un robot podría emerger de un equipo de ayudantes especializados trabajando juntos, donde una parte observa, otra planifica, una tercera verifica el trabajo y una cuarta recuerda lo sucedido. Este enfoque trata al robot no como una entidad única, sino como un grupo coordinado, permitiéndole recuperarse de los errores y adaptarse a los cambios de formas en las que un programa único no puede hacerlo.

Esta es la idea central detrás de un nuevo marco llamado EMERGE-Policy, desarrollado por investigadores de varias universidades, incluyendo la Universidad de Tsinghua y la Universidad de Pekín. En lugar de depender de un único modelo gigante para hacerlo todo, los investigadores construyeron un sistema donde un "Agente Principal" actúa como un gerente de proyecto. Este gerente no observa la señal de video bruta ni calcula cada movimiento del motor por sí mismo. En su lugar, descompone una tarea compleja, como "apila estas tazas en una pirámide", en pasos más pequeños. Luego delega trabajos específicos a "Sub Agentes" especializados. Un equipo de ayudantes se enfoca puramente en ver la escena y encontrar las tazas. Otro equipo vigila el brazo del robot para asegurarse de que se esté moviendo correctamente. Un tercer equipo comprueba si la taza es realmente estable después de ser colocada. Si algo sale mal, un cuarto equipo ayuda al robot a recordar el fallo y a intentar un enfoque diferente. El Agente Principal coordina estos grupos, recibiendo solo la información esencial y resumida que necesita para tomar la siguiente decisión, mientras que el trabajo pesado de procesar los datos brutos ocurre en segundo plano.

Los investigadores probaron este sistema en una serie de pruebas desafiantes, incluyendo tareas donde el robot tenía que manipular objetos sobre una mesa bajo condiciones difíciles. Compararon este enfoque basado en equipos contra los mejores modelos de programa único disponibles actualmente. Los resultados mostraron que el equipo coordinado superó significamente a los modelos únicos, especialmente cuando el entorno cambiaba o cuando las instrucciones eran vagas. En las pruebas estándar, el sistema alcanzó tasas de éxito cercanas al 99 por ciento, una mejora pequeña pero significativa sobre los mejores modelos únicos. Más importante aún, cuando los investigadores introdujeron perturbaciones —como cambiar la iluminación, alterar el tamaño de las tazas o bloquear la vista del robot— el sistema basado en equipos se mantuvo robusto. Mientras que los modelos únicos a menudo fallaban por completo bajo estas nuevas condiciones, el sistema EMERGE-Policy fue capaz de detectar el problema, diagnosticar la cuestión y ajustar su plan para tener éxito. En una prueba específica que involucraba a un robot real apilando tazas de papel en una pirámide de tres niveles, el sistema tuvo éxito en el 94 por ciento de los ensayos, incluso cuando las tazas eran de diferentes tamaños o los ángulos de la cámara cambiaban.

Una parte clave de este éxito es cómo el sistema maneja la memoria y los errores. En lugar de intentar recordar cada fotograma de video, lo que abrumaría a la computadora, el sistema escribe un resumen conciso de lo que sucedió en un registro digital. Si el robot deja caer una taza, el sistema no solo intenta de nuevo ciegamente. Analiza por qué ocurrió la caída, escribe una nota sobre el fallo y crea un plan específico para solucionar solo esa parte del problema antes de continuar. Esto permite que el robot se recupere de los errores localmente sin tener que reiniciar toda la tarea. Los investigadores también descubrieron que darle al sistema un "avance" de lo que podría pasar después le ayudó a evitar errores antes de que ocurrieran. Al simular algunos movimientos posibles en su mente y comprobar cuál parecía mejor, el robot podía elegir el camino más seguro. Este paso de "imaginación", combinado con un proceso de verificación estricto, significó que el robot era menos propenso a cometer errores irreversibles.

Los experimentos no se limitaron a simulaciones por computadora. El equipo desplegó el sistema en un brazo robótico físico para realizar una secuencia larga de tareas: quitar tazas de papel de una mesa, colocarlas boca abajo y apilarlas en capas. Esta prueba en el mundo real demostó que el marco podía manejar la imprevisibilidad de los objetos físicos, tales como tazas que podrían tambalearse o deslizarse. El sistema completó la tarea con éxito el 94 por ciento de las veces, e incluso cuando los investigadores interrumpieron el proceso o cambiaron la iluminación, el robot fue capaz de replanificar y terminar el trabajo. El estudio sugiere que el futuro de la inteligencia robótica puede no residir en construir un cerebro único más grande y más inteligente, sino en crear una mejor manera para que muchas herramientas más pequeñas y especializadas trabajen juntas. Al organizar estas herramientas en una jerarquía clara donde cada una tiene un trabajo específico y una forma clara de informar, los investigadores han creado un sistema que no solo es más preciso, sino también más resiliente al caos del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →