← Últimos artículos
💻 computer science

Zetta ζ\zeta: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

El artículo presenta Zetta, un arnés encarnado de bucle cerrado que permite la inteligencia física autoevolutiva mediante la actualización dinámica de críticos basados en código y habilidades de recuperación en línea a través de tres bucles separados por escalas de tiempo, logrando un rendimiento de vanguardia y aceleraciones significativas en la velocidad de inferencia en tareas de referencia, al tiempo que demuestra transferencia de cero disparos y "Momentos Aha" emergentes.

Autores originales: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

Publicado 2026-08-18
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots han sido capaces durante mucho tiempo de realizar tareas simples y repetitivas en las fábricas, pero dotarlos de la flexibilidad para manejar la naturaleza desordenada e impredecible de un hogar o un taller real ha seguido siendo uno de los desafíos más difíciles en la inteligencia artificial. Durante años, los investigadores han intentado enseñar a los robots alimentándolos con cantidades masivas de datos de video, con la esperanza de que la máquina aprendiera un conjunto único y perfecto de instrucciones para cada situación posible. Este enfoque, aunque potente, suele fallar cuando el mundo real se desvía incluso ligeramente de los videos de entrenamiento; un ligero desliz de una pinza o un cambio en la iluminación pueden hacer que el robot se congele o choque. Ha surgido un camino alternativo, que trata a los robots no como programas estáticos, sino como agentes que pueden pensar, planificar y usar herramientas. Sin embargo, incluso estos agentes más inteligentes han tenido dificultades para aprender de sus propios errores en tiempo real. La mayoría de los sistemas operan en un bucle en el que intentan una tarea, fallan y luego reflexionan sobre lo que salió mal solo después de que termina todo el intento. Para cuando analizan el error, el momento de corregirlo ya ha pasado y la interacción física ya se ha roto.

Un equipo de investigadores de la Universidad de Tsinghua y Z-Trans AI ha presentado un nuevo sistema llamado Zetta, que cambia la forma en que los robots aprenden al cerrar la brecha entre el pensamiento y la acción. En lugar de esperar hasta que se termine una tarea para aprender, Zetta permite que un robot monitoree su propio estado físico continuamente mientras se mueve, detectando errores en el instante en que ocurren y corrigiéndolos de inmediato. El sistema no intenta reentrenar el cerebro central del robot, que permanece fijo y estable. En su lugar, construye una capa de "críticos de tiempo de ejecución" (runtime critics), monitores pequeños y especializados que observan las manos del robot y los objetos que toca. Si un crítico nota que un agarre se está deslizando o que un objeto está a punto de caer, activa una habilidad de recuperación preprogramada para salvar la situación antes de que el robot pierda el control. Esto crea un bucle de autoevolución donde el robot mejora en una tarea específica cuanto más la intenta, no cambiando su comprensión fundamental del mundo, sino acumulando una biblioteca de formas probadas para manejar fallos físicos.

Los investigadores probaron este enfoque en dos bancos de pruebas importantes para la manipulación robótica: un conjunto de tareas que implican mover objetos entre diferentes ubicaciones y un conjunto más complejo de tareas doméstas como abrir cajones o encender electrodomésticos. En estas simulaciones, el sistema comenzó con una política de robot base que tenía una tasa de éxito de aproximadamente el 35 por ciento en las tareas más difíciles. A medida que el sistema ejecutaba miles de ensayos, comenzaba a identificar los momentos específicos donde las cosas salían mal. Agrupaba estos fallos, determinaba la causa raíz y escribía nuevo código para solucionarlos. En solo unas pocas rondas de esta autocorrección, la tasa de éxito en las tareas difíciles saltó a más del 90 por ciento. El sistema no tuvo simplemente suerte; demostró un patrón claro de mejora donde luchaba durante un tiempo y luego, de repente, descubría un principio físico clave —como la necesidad de estabilizar un agarre antes de levantar— y su rendimiento daba un salto hacia adelante. Los investigadores llaman a estos avances repentinos "momentos aha", donde el robot finalmente comprende la restricción física que le faltaba.

Lo que hace que este descubrimiento sea particularmente significativo es que las habilidades que el robot aprendió no estaban ligadas a un objeto específico o a una habitación específica. Cuando los investigadores llevaron las habilidades que el robot había aprendido para manipular una botella de vino en una tarea y las aplicaron a una tarea completamente diferente que involucraba un contenedor de queso crema, el robot tuvo éxito sin necesidad de un nuevo entrenamiento. El sistema había aprendido principios generales de cómo sujetar, mover y colocar objetos que funcionaban en diferentes escenarios. Esto sugiere que el robot no solo estaba memorizando una ruta hacia un objetivo, sino que estaba aprendiendo una comprensión más profunda de cómo interactuar con el mundo físico. El sistema también demostró ser increíblemente rápido, ejecutando simulaciones en un clúster de computadoras para generar la experiencia necesaria para el aprendizaje. Al desacoplar la lógica del robot del hardware que ejecuta la simulación, los investigadores pudieron ejecutar el proceso de aprendizaje más de veinte veces más rápido que los métodos anteriores, permitiendo que el robot evolucionara sus habilidades en cuestión de horas en lugar de días.

Los investigadores argumentan que este enfoque resuelve un problema fundamental en la robótica: la incapacidad de los modelos actuales para reaccionar a los cambios rápidos del mundo físico. Los grandes modelos de inteligencia artificial son demasiado lentos para tomar decisiones a la velocidad requerida para atrapar un objeto que cae o ajustar un agarre que se desliza. Al mantener el cerebro principal congelado y añadir una capa rápida y reactiva de críticos y habilidades de recuperación, Zetta cierra la brecha entre la planificación de alto nivel y el control físico de bajo nivel. El sistema demostró que podía manejar secuencias de acciones complejas y largas, como navegar por una cocina, abrir un gabinete y colocar un artículo dentro, dividiendo la tarea en pasos manejables y teniendo una red de seguridad lista para cada posible fallo. En un estudio de caso, un robot que intentaba mover una botella a un tazón falló repetidamente al principio porque dejaba caer la botella durante el transporte. Después de algunas rondas de autocorrección, el sistema añadió una comprobación específica para asegurar que el agarre fuera seguro antes de moverse, y la tasa de éxito para esa tarea se disparó del 15 por ciento al 95 por ciento.

El trabajo también destaca la importancia de la infraestructura para hacer posible este tipo de aprendizaje. Para evolucionar las habilidades de un robot, el sistema necesita ejecutar miles de ensayos para encontrar los momentos raros donde falla y luego analizar esos fallos. Los investigadores construyeron un sistema especializado para gestionar esta carga de trabajo, permitiéndoles ejecutar muchas simulaciones a la vez sin ralentizarse. Esta infraestructura fue crucial para la velocidad del proyecto, permitiendo al equipo recopilar los datos necesarios para entrenar a los críticos y las habilidades de recuperación de manera eficiente. Sin esta capacidad de escalar el proceso de aprendizaje, el bucle de autoevolución habría sido demasiado lento para ser práctico. Los resultados sugcia un nuevo camino para la inteligencia física, uno donde los robots no necesitan ser perfectos desde el principio, sino que pueden aprender a ser confiables a través de la experiencia, refinando constantemente su capacidad para manejar lo inesperado.

Las implicaciones de esta investigación se extienden más allá de simplemente hacer que los robots sean mejores moviendo objetos. Ofrece un plano de cómo la inteligencia artificial puede interactuar con el mundo físico de una manera robusta y adaptable. Al centrarse en la capacidad de detectar y recuperarse de los errores en tiempo real, el sistema evita la fragilidad que ha plagado a los enfoques anteriores. Los investigadores señalan que, si bien su trabajo actual se realizó en simulación, los principios que desarrollaron están diseñados para ser transferidos a robots reales. El siguiente paso para el equipo es llevar este arnés de autoevolución y probarlo en máquinas físicas, cerrando la brecha entre la simulación digital y el mundo real. Si tiene éxito, esto podría conducir a robots que no solo están programados para realizar una tarea, sino que son capaces de aprender y mejorar su desempeño cada vez que la intentan, haciéndolos compañeros más útiles y confiables en entornos humanos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →