← Últimos artículos
🤖 AI

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1 es un marco de post-entrenamiento de aprendizaje por refuerzo que aprovecha la Optimización de Política Relativa de Grupo (GRPO) en demostraciones de RoboCasa disponibles públicamente para mejorar significativamente el rendimiento y las tasas de éxito de los modelos de Visión-Lenguaje-Acción basados en flujo sin requerir datos privados adicionales.

Autores originales: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

Publicado 2026-07-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a cocinar una comida compleja, como hacer café o abrir un cajón difícil.

El Problema: El Robot "Copia y Pega"
Hasta ahora, la mayoría de los entrenadores de robots utilizaban un método llamado "Clonación de Comportamiento" (Behavior Cloning). Piensa en esto como un estudiante que solo aprende viendo las grabaciones perfectas de un profesor. El robot observa al profesor tener éxito e intenta copiar cada movimiento exactamente.

  • El Defecto: Si el estudiante comete un error diminuto (como estirar la mano hacia un mango un milímetro más lejos de lo debido), el video no muestra cómo solucionarlo. El robot se queda bloqueado, no sabe cómo recuperarse y falla. No puede aprender de sus propios errores porque nunca se le permitió cometerlos durante el entrenamiento.

La Solución: Z-1 (El Entrenador de "Ensayo y Error")
El artículo presenta Z-1, un nuevo sistema de entrenamiento que permite al robot aprender haciendo, fallando y volviendo a intentarlo. Es como un entrenador que deja que el estudiante practique en la cocina, falle y luego le dé comentarios específicos sobre cómo hacerlo mejor la próxima vez.

Así es como funciona Z-1, utilizando analogías sencjas:

1. El Punto de Partida (SFT)

Primero, el robot recibe un "curso intensivo" observando videos públicos de humanos realizando tareas (como abrir puertas o usar un fregadero). Esto le da una idea básica de qué hacer, similar a leer una receta antes de cocinar.

2. La "Práctica en Grupo" (GRPO)

En lugar de dejar que el robot practique solo, Z-1 utiliza un método llamado Optimización de Política Relativa de Grupo (GRPO).

  • La Analogía: Imagina a un entrenador enviando a 8 estudiantes a la cocina para hacer café al mismo tiempo.
  • El Objetivo: El entrenador no se limita a decir "Buen trabajo" o "Mal trabajo". En su lugar, compara a los 8 estudiantes entre sí. Si 7 estudiantes derraman el café pero 1 lo hace correctamente, el entrenador le dice al estudiante exitoso: "Lo hiciste de forma diferente; sigue haciendo lo que hiciste". Esto ayuda al robot a descubrir exactamente qué pequeño movimiento marcó la diferencia.

3. Los Trucos Inteligentes (Los Nuevos Módulos)

El artículo presenta cuatro trucos ingeniosos para que esta práctica sea eficiente y estable:

  • Prefijo Compartido (La Regla del "Mismo Inicio"):

    • El Problema: Si el Estudiante A comienza caminando hacia la izquierda y el Estudiante B comienza caminando hacia la derecha, comparar sus habilidades finales para hacer café es injusto. Tuvieron puntos de partida diferentes.
    • La Solución: Z-1 obliga a los 8 estudiantes a comenzar con los mismos primeros movimientos exactos (como caminar hacia la encimera). Una vez que todos están parados frente a la encimera, se separan e intentan diferentes formas de agarrar la taza. Esto asegura que el robot aprenda de la parte crítica de la tarea (el agarre), no del caminar.
  • Ramificación Estructurada en Árbol (La Regla de la "Ruta de Ramificación"):

    • El Problema: A veces, incluso la parte de "caminar hacia la encimera" necesita práctica. Si los obligamos a empezar exactamente igual, nunca aprenderán a corregir un mal paso.
    • La Solución: Z-1 utiliza una estructura de "árbol". Todos los estudiantes comienzan juntos, pero luego se dividen en pequeños grupos en diferentes puntos. Algunos se dividen temprano, otros tarde. Esto permite que el robot practique corrigiendo pequeños errores, manteniendo al mismo tiempo la práctica organizada.
  • Decaimiento de Recompensa Consciente del Éxito (El "Bono de Velocidad"):

    • El Problema: Si un robot tarda 10 minutos en abrir una puerta o 1 minuto en abrir la misma puerta, un sistema estándar podría darles a ambos una pegatina de "Buen Trabajo".
    • La Solución: Z-1 da una pegatina de "Buen Trabajo" más grande al robot que termina más rápido. No castiga al lento, pero recompensa más al rápido. Esto incentiva al robot a ser eficiente sin tener miedo de intentarlo.
  • Entrenamiento Conjunto Selectivo (El Interruptor "Cerebro vs. Manos"):

    • El Probleambio: A veces, el robot falla porque sus "manos" (el experto en acciones) son torpes. Otras veces, falla porque su "cerebro" (el cerebro de visión y lenguaje) no puede ver claramente el pomo.
    • La Solución: Normalmente, Z-1 solo entrena las "manos" para mantener la estabilidad. Pero si el robot sigue fallando porque no puede ver o entender el objeto, Z-1 activa un interruptor y entrena el "cerebro" y las "manos" juntos. Es como darse cuenta de: "¡Oh, el estudiante no es torpe; simplemente no puede ver el mango!" y enseñarle a mirar mejor.

Los Resultados

El equipo probó Z-1 en 24 tareas domésticas diferentes (como abrir cajones, usar fregaderos y hacer café).

  • Antes de Z-1 (Solo observar videos): El robot tenía éxito aproximadamente el 67% de las veces.
  • Después de Z-1 (Practicar con los nuevos trucos): El robot tuvo éxito el 80.6% de las veces.

Esta mejora fue lo suficientemente significativa como para superar a otros modelos robóticos de alto nivel actuales en el dominio público, a pesar de que Z-1 no utilizó ningún dato privado o secreto, sino solo videos públicos y sus propias sesiones de práctica.

En Resumen:
Z-1 toma a un robot que era solo un imitador y lo convierte en un solucionador de problemas. Al permitirle practicar en grupos, comenzando desde el mismo punto, recompensando la velocidad y sabiendo cuándo entrenar sus ojos frente a sus manos, el robot aprende a manejar mucho mejor los desafíos desordenados y reales de un hogar que antes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →