← Últimos artículos
🤖 machine learning

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

El artículo presenta GROW, un marco de aprendizaje por refuerzo que adapta la Optimización de Políticas Relativas de Grupo (GRPO) para agentes de Modelos Visión-Lenguaje en entornos abiertos, descomponiendo trayectorias completas en muestras de estado-acción para superar las limitaciones de longitud de contexto, logrando un rendimiento de vanguardia en más de 800 tareas de Minecraft.

Autores originales: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

Publicado 2026-05-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot a jugar un videojuego complejo como Minecraft. El robot tiene una cámara (sus ojos) y puede teclear en un teclado y mover un ratón (sus manos). Su objetivo es completar tareas como "construir una casa", "extraer oro" o "derrotar a un monstruo".

Durante mucho tiempo, la mejor manera de enseñar a estos robots fue la Ajuste Fino Supervisado (SFT). Piensa en esto como mostrarle al robot un video de un experto humano jugando el juego perfectamente y decirle: "Copia exactamente lo que hicieron". ¿El problema? Encontrar horas de partidas humanas perfectas es costoso, y si el robot simplemente memoriza el video, se confunde cuando el juego cambia ligeramente.

Luego, los investigadores probaron el Aprendizaje por Refuerzo (RL), específicamente un algoritmo llamado GRPO. Esto es como dejar que el robot juegue, falle, tenga éxito y aprenda de los resultados. Sin embargo, el GRPO estándar tenía un defecto mayor al aplicarse a juegos de mundo abierto: trataba a la sesión de juego completa como una sola lección.

El Problema: La lección "demasiado larga"

Imagina que estás intentando aprender a hornear un pastel.

  • El GRPO estándar es como entregarte un libro de 500 páginas que incluye la historia de tu infancia, el pronóstico del tiempo de hace tres días, la receta y la historia del perro de tu vecino, todo mezclado. Te dice: "Horneaste un buen pastel al final, así que todo en este libro de 500 páginas fue bueno".
  • En el artículo, esto se llama la "trayectoria completa". A medida que el robot juega a Minecraft, la historia de lo que vio y hizo se vuelve cada vez más larga. Eventualmente, el "libro" se vuelve tan enorme y lleno de ruido irrelevante (como caminar durante 10 minutos antes de encontrar un bloque) que el robot se abruma y no puede entender qué movimiento específico llevó realmente al éxito.

La Solución: GROW (El enfoque de la "tarjeta de receta")

Los autores proponen un nuevo marco llamado GROW (Alinear GRPO con Modelado de Estado-Acción).

En lugar de darle al robot todo el libro de 500 páginas, GROW corta la sesión de juego en pequeñas y manejables tarjetas de receta.

  • Descomposición Estado-Acción: GROW divide la larga sesión de juego en momentos individuales: "Mira el bloque" + "Haz clic en el ratón" + "El pico golpea".
  • Retroalimentación Inteligente: Si el robot tiene éxito al final, GROW no dice "Todo el juego fue genial". En su lugar, examina las tarjetas específicas que llevaron a la victoria. Dice: "El movimiento que hiciste 5 segundos antes de encontrar el oro fue muy bueno. El movimiento que hiciste hace 20 minutos cuando solo caminabas alrededor? Eso fue solo aceptable".

Cómo funciona (La analogía)

Piensa en un entrenador entrenando a un jugador de fútbol.

  • Antiguo método (GRPO estándar): El entrenador ve todo el partido de 90 minutos, ve al jugador marcar un gol y luego grita: "¡Buen trabajo! ¡Lo hiciste todo bien desde el primer minuto hasta el último!". El jugador está confundido porque en realidad hizo un pase terrible en el minuto 10 que casi hizo perder el partido.
  • Método GROW: El entrenador desglosa el juego. "Ese pase en el minuto 10 fue descuidado. Pero la carrera que hiciste en el minuto 80? Perfecta. ¿Y el golpe en el minuto 89? Brillante". El jugador aprende exactamente qué acciones específicas repetir.

La matemática "mágica"

El artículo incluye una prueba matemática (Análisis de Sustitutos) para asegurarnos de que este enfoque de "cortar la lección" sigue siendo válido.

  • La preocupación: Las matemáticas estándar para este tipo de aprendizaje generalmente requieren comparar diferentes intentos en el mismo punto de partida exacto. GROW compara diferentes momentos en el tiempo, que son todos diferentes.
  • El resultado: Los autores demostraron que, aunque los puntos de partida son diferentes, la "puntuación" que obtiene el robot refleja con precisión qué tan buena es su estrategia. Es como calificar a un estudiante en un examen de matemáticas: incluso si las preguntas son diferentes, la puntuación final aún te dice si están mejorando en matemáticas.

Los Resultados: Ganando el juego

El equipo probó GROW en más de 800 tareas diferentes de Minecraft, desde navegar por cuevas hasta crear objetos y luchar contra monstruos.

  • Tasa de éxito: GROW superó significativamente a los métodos anteriores. Por ejemplo, en las "tareas de GUI" (usar los menús del juego para crear objetos), el éxito saltó de aproximadamente el 39% al 68%.
  • Eficiencia: El robot no solo ganó más a menudo; ganó más rápido. Tardó menos pasos en completar tareas porque aprendió a ignorar el "ruido" y se centró en los movimientos que realmente importaban.
  • Generalización: El robot no solo memorizó los juegos específicos en los que practicó. Aprendió habilidades generales (como cómo buscar un objetivo o cómo usar un menú) que le permitieron tener éxito en tareas nuevas e inéditas que nunca había visto antes.

En resumen

GROW es una forma más inteligente de enseñar a agentes de IA a jugar juegos de mundo abierto. En lugar de abrumarlos con historias largas y desordenadas de sus sesiones de juego completas, desglosa el juego en pasos pequeños y claros. Esto ayuda a la IA a entender exactamente qué acciones conducen al éxito, permitiéndole aprender más rápido, jugar mejor y enfrentar nuevos desafíos sin confundirse.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →