← Últimos artículos
🤖 machine learning

Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models

Este artículo propone GRPO Aumentado con Transformaciones (TA-GRPO), un método que mitiga el desvanecimiento del gradiente y el colapso de la diversidad en el razonamiento de Modelos de Lenguaje Grandes mediante la generación de reformulaciones equivalentes al problema para crear recompensas mixtas y trayectorias de exploración diversas, mejorando así significativamente el rendimiento en benchmarks matemáticos complejos.

Autores originales: Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

Publicado 2026-05-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un estudiante muy inteligente (un Modelo de Lenguaje Grande) cómo resolver problemas matemáticos difíciles. La mejor manera actual de hacerlo es un método llamado GRPO. Piensa en GRPO como un profesor que le pide al estudiante escribir 8 respuestas diferentes a la misma pregunta. El profesor luego compara estas 8 respuestas: si algunas son correctas y otras incorrectas, el estudiante aprende qué estrategia funcionó mejor.

Sin embargo, el artículo señala que este método de "8 respuestas" tiene dos grandes defectos, como dos trampas en las que el estudiante puede caer:

  1. La Trampa del "Todo o Nada" (Desvanecimiento del Gradiente):

    • El Problema: Si la pregunta es demasiado fácil, el estudiante acierta las 8 respuestas. Si es demasiado difícil, falla en las 8. En ambos casos, el profesor no puede decirle al estudiante cómo mejorar porque no hay diferencia entre las respuestas. Es como un profesor que dice: "¡Buen trabajo!" o "¡Inténtalo de nuevo!" sin explicar por qué. El estudiante no recibe retroalimentación útil y deja de aprender.
    • La Solución del Artículo: En lugar de simplemente hacer la misma pregunta 8 veces, el profesor hace la misma pregunta pero la reformula de diferentes maneras (por ejemplo, cambiando el orden de las palabras, usando un formato diferente o contando la historia desde un ángulo distinto).
    • La Analogía: Imagina preguntar a un amigo: "¿Cuánto es 2+2?". Él dice "4". Fácil. Ahora pregunta: "Si tienes dos manzanas y obtienes dos más, ¿cuántas tienes?". Podría decir "4". Ahora pregunta: "Tengo dos pares de zapatos; ¿cuántos zapatos son?". Podría dudar y pensar más. Aunque las matemáticas son las mismas, la forma en que se hace la pregunta cambia cómo piensa el estudiante. Al mezclar la pregunta original con estos "vecinos reformulados", es más probable que el estudiante obtenga una mezcla de respuestas correctas e incorrectas en todo el grupo, dando al profesor mucha retroalimentación útil con la que trabajar.
  2. La Trampa de la "Cámara de Eco" (Colapso de la Diversidad):

    • El Problema: Incluso cuando el estudiante obtiene algunas respuestas correctas y otras incorrectas, tiende a quedarse atascado usando el mismo patrón de razonamiento para las 8 respuestas. Es como si el estudiante tuviera una "forma favorita" de resolver un problema y se negara a probar nada más. Deja de explorar nuevas estrategias.
    • La Solución del Artículo: Como las preguntas reformuladas se ven diferentes, el estudiante se ve obligado a probar diferentes estrategias para resolverlas. Una versión de la pregunta podría desencadenar un enfoque de "fórmula", mientras que otra desencadena un enfoque "visual".
    • La Analogía: Es como pedirle a un chef que haga una hamburguesa. Si solo dices "Haz una hamburguesa", podría hacer exactamente la misma cada vez. Pero si dices: "Haz una hamburguesa con el pan en la parte inferior", "Haz una hamburguesa con la carne cortada en cubos" y "Haz una hamburguesa con el queso derretido primero", el chef tiene que experimentar con diferentes técnicas. Esto obliga al chef a explorar una variedad más amplia de estilos culinarios, convirtiéndolo en un cocinero mejor y más versátil en general.

Cómo Funciona el Nuevo Método (TA-GRPO)

Los autores llaman a su nuevo método TA-GRPO (GRPO Aumentado con Transformación). Aquí está la receta simple:

  1. Toma un problema matemático.
  2. Usa una herramienta de IA (como GPT-4) para reescribir ese problema 3 veces de diferentes maneras, manteniendo el mismo significado.
  3. Pide al estudiante que resuelva el problema original y las 3 nuevas versiones, generando 8 respuestas para cada una de las 4 versiones. ¡Eso son 32 respuestas en total!
  4. El profesor examina las 32 respuestas en conjunto para determinar qué estrategias funcionaron mejor.
  5. Crucialmente, aunque el estudiante resolvió diferentes versiones de la pregunta, el profesor actualiza el "cerebro" del estudiante basándose en la pregunta original. Esto asegura que el estudiante aprenda el concepto central, no solo cómo responder a una redacción específica.

Los Resultados

El artículo probó esto en cuatro modelos de IA diferentes (de tamaño pequeño a mediano) utilizando competiciones matemáticas difíciles (como la AMC y la AIME).

  • Mejores Puntuaciones: TA-GRPO obtuvo consistentemente puntuaciones más altas que el método estándar. Por ejemplo, en las pruebas matemáticas más difíciles, mejoró la tasa de éxito en aproximadamente 5 puntos de media.
  • Exploración Más Inteligente: Los modelos no solo tuvieron suerte; realmente probaron formas más diversas de resolver problemas.
  • Eficiencia de Datos: El hallazgo más impresionante es que TA-GRPO logró resultados similares a entrenar un modelo con 2.5 veces más datos. En otras palabras, al hacer las preguntas de maneras más inteligentes, el modelo aprendió tanto como lo habría hecho si le hubieras alimentado una biblioteca masiva de libros de texto adicionales.

El Truco

El artículo señala un pequeño costo: para obtener esas preguntas reformuladas, necesitas pagar una pequeña tarifa por usar una IA potente (GPT-4-Turbo) para hacer la reescritura. Además, lleva un poco más de tiempo entrenar porque el modelo tiene que procesar más preguntas por paso. Pero los autores argumentan que la mejora en el rendimiento vale la pena este esfuerzo adicional.

En resumen: TA-GRPO evita que los modelos de IA se aburran o se queden atascados al hacerles la misma pregunta en muchos "disfraces" diferentes. Esto los obliga a pensar de manera más creativa y aprender de manera más efectiva, ahorrando tiempo y dinero en comparación con simplemente lanzar más datos al problema.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →