GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
Este artículo presenta GTPO y GRPO-S, dos nuevos algoritmos de aprendizaje por refuerzo que mejoran el razonamiento de los Grandes Modelos de Lenguaje mediante la implementación de un modelado de recompensa dinámico basado en la entropía para lograr una asignación de crédito de grano fino, tanto a nivel de token como de secuencia, superando así las limitaciones de grano grueso de métodos existentes como GRPO y DAPO.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
El gran problema: La calificación de "todo o nada"
Imagina que estás enseñando a un estudiante (la IA) a resolver un problema matemático muy largo y complejo. El estudiante escribe una solución de 50 pasos.
- Los pasos 1 al 49 son brillantes, lógicos y correctos.
- El paso 50 (la respuesta final) es incorrecto debido a un pequeño error de cálculo.
En los métodos actuales predominantes (como GRPO), el profesor mira el resultado final, ve que es incorrecto y le da a todo el ensayo de 50 pasos una calificación reprobatoria (0 puntos).
- El resultado: El estudiante piensa: "Oh, supongo que los pasos 1 al 49 también fueron inútiles". Olvida las partes buenas y podría intentar un enfoque completamente diferente y aleatorio la próxima vez.
- El fallo: Esto se llama asignación de crédito de grano grueso (coarse-grained credit assignment). Trata toda la cadena de pensamiento como un único bloque, ignorando que la mayor parte fue en realidad perfecta.
La solución: La brújula de la "Entropía"
Los autores de este artículo proponen una nueva forma de calificar al estudiante. Introducen un concepto llamado Entropía de la Política (Policy Entropy).
Piensa en la Entropía como una medida de "pensar intensamente" o "incertidumbre".
- Baja Entropía: El estudiante está muy seguro de sí mismo. Solo está escribiendo lo que ya sabe (por ejemplo, "1 + 1 = 2").
- Alta Entropía: El estudiante hace una pausa, considera múltiples opciones y lucha con una elección difícil. Está explorando diferentes caminos.
El artículo sostiene que la Alta Entropía es buena cuando aciertas (significa que exploraste el camino correcto con cuidado), pero la Alta Entropía es mala cuando te equivocas (significa que estabas adivinando con confianza en la dirección equivocada).
Los dos nuevos algoritmos
El artículo presenta dos nuevos "profesores" (algoritmos) que utilizan esta brújula de Entropía para dar un mejor feedback.
1. GTPO (Optimización de la Política de Tokens de Grupo)
La analogía: El profesor "Resaltador"
En lugar de calificar todo el ensayo a la vez, GTPO califica cada una de las palabras (tokens) individualmente.
- Si el ensayo es Correcto: El profesor resalta las palabras donde el estudiante dudó o exploró diferentes opciones (Alta Entropía) y les otorga puntos extra de bonificación. Esto le dice al estudiante: "¡Buen trabajo pensando intensamente en ese paso específico!".
- Si el ensayo es Incorrecto: El profesor busca las palabras donde el estudiante fue demasiado seguro de sí mismo pero se equivocó (Baja Entropía). A estas palabras les aplica una penalización severa. Esto le dice al estudiante: "Estabas demasiado seguro de ti mismo aquí, y te equivocaste. No seas tan confiado la próxima vez".
Por qué ayuda: Preserva las partes buenas del razonamiento y castiga los momentos específicos de exceso de confianza que llevaron al error.
2. GRPO-S (GRPO a nivel de secuencia)
La analogía: El profesor de "Boleta de Calificaciones"
A veces, calificar cada palabra es demasiado lento o computacionalmente pesado. GRPO-S es una versión más ligera.
- En lugar de mirar las palabras individuales, observa el promedio del "esfuerzo de pensamiento" de todo el ensayo.
- Si el ensayo es Correcto: Verifica: "¿Pensó el estudiante intensamente y exploró en general?". Si es así, todo el ensayo recibe un impulso.
- Si el ensayo es Incorrecto: Verifica: "¿Estaba el estudiante erradamente seguro de sí mismo?". Si es así, el ensayo completo recibe una penalización mayor.
Por qué ayuda: Es más rápido pero sigue siendo más inteligente que el viejo método de "todo o nada". Es particularmente bueno para mantener la estabilidad del estudiante durante tareas de razonamiento muy largas.
Los resultados: ¿Qué pasó?
Los autores probaron estos nuevos profesores en pruebas de matemáticas difíciles (como AIME y MATH).
- La forma antigua (GRPO/DAPO): El estudiante a menudo se quedaba estancado. O bien se rendían demasiado rápido, o se quedaban "atrapados" en un bucle de respuestas seguras pero incorrectas (Colapso de la Política).
- La nueva forma (GTPO/GRPO-S):
- Exploración: Los estudiantes siguieron intentando diferentes caminos durante más tiempo porque se les recompensaba por "pensar intensamente" (alta entropía) cuando acertaban.
- Precisión: Aprendieron a dejar de estar erradamente seguros de sí mismos.
- Rendimiento: Obtuvieron puntuaciones significativamente más altas en problemas matemáticos difíciles, resolviendo cadenas de razonamiento más complejas que antes.
Resumen en una frase
Este artículo enseña a los modelos de IA a dejar de tratar una larga cadena de pensamiento como una única calificación de "aprobado o reprobado", y en su lugar, les entrega una boleta de calificaciones detallada que los premia por pensar intensamente cuando aciertan y por ser humildes cuando se equivocan, lo que conduce a un razonamiento mucho más inteligente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.