← Últimos artículos
💬 NLP

Group Entropy-Controlled Policy Optimization

Este artículo presenta la Optimización de Política Controlada por Entropía de Grupo (GEPO, por sus siglas en inglés), una extensión ligera de GRPO que aborda las limitaciones de la regulación de entropía global en tareas de aprendizaje por refuerzo heterogéneas mediante el uso de estimaciones de entropía a nivel de grupo para realizar un modelado asimétrico de la ventaja, equilibrando así la exploración y la explotación para lograr un rendimiento superior entre distintas tareas.

Autores originales: Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

Publicado 2026-07-21
📖 1 min de lectura☕ Lectura para el café

Autores originales: Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Optimización de Política Controlada por Entropía de Grupo (GEPO)

1. Planteamiento del Problema

El Aprendizaje por Refuerzo (RL) se ha convertido en un paradigma dominante para el post-entrenamiento de Grandes Modelos de Lenguaje (LLMs) con el fin de mejorar el alineamiento y el razonamiento. Sin embargo, equilibrar la compensación entre exploración y explotación sigue siendo un desafío crítico, particularmente cuando se entrena sobre mezclas de tareas heterogéneas (por ejemplo, combinando matemáticas, programación, física y seguimiento de instrucciones).

Los métodos actuales de control de entropía operan principalmente en dos granularidades:

  1. A nivel de política: Calculando la entropía sobre todo el lote (batch) y aplicando una señal de regulación uniforme (Figura 1a).
  2. A nivel de token: Calculando la covarianza de los tokens y regulando los tokens individuales (Figura 1b).

El artículo identifica un fallo fundamental en estos enfoques cuando se aplican a la Optimización de Política Relativa de Grupo (GRPO): la Heterogeneidad de la Entropía. Diferentes dominios de tareas exhiben regímenes de entropía distintos bajo la misma política. Por ejemplo, los prompts de física pueden concentrarse naturalmente en una entropía baja, mientras que los prompts de seguimiento de instrucciones exhiben una entropidad alta.

Esta heterogeneidad induce dos patologías específicas en el GRPO estándar:

  • Sesgo Dependiente de la Entropía: La normalización de las ventajas dentro de los grupos crea señales estadísticamente no comparables entre grupos con diferentes niveles de entropía. Los grupos de baja entropía (a menudo tareas de alta precisión) producen señales de gradiente fuertes y consistentes, mientras que los grupos de alta entropía (a menudo tareas de baja precisión) producen señales débiles y ruidosas.
  • Desequilibrio de Optimización: La optimización a nivel de lote se ve dominada por las tareas de baja entropía, lo que provoca que las tareas de alta entropía reciban señales de aprendizaje decrecientes. Esto conduce a un ciclo de retroalimentación donde las tareas de baja entropía convergen prematuramente, mientras que las tareas de alta entropía no exploran eficazmente o sufren de una "entropía descontrolada" que conduce a salidas degeneradas.

2. Metodología: GEPO

Los autores proponen la Optimización de Política Controlada por Entropía de Grupo (GEPO), una extensión ligera y agnóstica al modelo para GRPO que realiza un moldeado de ventaja asimétrico condicionado por la entropía a nivel de grupo.

Mecanismo Central

GEPO utiliza la Entropía de Grupo (Hg\mathcal{H}_g), estimada a partir de las muestras agrupadas existentes de un prompt, como una señal de diagnóstico. En lugar de aplicar un objetivo de entropía global, GEPO moldea la señal de ventaja (AiA_i) para cada respuesta basándose en el estado de entropía del grupo:

A^i=ω(Ai,Hg)Ai \hat{A}_i = \omega(A_i, \mathcal{H}_g) \cdot A_i

La función de moldeado aplica coeficientes de escalado asimétricos (αlow,αhigh(0,1)\alpha_{low}, \alpha_{high} \in (0, 1)):

  • Grupos de Baja Entropía (Hg<Hlow\mathcal{H}_g < \mathcal{H}_{low}): Las ventajas positivas son atenuadas por αlow\alpha_{low}. Esto evita la sobre-explotación y la convergencia prematura en tareas donde el modelo ya tiene confianza.
  • Grupos de Alta Entropía (Hg>Hhigh\mathcal{H}_g > \mathcal{H}_{high}): Las ventajas negativas son atenuadas por αhigh\alpha_{high}. Esto evita la supresión prematura de la exploración en tareas donde el modelo es incierto, permitiendo que la política descubra caminos de razonamiento correctos.
  • De lo contrario: La ventaja permanece sin cambios.

Decisiones de Diseño Clave

  1. Moldeado Asimétrico (αhigh<αlow\alpha_{high} < \alpha_{low}): Los autores observan empíricamente que los grupos de baja entropía son más frágiles; la penalización agresiva de las ventajas negativas en estos grupos puede desencadenar un "colapso de longitud" (donde el modelo acorta las respuestas para reducir la incertidumbre). Por lo tanto, GEPO aplica un impulso más suave (αlow\alpha_{low} es mayor) a los grupos de baja entropía en comparación con la atenuación más fuerte (αhigh\alpha_{high} es menor) aplicada a los grupos de alta entropía.
  2. Umbrales Adaptativos: Los umbrales de entropía fijos son frágiles a través de diferentes modelos base y etapas de entrenamiento. GEPO deriva los umbrales (Hlow,Hhigh\mathcal{H}_{low}, \mathcal{H}_{high}) dinámicamente de la distribución de entropía del lote (media y desviación estándar) y los suaviza mediante una Media Móvil Exponencial (EMA). Esto permite que el método se calibre automáticamente al escalado de entropía específico del modelo base sin necesidad de ajuste específico de la tarea.

3. Contribuciones Clave

  • Perspectiva Teórica: El artículo proporciona un análisis teórico (Proposiciones 2.1 y 2.2) demostrando que las ventajas normalizadas en GRPO están estructuralmente sesgadas por la entropía del grupo. Prueba que la discrepancia entre las distribuciones de recompensa ponderadas por la política y la de referencia depende de la entropía, lo que conduce a señales de ventaja no comparables entre tareas heterogéneas.
  • Innovación Algorítmica: GEPO introduce el primer mecanismo de control de entropía a nivel de grupo que realiza un moldeado de ventaja asimétrico. A diferencia de otros métodos que tratan la entropía como una propiedad global o de token, GEPO la trata como un diagnóstico de grupo de prompts para reequilibrar las presiones de optimización.
  • Implementación de Costo Cero: El método no requiere muestreo adicional ni estimación de la función de valor. Aprovecha las muestras agrupadas existentes en GRPO, añadiendo un costo computacional insignificante.

4. Resultados Experimentales

Los autores evaluaron GEPO en dos modelos base (Intern-S1-mini y Qwen3.5-9B) a través de trece benchmarks que cubren matemáticas, física, ciencia, generación de código y seguimiento de instrucciones.

  • Rendimiento: GEPO superó consistentemente a GRPO y a los métodos de control de entropía recientes (AEPO, Clip-Cov, KL-Cov).
    • En Intern-S1-mini, GEPO logró la mejor puntuación promedio (54.2) y ganó en 7 de los 13 benchmarks, incluyendo ganancias significativas en AIME25, IMO-Bench y GPQA.
    • En Qwen3.5-9B, GEPO alcanzó la puntuación más alta (71.2), superando a bases sólidas como Clip-Cov (70.9) y KL-Cov (69.9).
  • Estabilidad: GEPO demostró una estabilidad de entrenamiento superior. Mientras que GRPO sufrió un colapso de rendimiento catastrófico (por ejemplo, en Qwen3.5-9B alrededor del paso 170) debido al crecimiento ilimitado de la entropía, y AEPO exhibió oscilaciones persistentes, GEPO mantuvo curvas de validación suaves y de mejora monótona.
  • Dinámica de la Entropía: El análisis de la dinámica de entrenamiento mostró que GEPO preserva niveles de exploración diferenciados entre tareas. A diferencia de AEPO, que fuerza un patrón de entropía uniforme, GEPO permite que las tareas que requieren una exploración amplia mantengan una entropía más alta, mientras que las tareas deterministas se asientan en una entropía más baja, evitando tanto el colapso prematuro como la entropía descontrolada.

5. Significado y Reivindicaciones

El artículo afirma que GEPO aborda una brecha crítica en el post-entrenamiento de RL multitarea: la incapacidad de los métodos actuales para manejar el sesgo estructural introducido por la heterogeneidad de la entropía entre diversas tareas.

Los autores sostienen que:

  1. La Regulación Específica de la Tarea es Esencial: Dirigir las tareas heterogéneas hacia un patrón de entropía uniforme es subóptimo. El aprendizaje multitarea efectivo requiere preservar los regímenes de exploración específicos de cada tarea.
  2. La Asimetría es Crucial: La fragilidad de los grupos de baja entropía requiere un enfoque asimétrico de moldeado de ventaja para evitar el colapso de longitud y, al mismo tiempo, fomentar la exploración.
  3. Escalabilidad: Al depender de la entropía de grupo estimada a partir de los rollouts existentes y de umbrales adaptativos, GEPO ofrece una solución escalable y agnóstica al modelo que mejora tanto el rendimiento promedio como el equilibrio entre tareas sin requerir anotaciones de tareas explícitas ni costos de muestreo adicionales.

En conclusión, el artículo posiciona a GEPO como un marco robusto para estabilizar el entrenamiento de RL en escenarios complejos de post-entrenamiento de LLM multidominio, asegurando que el proceso de optimización respete la incertidencia inherente y la diversidad de los diferentes tipos de tareas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →