← Derniers articles
💬 NLP

Group Entropy-Controlled Policy Optimization

Ce document introduit l'optimisation de politique contrôlée par l'entropie de groupe (GEPO), une extension légère de GRPO qui remédie aux limites de la régulation globale de l'entropie dans les tâches d'apprentissage par renforcement hétérogènes en utilisant des estimations d'entropie au niveau du groupe pour effectuer un façonnage asymétrique de l'avantage, équilibrant ainsi l'exploration et l'exploitation pour atteindre une performance inter-tâches supérieure.

Auteurs originaux : Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

Publié 2026-07-21
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : Optimisation de la Politique Contrôlée par l'Entropie de Groupe (GEPO)

1. Énoncé du Problème

L'apprentissage par renforcement (RL) est devenu un paradigme dominant pour le post-entraînement des grands modèles de langage (LLM) afin d'améliorer l'alignement et le raisonnement. Cependant, équilibrer le compromis exploration-exploitation reste un défi critique, particulièrement lors de l'entraînement sur des mélanges de tâches hétérogènes (par exemple, combiner les mathématiques, le codage, la physique et le suivi d'instructions).

Les méthodes actuelles de contrôle de l'entropie opèrent principalement à deux niveaux de granularité :

  1. Au niveau de la politique : Calcul de l'entropie sur l'ensemble du batch et application d'un signal de régulation uniforme (Figure 1a).
  2. Au niveau du jeton (token) : Calcul de la covariance des jetons et régulation des jetons individuels (Figure 1b).

Le document identifie une faille fondamentale dans ces approches lorsqu'elles sont appliquées à l'Optimisation de la Politique Relative de Groupe (GRPO) : l'hétérogénéité de l'entropie. Différents domaines de tâches présentent des régimes d'entropie distincts sous une même politique. Par exemple, les prompts de physique peuvent naturellement se concentrer autour d'une faible entropie, tandis que les prompts de suivi d'instructions présentent une entropie élevée.

Cette hétérogénéité induit deux pathologies spécifiques dans le GRPO standard :

  • Biais dépendant de l'entropie : La normalisation des avantages au sein des groupes crée des signaux statistiquement non comparables entre les groupes ayant des niveaux d'entropie différents. Les groupes à faible entropie (souvent des tâches à haute précision) produisent des signaux de gradient forts et cohérents, tandis que les groupes à haute entropie (souvent des tâches à faible précision) produisent des signaux faibles et bruités.
  • Déséquilibre d'optimisation : L'optimisation au niveau du batch devient dominée par les tâches à faible entropie, ce qui fait que les tâches à haute entropie reçoivent des signaux d'apprentissage décroissants. Cela mène à un cycle d'auto-renforcement où les tâches à faible entropie convergent prématurément, tandis que les tâches à haute entropie ne parvèrent pas à explorer efficacement ou souffrent d'une « entropie incontrôlée » menant à des sorties dégénérées.

2. Méthodologie : GEPO

Les auteurs proposent l'Optimisation de la Politique Contrôlée par l'Entropie de Groupe (GEPO), une extension légère et agnostique au modèle de GRPO qui effectue un façonnage asymétrique de l'avantage conditionné par l'entropie au niveau du groupe.

Mécanisme Central

GEPO utilise l'Entropie de Groupe (Hg\mathcal{H}_g), estimée à partir des échantillons groupés existants d'un prompt, comme signal de diagnostic. Au lieu d'appliquer une cible d'entropie globale, GEPO façonne le signal d'avantage (AiA_i) pour chaque réponse en fonction de l'état d'entropie du groupe :

A^i=ω(Ai,Hg)Ai \hat{A}_i = \omega(A_i, \mathcal{H}_g) \cdot A_i

La fonction de façonnage applique des coefficients d'échelle asymétriques (αlow,αhigh(0,1)\alpha_{low}, \alpha_{high} \in (0, 1)) :

  • Groupes à faible entropie (Hg<Hlow\mathcal{H}_g < \mathcal{H}_{low}) : Les avantages positifs sont atténués par αlow\alpha_{low}. Cela empêche la sur-exploitation et la convergence prématurée dans les tâches où le modèle est déjà confiant.
  • Groupes à haute entropie (Hg>Hhigh\mathcal{H}_g > \mathcal{H}_{high}) : Les avantages négatifs sont atténués par αhigh\alpha_{high}. Cela empêche la suppression prématurée de l'exploration dans les tâches où le modèle est incertain, permettant à la politique de découvrir des chemins de raisonnement corrects.
  • Sinon : L'avantage reste inchangé.

Choix de Conception Clés

  1. Façonnage Asymétrique (αhigh<αlow\alpha_{high} < \alpha_{low}) : Les auteurs observent empiriquement que les groupes à faible entropie sont plus fragiles ; une pénalisation agressive des avantages négatifs dans ces groupes peut déclencher un « effondrement de la longueur » (où le modèle raccourcit les réponses pour réduire l'incertitude). Par conséquent, GEPO applique une incitation plus douce (αlow\alpha_{low} est plus élevé) aux groupes à faible entropie par rapport à l'atténuation plus forte (αhigh\alpha_{high} est plus bas) appliquée aux groupes à haute entropie.
  2. Seuils Adaptatifs : Les seuils d'entropie fixes sont fragiles selon les modèles de base et les étapes d'entraînement. GEPO dérive les seuils (Hlow,Hhigh\mathcal{H}_{low}, \mathcal{H}_{high}) dynamiquement à partir de la distribution de l'entropie du batch (moyenne et écart type) et les lisse en utilisant une Moyenne Mobile Exponentielle (EMA). Cela permet à la méthode de s'auto-calibrer automatiquement à l'échelle d'entropie spécifique du modèle de base sans réglage spécifique à la tâche.

3. Contributions Clés

  • Insight Théorique : Le papier fournit une analyse théorique (Propositions 2.1 et 2.2) démontrant que les avantages normalisés dans GRPO sont structurellement biaisés par l'entropie de groupe. Il prouve que l'écart entre les distributions de récompense pondérées par la politique et la référence dépend de l'entropie, conduisant à des signaux d'avantage non comparables entre des tâches hétérogènes.
  • Innovation Algorithmique : GEPO introduit le premier mécanisme de contrôle de l'entropie au niveau du groupe qui effectue un façonnage d'avantage asymétrique. Contrairement aux méthodes précédentes qui traitent l'entropie comme une propriété globale ou par jeton, GEPO traite l'entropie comme un diagnostic de groupe-prompt pour rééquilibrer les pressions d'optimisation.
  • Implémentation à Coût Zéro : La méthode ne nécessite aucun échantillonnage supplémentaire ni estimation de fonction de valeur. Elle exploite les échantillons groupés existants dans GRPO, ajoutant une charge de calcul négligeable.

4. Résultats Expérimentaux

Les auteurs ont évalué GEPO sur deux modèles de base (Intern-S1-mini et Qwen3.5-9B) à travers treize benchmarks couvrant les mathématiques, la physique, les sciences, la génération de code et le suivi d'instructions.

  • Performance : GEPO a systématiquement surpassé GRPO et les récentes méthodes de contrôle de l'entropie (AEPO, Clip-Cov, KL-Cov).
    • Sur Intern-S1-mini, GEPO a obtenu le meilleur score moyen (54,2) et a gagné sur 7 des 13 benchmarks, incluant des gains significatifs sur AIME25, IMO-Bench et GPQA.
    • Sur Qwen3.5-9B, GEPO a obtenu le score moyen le plus élevé (71,2), dépassant des bases solides comme Clip-Cov (70,9) et KL-Cov (69,9).
  • Stabilité : GEPO a démontré une stabilité d'entraînement supérieure. Alors que GRPO a souffert d'un effondrement de performance catastrophique (par exemple, sur Qwen3.5-9B autour de l'étape 170) dû à une croissance incontrôlée de l'entropie, et que AEPO a présenté des oscillations persistantes, GEPO a maintenu des courbes de validation lisses et en amélioration monotone.
  • Dynamique de l'Entropie : L'analyse des dynamiques d'entraînement a montré que GEPO préserve des niveaux d'exploration différenciés entre les tâches. Contra contrairement à AEPO, qui impose un schéma d'entropie uniforme, GEPO permet aux tâches nécessitant une large exploration de maintenir une entropie élevée, tandis que les tâches déterministes se stabilisent à une entropie plus faible, évitant ainsi tant l'effondrement prématuré que l'entropie incontrôlée.

5. Signification et Revendications

Le papier affirme que GEPO répond à une lacune critique dans le post-entraînement par RL multi-tâches : l'incapacité des méthodes actuelles à gérer le biais structurel introduit par l'hétérogénéité de l'entropie entre diverses tâches.

Les auteurs affirment que :

  1. La régulation spécifique à la tâche est essentielle : Pousser des tâches hétérogènes vers un schéma d'entropie uniforme est sous-optimal. Un apprentissage multi-tâches efficace nécessite de préserver les régimes d'exploration spécifiques à chaque tâche.
  2. L'asymétrie est cruciale : La fragilité des groupes à faible entropie nécessite une approche asymétrique du façonnage de l'avantage pour éviter l'effondrement de la longueur tout en encourageant l'exploration.
  3. Scalabilité : En s'appuyant sur l'entropie de groupe estimée à partir des rollouts existants et sur des seuils adaptatifs, GEPO offre une solution scalable et agnostique au modèle qui améliore à la fois la performance moyenne et l'équilibre inter-tâches sans nécessendre d'annotations de tâches explicites ou de coûts d'échantillonnage supplémentaires.

En conclusion, le papier positionne GEPO comme un cadre robuste pour stabiliser l'entraînement par RL dans des scénarios complexes de post-entraînement de LLM multi-domaines, garantissant que le processus d'optimisation respecte l'incertitude et la diversité inhérentes aux différents types de tâches.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →