GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
Cet article introduit GTPO et GRPO-S, deux nouveaux algorithmes d'apprentissage par renforcement qui améliorent le raisonnement des grands modèles de langage en implémentant un façonnage de récompense dynamique basé sur l'entropie afin de parvenir à une attribution de crédit fine, au niveau du jeton et de la séquence, surmontant ainsi les limitations de granularité grossière des méthodes existantes telles que GRPO et DAPO.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Le gros problème : La note « Tout ou Rien »
Imaginez que vous enseignez à un élève (l'IA) à résoudre un problème de mathématiques très long et complexe. L'élève écrit une solution en 50 étapes.
- Les étapes 1 à 49 sont brillantes, logiques et correctes.
- L'étape 50 (la réponse finale) est fausse à cause d'une minuscule erreur de calcul.
Dans les méthodes dominantes actuelles (comme GRPO), le professeur regarde le résultat final, voit qu'il est faux, et donne à l'intégralité de l'essai de 50 étapes une note éliminatoire (0 point).
- Le résultat : L'élève pense : « Oh, je suppose que les étapes 1 à 49 étaient inutiles aussi. » Il oublie les bonnes parties et essaie peut-être une approche complètement différente et aléatoire la prochaine fois.
- La faille : C'est ce qu'on appelle l'attribution de crédit à grain grossier (coarse-grained credit assignment). Cela traite toute la chaîne de pensée comme un bloc unique, ignorant que la majeure partie était en réalité parfaite.
La solution : La boussole de l'« Entropie »
Les auteurs de ce papier proposent une nouvelle façon de noter l'élève. Ils introduisent un concept appelé Entropie de la Politique (Policy Entropy).
Considérez l'Entropie comme une mesure de la « réflexion intense » ou de l'« incertitude ».
- Faible Entropie : L'élève est très confiant. Il se contente de taper ce qu'il sait déjà (ex: « 1 + 1 = 2 »).
- Haute Entropie : L'élève marque une pause, considère plusieurs options et se débat avec un choix difficile. Il explore différents chemins.
Le papier soutient qu'une Haute Entropie est une bonne chose quand on a raison (cela signifie qu'on a exploré le bon chemin avec soin), mais qu'une Haute Entropie est une mauvaise chose quand on a tort (cela signifie qu'on spéculait avec assurance dans la mauvaise direction).
Les deux nouveaux algorithmes
Le papier présente deux nouveaux « professeurs » (algorithmes) qui utilisent cette boussole d'Entropie pour donner un meilleur feedback.
1. GTPO (Optimisation de la politique de jetons de groupe)
L'analogie : Le professeur « Surligneur »
Au lieu de noter l'essai entier d'un coup, GTPO note chaque mot (jeton/token) individuellement.
- Si l'essai est Correct : Le professeur surligne les mots où l'élève a hésité ou exploré différentes options (Haute Entropie) et leur donne des points bonus supplémentaires. Cela dit à l'élève : « Bon travail, tu as bien réfléchi à cette étape spécifique ! »
- Si l'essai est Incorrect : Le professeur cherche les mots où l'élève était trop confiant mais s'est trompé (Faible Entropie). Il applique à ces mots une pénalité lourde. Cela dit à l'élève : « Tu étais trop sûr de toi ici, et tu avais tort. Ne sois pas si confiant la prochaine fois. »
Pourquoi cela aide : Cela préserve les bonnes parties du raisonnement et punit les moments spécifiques de surconfiance qui ont mené à l'échec.
2. GRPO-S (GRPO au niveau de la séquence)
L'analogie : Le professeur « Bulletin de notes »
Parfois, noter chaque mot individuellement est trop lent ou trop gourmand en ressources de calcul. GRPO-S est une version plus légère.
- Au lieu de regarder les mots individuellement, il regarde l'effort de réflexion moyen de l'ensemble de l'essai.
- Si l'essai est Correct : Il vérifie : « L'élève a-t-il généralement réfléchi intensément et exploré ? » Si oui, l'essai entier reçoit un bonus.
- Si l'essai est Incorrect : Il vérifie : « L'élève était-il sûrement dans l'erreur ? » Si oui, l'essai entier reçoit une pénalité plus importante.
Pourquoi cela aide : C'est plus rapide, mais c'est toujours plus intelligent que l'ancienne méthode du « Tout ou Rien ». C'est particulièrement efficace pour maintenir la stabilité de l'élève lors de tâches de raisonnement très longues.
Les résultats : Qu'est-ce qui s'est passé ?
Les auteurs ont testé ces nouveaux professeurs sur des benchmarks mathématiques difficiles (comme AIME et MATH).
- L'ancienne méthode (GRPO/DAPO) : L'élève se retrouvait souvent bloqué. Soit il abandonnait trop vite, soit il restait « coincé » dans une boucle de réponses confiantes mais erronées (Effondrement de la politique / Policy Collapse).
- La nouvelle méthode (GTPO/GRPO-S) :
- Exploration : Les élèves ont continué à essayer différents chemins plus longtemps car ils étaient récompensés pour « réfléchir intensément » (haute entropie) lorsqu'ils avaient raison.
- Précision : Ils ont appris à ne plus être sûrs d'eux tout en ayant tort.
- Performance : Ils ont obtenu des scores nettement plus élevés sur des problèmes mathématiques difficiles, résolvant des chaînes de raisonnement plus complexes que auparavant.
Résumé en une phrase
Ce papier apprend aux modèles d'IA à ne plus traiter une longue chaîne de pensée comme une note unique de « réussite ou d'échec », mais à leur donner plutôt un bulletin détaillé qui les récompense pour avoir réfléchi intensément quand ils ont raison et pour faire preuve d'humilité quand ils ont tort, menant ainsi à un raisonnement beaucoup plus intelligent.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.