SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR
Cet article démontre qu'un ajustement fin supervisé (SFT) excessif peut compresser la distribution de déploiement, provoquant un effondrement de l'entropie qui entraîne une inversion de rang et une dégradation des performances lors de l'entraînement ultérieur par optimisation de politique relative au groupe (GRPO), un mode de défaillance qui peut être prédit et atténué en surveillant l'entropie pré-RL et la dynamique précoce de la GRPO.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
La vue d'ensemble : Le piège du « Trop Parfait »
Imaginez que vous entraînez un robot à écrire du code. La recette standard comporte deux étapes :
- L'Ajustement Fin Supervisé (SFT - Supervised Fine-Tuning) : Vous montrez au robot des milliers d'exemples de code correct pour qu'il apprenne les modèles.
- L'Apprentissage par Renforcement (RL - Reinforcement Learning) : Vous laissez le robot essayer de résoudre de nouveaux problèmes par lui-même. S'il réussit, il reçoit une récompense ; s'il échoue, il n'obtient rien.
Le Problème : L'article a découvert que si vous entraînez trop le robot lors de l'étape 1 (Surapprentissage de l'étape 1), il devient en réalité moins bon à l'étape 2.
D'habitude, nous pensons : « Plus le robot mémorise d'exemples à l'étape 1, meilleur il sera. » Les auteurs ont découvert l'inverse : le robot qui mémorise le plus à l'étape 1 est celui qui performe le moins bien à l'étape 2. En fait, le robot qui mémorise le moins finit par être le champion.
La Métaphore : Le Danseur Rigide vs Le Danseur Flexible
Pour comprendre pourquoi cela se produit, imaginez deux danseurs se préparant pour une compétition où ils doivent improviser une routine basée sur une musique aléatoire.
- Le Danseur « Surentraîné » (SFT Profond) : Ce danseur a pratiqué les mêmes 10 routines parfaites des milliers de fois. Il est incroyablement précis. Mais quand la musique change, il se fige. Il ne connaît que ces 10 mouvements. Il n'a aucune idée de comment bouger autrement.
- Le Danseur « Juste-ce qu'il faut » (SFT Peu Profond) : Ce danseur a pratiqué les bases mais a gardé son corps souple et flexible. Il connaît les règles, mais il peut encore se tortiller, pivoter et essayer de nouvelles choses quand la musique change.
La Compétition (RL) :
La compétition exige que les danseurs essaient de nombreux mouvements différents à la fois pour voir lequel fonctionne le mieux.
- Le Danseur Surentraîné essaie de faire exactement le même mouvement parfait à chaque fois. Comme ils se ressemblent tous, les juges (l'algorithme) ne peuvent pas distinguer quel mouvement est meilleur. Le danseur reste bloqué et ne peut rien apprendre de nouveau.
- Le Danseur Flexible essaie une grande variété de mouvements. Les juges peuvent voir : « Ah, ce mouvement a fonctionné, celui-là non ! » et le danseur apprend rapidement.
Le « Pourquoi » Technique : L'Effondrement de l'Entropie
L'article utilise un mot savant pour désigner la « variété » ou la « flexibilité » : l'Entropie.
- Effondrement de l'Entropie : Quand le robot est surentraîné, son « esprit » devient trop étroit. Il cesse d'explorer différentes possibilités et se contente de répéter les mêmes quelques réponses. Dans l'article, on dit que son entropie s'effondre.
- Le Signal Meurt : L'algorithme d'apprentissage (appelé GRPO) fonctionne en comparant différentes réponses. Si le robot donne la même réponse 8 fois de suite, l'algorithme est confus. Il ne peut pas calculer un « gradient » (une direction pour s'améliorer) car il n'y a aucune différence à comparer. C'est comme essayer de diriger une voiture alors que le volant est verrouillé droit devant.
- L'Inversion de Rang : Cela mène à un résultat étrange appelé Inversion de Rang.
- Avant la deuxième phase d'entraînement, le robot surentraîné ressemble à un génie (il obtient la bonne réponse 100 % du temps au test d'entraînement).
- Après la deuxième phase d'entraînement, il devient un désastre.
- Pendant ce temps, le robot « moins parfait », qui semblait légèrement moins bon au début, devient la superstar.
Les Deux Modèles : Un Conte de Deux Villes
Les auteurs ont testé cela sur deux cerveaux de robots différents (modèles) :
- Qwen (La Victime) : Ce modèle est tombé dans le piège. Plus ils l'entraînaient à l'étape 1, plus il se rigidifiait. Le « meilleur » point de contrôle (score le plus élevé) s'est avéré être le pire point de départ pour la phase suivante.
- DeepSeek (Le Survivant) : Ce modèle était naturellement plus flexible. Même après un entraînement intensif, il ne s'est pas rigidifié. Il est resté dans la « zone de sécurité » où il pouvait encore apprendre. Cela a prouvé que le problème n'était pas la deuxième phase d'entraînement elle-même, mais spécifiquement la façon dont la première phase a ruiné la flexibilité du modèle Qwen.
La Solution : Un Double Contrôle de Santé
Les auteurs n'ont pas seulement trouvé le problème ; ils ont construit un outil de diagnostic pour le repérer avant de gaspiller du temps et de l'argent.
- Étape 1 : Le Test d'Étirement (Entropie Pré-RL) : Avant de commencer la deuxième phase d'entraînement, ils vérifient à quel point l'esprit du robot est « lâche ». Si le robot est trop rigide (entropie faible), ils le signalent comme étant à haut risque.
- Étape 2 : Le Moniteur d'Alerte Précoce : S'ils commencent la deuxième phase, ils surveillent les premières minutes. Si le robot arrête d'essayer de nouvelles choses et commence immédiatement à se répéter, ils arrêtent l'entraînement prématurément pour économiser les ressources.
Ce qui n'a pas fonctionné ?
Les auteurs ont essayé de réparer le robot cassé avec des astuces classiques, comme :
- Ajouter une pénalité : « Ne dévie pas trop de ton entraînement d'origine. » (Cela l'a rendu encore moins bon).
- Lisser les étiquettes (Labels) : « Sois un peu moins certain de tes réponses. » (Cela a redonné de l'assurance au robot, mais il a quand même échoué à la compétition).
La Conclusion : On ne peut pas réparer un danseur rigide en lui disant d'« essayer plus fort » pendant la compétition. Il faut arrêter de l'entraîner de manière aussi rigide dès le départ. L'article prouve que la variété (l'entropie) est plus importante que la perfection lorsque l'on veut qu'un modèle continue d'apprendre.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.