RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training
Cet article remet en question la pratique standard consistant à n'appliquer l'apprentissage par renforcement (RL) qu'après l'ajustement fin supervisé (SFT) en démontrant que l'intégration du RL plus tôt dans le pré-entraînement, l'optimisation de la composition des données et la fusion du RL avec les objectifs de SFT peuvent améliorer efficacement les capacités de raisonnement et élargir les distributions du modèle tout en préservant les capacités générales.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous formez un étudiant brillant mais novice (le modèle d'IA) pour résoudre des problèmes mathématiques. Pendant des années, la recette standard comprenait trois étapes :
- Pré-entraînement : L'étudiant lit des millions de livres pour apprendre le langage général et les faits.
- SFT (Ajustement Supervisé) : Un enseignant donne à l'étudiant un manuel avec des problèmes et leurs réponses exactes, le forçant à mémoriser le chemin de résolution.
- RL (Apprentissage par Renforcement) : L'étudiant est placé dans un jeu où il reçoit des points uniquement s'il trouve la réponse finale, l'encourageant à découvrir de nouvelles façons de résoudre les problèmes par lui-même.
Cette étude pose la question suivante : Devons-nous vraiment attendre que l'étudiant ait fini de lire tous les livres et mémorisé le manuel avant de le laisser jouer au jeu ?
Voici ce que les chercheurs ont découvert, expliqué simplement :
1. On peut commencer le jeu plus tôt
La règle habituelle dit : « Attendez que l'étudiant soit pleinement formé avant de lui donner le jeu. » Les chercheurs ont essayé de donner le jeu (RL) à l'étudiant alors qu'il en était encore à la lecture de ses premiers chapitres (au début du pré-entraînement).
- Le résultat : Cela a fonctionné de manière surprenante ! Même quand l'étudiant n'avait lu qu'une infime fraction des livres, jouer au jeu l'aidait à résoudre les problèmes mathématiques bien mieux que la simple lecture de plus de livres. En fait, jouer au jeu tôt était souvent aussi efficace que d'attendre la fin et de suivre toute la routine « Lire → Mémoriser → Jouer ».
2. Le « Jeu » est meilleur quand on n'a pas de manuel
Habituellement, l'étape de « Mémorisation » (SFT) nécessite un manuel avec les bonnes réponses. Mais et si vous n'avez pas assez de manuels ?
- La découverte : Si vous n'avez qu'un ou deux exemples de la façon de résoudre un problème, l'étape de « Mémorisation » (SFT) échoue. Mais le « Jeu » (RL) prospère. L'étudiant apprend à explorer et à trouver des solutions par lui-même sans avoir besoin d'un corrigé parfait. Le jeu est un bien meilleur professeur lorsque vous manquez d'exemples.
3. Le ingrédient secret est le type de livres, pas la taille de l'étudiant
Les gens pensent souvent : « Si l'étudiant est plus grand (plus puissant), il apprendra mieux. » Les chercheurs ont testé cela en rendant l'étudiant plus grand.
- Le rebondissement : Rendre l'étudiant plus grand n'a pas aidé à apprendre le jeu plus rapidement. Cependant, lui donner plus de livres de mathématiques spécifiquement pendant sa phase de lecture initiale l'a fait.
- La leçon : Si vous voulez que l'étudiant soit bon en mathématiques, nourrissez-le d'histoires mathématiques tôt. Le contenu de ce qu'il lit importe plus que la taille de son cerveau.
4. Le mythe de l'« Affûtage » vs l'« Expansion »
Il existe un débat récent : Le « Jeu » (RL) ne fait-il qu'affûter les réponses existantes de l'étudiant pour les rendre plus précises et confiantes, ou lui apprend-il réellement de nouvelles façons de réfléchir ?
- La vue ancienne : Beaucoup pensaient que le RL ne faisait qu'« affûter » l'étudiant, le rendant plus confiant mais pas nécessairement plus intelligent.
- La nouvelle découverte : Les chercheurs ont découvert que l'effet d'« affûtage » provient en réalité de l'étape de « Mémorisation » (SFT). Lorsque vous forcez un étudiant à mémoriser un manuel d'abord, il cesse d'explorer.
- La vraie magie : Si vous laissez l'étudiant jouer au jeu directement sans mémoriser le manuel au préalable, il étend réellement sa pensée. Il essaie de nombreux chemins différents et découvre de nouvelles solutions qu'il ne connaissait pas auparavant. L'étape de « Mémorisation » est ce qui limite sa créativité, et non le jeu lui-même.
5. La recette de l'« Étudiant Suprême »
Les chercheurs ont combiné le meilleur des deux mondes. Au lieu de faire « Mémoriser » puis « Jouer », ils ont fait faire les deux à l'étudiant en même temps.
- Comment ça marche : Imaginez l'étudiant en train de résoudre un problème. Une partie de son cerveau vérifie le manuel (SFT), et une autre partie expérimente de nouvelles idées (RL). Ils font la moyenne des conseils de ces deux parties pour mettre à jour leur cerveau.
- Le résultat : Cet « Étudiant Suprême » (Moyenne Parallèle) est devenu le meilleur pour résoudre les problèmes. Il obtient les bonnes réponses plus souvent que n'importe qui d'autre, et contrairement aux étudiants qui ont simplement mémorisé le manuel, il n'oublie pas comment faire d'autres choses (comme la conversation générale).
Résumé des points clés
- N'attendez pas : Vous pouvez utiliser l'Apprentissage par Renforcement (le jeu) très tôt dans la vie d'un modèle, même avant qu'il n'ait terminé sa phase de « lecture ».
- Les données comptent plus que la taille : Nourrir le modèle avec des types de données spécifiques (comme les mathématiques) pendant le pré-entraînement est plus important que de simplement agrandir le modèle.
- Le RL n'est pas le méchant : Le RL ne gâche pas les compétences générales d'un modèle et ne fait pas que l'« affûter ». Ces effets négatifs proviennent de l'étape de « Mémorisation » (SFT). Le RL aide réellement les modèles à explorer et à trouver de nouvelles solutions.
- Faites-le ensemble : Les meilleurs résultats proviennent du mélange des étapes de « Mémorisation » et de « Jeu » simultanément, plutôt que de les faire l'une après l'autre.
En bref, l'étude suggère que nous devrions cesser de traiter l'Apprentissage par Renforcement comme une simple touche finale à la fin du processus. Au lieu de cela, nous devrions l'intégrer beaucoup plus tôt dans le processus d'entraînement et le mélanger à d'autres méthodes pour obtenir des modèles plus intelligents et plus capables.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.