Data Augmentations for Data-Constrained Language Model Pretraining
Cet article propose que la combinaison de bruit au niveau du jeton, de permutations de séquences et de prédiction de décalage de cible, en tant que techniques d'augmentation de données, atténue efficacement le surapprentissage lors du préentraînement de modèles de langage autorégressifs, permettant ainsi un entraînement multipas productif sur des corpus fixes et contraints en données.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous enseignez l'art d'écrire des histoires à un étudiant brillant mais très affamé (le modèle IA). Par le passé, la meilleure façon d'enseigner à cet étudiant était de lui donner une immense bibliothèque de livres à lire. Plus il lisait de livres, plus il devenait intelligent.
Mais maintenant, nous avons heurté un mur. Nous sommes à court de livres de haute qualité sur Internet. Pendant ce temps, nos ordinateurs (les professeurs) deviennent incroyablement puissants et rapides. Nous sommes dans une situation où nous avons trop de puissance de calcul mais pas assez de nouvelles données.
Le Problème : L'Étudiant « Sur-Lu »
Parce que nous n'avons plus de nouveaux livres, nous devons faire lire au même texte les 75 millions de mots de façon répétée.
Dans l'ancienne méthode d'entraînement (appelée « Auto-régressive » ou AR), si vous faites lire le même texte à un étudiant trop de fois, il cesse d'apprendre l'histoire pour commencer à mémoriser les mots exacts.
- L'Analogie : Imaginez lire une seule page d'un livre 100 fois. Finalement, vous ne connaissez plus seulement l'histoire ; vous savez exactement où se trouve chaque virgule. Mais si on vous teste sur une nouvelle page que vous n'avez pas vue, vous échouez parce que vous avez seulement mémorisé l'ancienne.
- Le Résultat : L'IA devient très douée pour les données d'entraînement, mais sa performance sur de nouvelles données inédites se dégrade de plus en plus au fur et à mesure qu'elle s'entraîne. Elle fait du « surapprentissage » (overfitting).
La Solution : L'Augmentation de Données (La Méthode du « Twist »)
Les auteurs de ce papier se sont demandé : Comment faire pour que l'étudiant lise le même livre 100 fois sans qu'il ne se contente de mémoriser ?
Leur réponse est l'Augmentation de Données. Au lieu de donner à l'étudiant exactement le même texte à chaque fois, ils « tordent » ou « brouillent » légèrement le texte avant que l'étudiant ne le lise. Cela force l'étudiant à réellement comprendre le sens et le contexte, plutôt que de simplement mémoriser la séquence de mots.
Ils ont essayé trois manières principales de tordre le texte :
1. Le Jeu de l'« Aveugle » et du « Mot Incorrect » (Bruit au niveau des Tokens)
- Le Masquage (L'Aveugle) : Ils cachent certains mots avec une boîte noire (un jeton ``). L'étudiant doit deviner le mot manquant en se basant sur le reste de la phrase.
- Le Remplacement Aléatoire (Le Mot Incorrect) : Au lieu d'une boîte noire, ils remplacent un mot par un autre mot qui est grammaticalement correct mais factuellement faux.
- Exemple : Changer « Le chat est assis sur le tapis » par « Le chat est assis sur le chapeau ».
- La Découverte : Étonnamment, le jeu du « Mot Incorrect » a mieux fonctionné que celui de l'« Aveugle ». Pourquoi ? Parce que deviner un mot manquant est facile si l'on voit un vide. Mais repérer que « chapeau » est le mauvais mot alors que la phrase semble correcte est un exercice mental beaucoup plus difficile. Cela force l'étudiant à prêter une attention plus soutenue.
2. Le Jeu du « Retour en Arrière » et du « Texte à Compléter » (Permutations de Séquences)
- De Droite à Gauche (Retour en Arrière) : Ils font lire la phrase à l'envers, du dernier mot vers le premier.
- Remplir le Milieu : Ils prennent une phrase, en retirent la partie centrale, et demandent à l'étudiant de prédire le milieu en se basant sur le début et la fin.
- La Découverte : Lire à l'envers a très bien fonctionné comme régularisateur (cela a stoppé la mémorisation). Cependant, le jeu du « Remplir le Milieu » a en fait aggravé les choses pour le texte général. Les auteurs suggèrent que c'est parce que le format « Remplir le milieu » est tellement différent de notre façon habituelle de lire (de gauche à droite) qu'il a confondu l'étudiant plutôt que de l'aider.
3. Le Jeu de la « Boule de Cristal » (Prédiction de l'Offset de Cible)
- Au lieu de demander « Quel est le mot suivant ? », ils demandent « Quel est le mot trois étapes plus loin ? »
- La Découverte : Cela fonctionne bien, mais seulement s'ils le font avec soin. Si on demande les mots trop loin dans le futur trop souvent, l'étudiant est confus. Si on demande principalement le mot suivant, mais qu'on demande occasionnellement un mot plus loin, cela agit comme un programme d'entraînement parfait.
La Stratégie Gagnante : La « Tempête Parfaite »
Les auteurs n'ont pas seulement choisi un jeu ; ils les ont combinés. Cependant, ils ont découvert que certains jeux s'entrechoquent.
- Le Conflit : Si vous cachez des mots (Masquage) et que vous demandez des mots plus loin dans le futur, l'étudiant est submergé. Le contexte est trop brisé pour faire une bonne supposition.
- L'Harmonie : Si vous utilisez le Remplacement Aléatoire (changer les mots) + la Lecture à l'Envers + une Observation Occasionnelle vers l'Avant, l'étudiant reste vif.
Le Résultat :
En utilisant cette combinaison spécifique de « twists », l'IA a pu s'entraîner pendant 100 époques (lire les données 100 fois) sans perdre sa capacité de généralisation.
- Sans les astuces : L'IA a atteint son pic à l'époque 16, puis a régressé.
- Avec les astuces : L'IA a continué de s'améliorer, atteignant un taux d'erreur bien plus bas (meilleure performance) que n'importe quelle méthode utilisée seule.
L'Essentiel à Retenir
Ce papier prouve que lorsque nous manquons de nouvelles données, nous n'avons pas besoin d'arrêter l'entraînement. Nous devons simplement changer la manière dont nous présentons les données. En ajoutant de petites « distorsions » intelligentes au texte, nous pouvons permettre à des ordinateurs puissants de continuer à apprendre efficacement beaucoup plus longtemps, empêchant ainsi le simple fait de mémoriser l'ensemble des données d'entraînement.
Point Clé : Remplacer aléatoirement des mots (rendre le texte légèrement « faux ») était l'astuce la plus efficace, et la combiner avec la lecture à l'envers et l'anticipation vers l'avant a créé la meilleure performance globale.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.