← Derniers articles
🤖 machine learning

Training nGPT

Cet article présente une recette d'entraînement pratique pour le Transformer normalisé (nGPT) qui incorpore des techniques telles que le Logit Gradient Preconditioning et GatedAdamW, permettant à des modèles MoE hybrides Mamba-Transformer de 14 milliards de paramètres d'atteindre la même perte de validation que leurs homologues non normalisés en utilisant environ la moitié des jetons d'entraînement.

Auteurs originaux : Ilya Loshchilov, Boris Ginsburg

Publié 2026-08-04
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ilya Loshchilov, Boris Ginsburg

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez le monde de l'intelligence artificielle comme une immense et trépidante bibliothèque où des ordinateurs tentent d'apprendre à écrire des histoires, à résoudre des problèmes mathématiques et à discuter comme des humains. Pour ce faire, ils utilisent des structures mathématiques spéciales appelées réseaux de neurones, qui sont comme de vastes réseaux interconnectés de neurones. À l'intérieur de ces réseaux, l'information circule sous forme de nombres, et le réseau apprend en ajustant la force des connexions entre ces neurones. Pendant longtemps, les scientifiques ont remarqué que ces nombres pouvaient devenir désordonnés — parfois trop grands, parfois réduits à néant, et tout le système pouvait s'embrouiller sur la direction à prendre pour devenir plus intelligent. C'est un peu comme essayer de monter une montagne escarpée et brumeuse en portant un sac à dos dont le poids change constamment ; vous pourriez faire un pas en avant, pour ensuite glisser immédiatement vers le bas. L'objectif de cette recherche est de trouver une meilleure façon de porter ce sac à dos afin que l'ordinateur puisse gravir la montagne de l'apprentissage beaucoup plus rapidement et plus efficacement.

Le document que vous allez lire provient de l'équipe de NVIDIA, dirigée par Ilya Loshchilov et Boris Ginsburg. Ils s'attaquent à un problème spécifique : comment rendre ces modèles d'IA plus performants en forçant tous leurs nombres internes à rester sur une sphère parfaite et invisible. Pensez à une règle qui dirait : « Peu importe la distance parcourue, vous devez toujours rester exactement à un mille du centre de la ville ». Cette règle, appelée « normalisation », empêche les nombres de devenir trop grands ou trop petits, ce qui aide l'ordinateur à rester concentré. Les auteurs se sont appuyés sur une idée précédente appelée « nGPT » (GPT normalisé) et l'ont testée sur un type d'IA très moderne et puissant qui mélange deux technologies différentes : « Mamba-2 » (qui est excellent pour se souvenir de longues séquences) et les « Transformers » (qui sont excellents pour comprendre le contexte). Ils voulaient voir si leurs nouvelles règles d'entraînement pouvaient permettre à ces modèles hybrides d'apprendre plus rapidement que la méthode standard.

La Grande Idée : Une Nouvelle Recette d'Entraînement

Les auteurs n'ont pas seulement peaufiné une chose ; ils ont concocté toute une nouvelle « recette d'entraînement » pour ces modèles d'IA. Imaginez que vous enseigniez à un robot comment marcher. L'ancienne méthode (utilisant une méthode standard appelée AdamW) revient à laisser le robot trébucher, faisant parfois des pas géants et maladroits et d'autres fois des pas minuscules et hésitants, tout en espérant qu'il finisse par trouver le chemin. La nouvelle recette, qu'ils appellent la recette d'entraînement nGPT, revient à placer le robot sur un tapis roulant avec un ensemble de règles très spécifiques pour que ses pas soient parfaits.

Voici comment ils ont procédé, décomposé en concepts simples de la vie quotidienne :

1. Le « Logit Gradient Preconditioning » (Le Bouton de Volume)
Lorsque l'IA essaie de deviner le mot suivant dans une phrase, elle produit une liste de scores appelés « logits ». Dans l'ancien système, le volume de ces scores pouvait devenir étrangement fort ou faible au fil de l'entraînement, confondant le robot sur l'intensité de l'effort à fournir. Les auteurs ont ajouté un « bouton de volume » spécial (un vecteur d'échelle apprenable) qu'ils pouvaient ajuster. Mais voici la partie astucieuse : ils ont réalisé que s'ils se contentaient de tourner le bouton, cela perturberait la mémoire de marche du robot. Ils ont donc inventé un tour appelé Logit Gradient Preconditioning. C'est comme avoir un bouton de volume qui change le son que vous entendez, mais quand le robot essaie d'apprendre d'une erreur, le système ramène automatiquement le volume à la normale pour que le robot ne soit pas confus. Cela maintient le processus d'apprentissage stable, même si l'« intensité » des prédictions change.

2. Le « Logarithmic Learning Rate Decay » (Le Pilote de Course)
Habituellement, lors de l'entraînement d'une IA, on commence avec une vitesse d'apprentissage rapide et on la ralentit progressivement, comme un pilote de course de voitures qui relâche la pédale d'accélérateur. Les auteurs ont découvert que la méthode standard de ralentissement (comme une courbe fluide) n'était pas la meilleure pour leur nouveau système de « sphère ». Au lieu de cela, ils ont utilisé un « Logarithmic Learning Rate Decay ». Imaginez une voiture de course qui bondit au départ, ralentit très rapidement au début pour prendre ses marques, puis poursuit sur une longue traîne constante pour le reste de la course. Ce programme « chargé à l'avant » permet au modèle d'apprendre les bases rapidement, puis de perfectionner ses compétences sur une longue période, ce qui s'est avéré beaucoup plus efficace.

3. « GatedAdamW » (Le Gardien Intelligent)
La méthode standard pour mettre à jour le cerveau du robot est appelée AdamW. Les auteurs l'ont améliorée en GatedAdamW. Considérez la méthode standard comme un gardien qui laisse passer chaque mise à jour, même si celle-ci est minuscule et à peine perceptible. Parfois, ces mises à jour ne sont que du bruit. Le nouveau GatedAdamW possède un « portier intelligent » qui examine chaque mise à jour. Si une mise à jour est trop petite (comme un murmure), le gardien dit doucement : « Pas aujourd'hui », et la bloque. Si la mise à jour est un cri (un changement significatif), la porte s'ouvre largement. Cela empêche le robot de gaspiller de l'énergie dans des ajustements minuscules et inutiles et l'aide à se concentrer sur les changements importants.

4. L' « Angular Step Cap » (La Laisse de Sécurité)
Puisque le robot marche sur une sphère, faire un pas trop grand pourrait le faire partir en tête et le faire basculer du mauvais côté du monde. Les auteurs ont ajouté un « Angular Step Cap », qui est comme une laisse de sécurité. Si le robot tente de faire un pas trop grand, la laisse le ramène doucement vers un angle plus petit et plus sûr. Cela garantit que le robot ne fera jamais de saut sauvage et dangereux, maintenant son voyage fluide et stable.

Les Résultats : Apprendre plus Efficacement

L'équipe a testé cette nouvelle recette sur une série de modèles d'IA, allant de 1 à 14 milliards de paramètres (la « taille du cerveau » du robot). Ils ont comparé leurs nouveaux modèles nGPT aux modèles GPT standards entraînés avec les anciennes méthodes.

Les résultats ont été impressionnants. Les nouveaux modèles nGPT ont systématiquement obtenu des taux d'erreur plus faibles (mesurés par la « validation loss ») que les modèles standards. Plus précisément, le modèle nGPT de 14 milliards de paramètres a atteint le même niveau de compétence que le modèle standard de 14 milliards, mais a nécessité environ la moitié de jetons d'entraînement (la quantité de texte que le modèle lit) pour y parvenir. En d'autres termes, pour atteindre la même destination, le modèle nGPT n'a eu besoin de lire environ la moitié du texte par rapport au modèle standard.

L'article suggère que cette amélioration provient de la combinaison de toutes ces nouvelles règles travaillant ensemble, et non d'un seul tour de magie. Ils ont également testé un réglage spécifique pour leur « portier intelligent » (appelé paramètre de netteté aa) et ont constaté qu'un portier plus souple (a=0.5a=0.5) fonctionnait légèrement mieux qu'un portier strict, mais la plus grande victoire est venue de l'ensemble du nouveau système d'entraînement, et non seulement du portier lui-même.

Ce que cela signifie

Les auteurs précisent avec prudence qu'ils n'ont pas essayé toutes les variations possibles de ces règles (ils n'ont pas fait une « étude d'ablation complète »), il se peut donc qu'il existe de meilleurs réglages qu'ils n'ont pas encore trouvés. Cependant, les résultats qu'ils ont obtenus sont solides : en forçant l'IA à marcher sur une sphère parfaite et en utilisant une façon plus intelligente et plus contrôlée de faire des pas, nous pouvons enseigner à ces modèles massifs pour qu'ils deviennent plus intelligents en utilisant nettement moins de données et de temps. C'est une recette pratique qui suggère que nous pouvons construire une meilleure IA sans avoir besoin de la nourrir avec l'intégralité d'Internet, mais simplement avec une portion beaucoup plus efficace de celui-ci.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →