M+Adam: Low-Precision Training via Additive-Multiplicative Optimization
L'article propose M+Adam, un nouvel optimiseur qui combine des mises à jour additives et multiplicatives pour surmonter les modes de défaillance complémentaires de l'entraînement en basse précision, permettant ainsi un entraînement stable et précis de modèles de type LLaMA en utilisant uniquement des poids maîtres en BF16, FP8 et FP4.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à un robot géant et hyper-intelligent (un grand modèle de langage) à écrire comme un humain. Pour ce faire, vous devez ajuster des millions de petits curseurs sur le cerveau du robot. Habituellement, ces curseurs sont ajustés avec une précision extrême, comme si l'on utilisait un microscope pour tourner une vis. Mais les microscopes sont lourds, lents et coûteux.
La question posée par l'article est la suivante : Et si nous utilisions une clé à molette légère et bon marché à la place ?
C'est le monde de l'entraînement à faible précision. Au lieu d'utiliser des « poids maîtres » de haute précision (la mémoire du robot concernant les curseurs), les chercheurs tentent de les stocker dans un format plus petit et plus grossier comme BF16, FP8 ou même FP4. C'est comme essayer de mesurer la hauteur d'une montagne avec une règle qui n'a des graduations que tous les 3 mètres.
Le Problème : Le Piège de l'« Arrondi »
Les auteurs ont découvert que lorsque vous utilisez ces règles grossières, les méthodes d'entraînement standard (appelées Adam) se heurtent à un mur. En voici la raison :
- Le Problème de la Grande Montagne : Lorsqu'un curseur est réglé sur un nombre énorme, les graduations de la « règle » sont très espacées. Si le robot doit déplacer le curseur d'un montant infime, la règle ne peut pas le voir. Ce minuscule mouvement est arrondi à zéro, et le robot pense : « Je n'ai rien bougé ! ». Le robot reste bloqué, incapable de gravir la montagne.
- Le Problème de la Vallée du Zéro : D'autres méthodes ont tenté de corriger cela en utilisant des mises à jour multiplicatives (comme Madam). Au lieu d'ajouter un petit nombre, elles multiplient le curseur par un facteur. Cela fonctionne très bien pour les grandes montagnes car la taille du pas augmente avec le curseur. Cependant, si un curseur est bloqué exactement à zéro, vous ne pouvez pas le multiplier pour le faire bouger. C'est comme essayer de pousser une voiture qui n'a pas de roues ; multiplier zéro par n'importe quoi donne toujours zéro. De plus, si le curseur doit passer de positif à négatif (en traversant le zéro), ces méthodes s'embrouillent et ne peuvent pas effectuer le changement.
La Solution : M+Adam (Le Kit à Deux Outils)
L'article présente M+Adam, un nouvel optimiseur qui agit comme un mécanicien ingénieux transportant deux outils différents à la fois. Il combine le meilleur des deux mondes pour corriger les « modes de défaillance complémentaires ».
- Outil 1 : La Clé Additive (Style Adam). Cet outil est excellent pour les ajustements petits et précis. Il peut pousser un curseur depuis zéro, changer le signe de positif à négatif, et gérer les mouvements minuscules près du fond de la vallée.
- Outil 2 : Le Levier Multiplicatif (Style Madam). Cet outil est excellent pour les gros travaux de force. Lorsque le curseur est énorme et que la clé additive se fait « arrondir » à néant, le levier multiplicatif prend le relais. Il change l'échelle du curseur vers le haut ou vers le bas, garantissant que le robot continue de progresser, même sur les plus hautes montagnes.
M+Adam utilise les deux outils simultanément. Si l'outil additif est bloqué à cause de l'arrondi, l'outil multiplicatif maintient le mouvement du robot. Si l'outil multiplicatif ne peut pas échapper au zéro, l'outil additif le pousse dehors.
La Preuve : Est-ce que cela a fonctionné ?
Les auteurs ne se sont pas contentés de deviner ; ils ont testé cela à une échelle massive.
- Le Test : Ils ont entraîné des modèles de langage de type « LLaMA » allant de 60 millions à 1 milliard de paramètres.
- Le Budget : Ils ont utilisé des budgets d'entraînement allant de 1x à 8x le budget « Chinchilla » standard (une mesure standard de la quantité de données qu'un modèle voit).
- La Précision : Ils ont testé avec des poids maîtres en BF16, FP8 et NVFP4.
Les Résultats :
Dans chaque test, M+Adam a systématiquement battu l'optimiseur Adam standard.
- Dans le réglage de basse précision le plus extrême (NVFP4), M+Adam a réduit la « perplexité » (une mesure de la confusion du modèle) de 16,6 % pour le modèle de 350M par rapport à Adam.
- Même avec 1 milliard de paramètres, M+Adam a montré des améliorations claires par rapport à Adam dans tous les régimes de précision.
L'article prouve mathématiquement que cette approche combinée garantit que la perte d'entraînement diminuera (une « descente monotone »), ce qui signifie que le robot apprend toujours et ne reste jamais bloqué dans une boucle.
Ce que ce n'est PAS
Il est important de savoir ce que cet article ne prétend pas :
- Il ne dit pas que M+Adam est une solution miracle qui élimine tous les coûts de mémoire. En fait, l'article note que M+Adam ajoute un peu de mémoire supplémentaire (un « état » supplémentaire pour l'outil multiplicatif), bien qu'ils montrent que cela peut être compressé plus tard.
- Il ne prétend pas que les méthodes standard comme l'Arrondi Stochastique (une technique pour corriger les erreurs d'arrondi) sont inutiles. Ils ont testé Adam avec l'Arrondi Stochastique, et M+Adam est resté plus performant.
- Il ne suggère pas que nous devions arrêter d'utiliser entièrement le matériel de haute précision. Au contraire, il montre que si nous devons utiliser un stockage de faible précision, M+Adam est la bonne façon de le faire.
L'Essentiel
L'article suggère que lorsque vous êtes contraint d'utiliser des « règles grossières » (poids de faible précision) pour entraîner de gigantesques modèles d'IA, vous ne pouvez pas vous appuyer sur un seul type de mouvement. Vous avez besoin d'une approche hybride. M+Adam est cet hybride, utilisant à la fois des étapes additives et multiplicatives pour garantir que le robot ne reste jamais bloqué, qu'il grimpe une montagne géante ou qu'il s'échappe d'une vallée de zéro. C'est une étape fondamentale vers l'entraînement de modèles d'IA massifs de manière efficace, sans avoir besoin de la mémoire de haute précision lourde et coûteuse sur laquelle nous comptons habituellement.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.