← Derniers articles
🤖 machine learning

Gefen: Optimized Stochastic Optimizer

Le document présente Gefen, un optimiseur économe en mémoire qui réduit l'empreinte mémoire d'AdamW d'environ 8 fois grâce au partage automatique du second moment et à la quantification apprise du premier moment, permettant des tailles de lots plus grandes et un débit amélioré tout en maintenant des performances équivalentes.

Auteurs originaux : Nadav Benedek, Tomer Koren, Ohad Fried

Publié 2026-06-15
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nadav Benedek, Tomer Koren, Ohad Fried

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous entraînez un robot géant (un modèle de deep learning) à acquérir une nouvelle compétence. Pour ce faire, le robot a besoin d'un « entraîneur » (un optimiseur) qui lui indique comment ajuster ses réglages internes après chaque séance d'entraînement. L'entraîneur le plus populaire actuellement s'appelle AdamW.

AdamW est un excellent entraîneur, mais il porte un sac à dos très lourd. Pour chaque réglage du robot, AdamW transporte deux carnets supplémentaires (appelés « états de moments de premier et second ordre ») pour se souvenir des erreurs passées et de la vitesse à laquelle les choses changent. Si votre robot possède 1 milliard de réglages, le sac à dos d'AdamW ajoute le poids de 2 milliards de réglages supplémentaires. Cela rend le sac si lourd que vous ne pouvez pas faire tenir un grand robot sur un ordinateur de formation standard, ou alors vous devez faire pratiquer le robot par toutes petites étapes très lentes.

Le papier présente un nouvel entraîneur nommé Gefen. Gefen est un optimiseur « économe en mémoire » qui réduit ce sac à dos lourd de 8 fois tout en gardant la vitesse d'apprentissage et la qualité du robot exactement les mêmes qu'avec AdamW.

Voici comment Gefen fonctionne, en utilisant des analogies simples :

1. La stratégie du « Group Hug » (Partage de notes)

Le Problème : AdamW écrit une note séparée pour chaque nombre dans le cerveau du robot.
La Solution de Gefen : Gefen réalise que beaucoup de ces nombres sont en fait des « meilleurs amis ». Ils réagissent au monde de manières très similaires. Au lieu d'écrire une note unique pour chaque ami, Gefen les regroupe en équipes (blocs) et donne à toute l'équipe un seul carnet partagé.

  • Comment sait-il comment les regrouper ? Habituellement, il faudrait une carte super complexe (appelée matrice Hessienne) pour voir qui est ami avec qui, mais cette carte est trop grande à dessiner pour des robots géants.
  • L'astuce de Gefen : Gefen observe la toute première séance d'entraînement du robot. Il voit quels nombres bougent ensemble selon un schéma similaire. Il part du principe que : « Si vous avez bougé ensemble au début, vous bougerez probablement ensemble plus tard. » Il regroupe ensuite ces nombres automatiquement. Aucun humain n'a besoin de lui dire quels groupes former ; il le comprend par lui-même.

2. La stratégie de l'« Artiste de l'ombre » (Quantification)

Le Problème : Même avec des carnets partagés, les nombres à l'intérieur sont encore écrits avec une haute précision (comme 10 décimales), ce qui prend de la place.
La Solution de Gefen : Gefen utilise une approche d'« artiste de l'ombre ». Au lieu d'écrire le nombre exact (par exemple 0,123456789), il l'arrondit à la « valeur standard » la plus proche issue d'une liste préétablie (un codebook).

  • La Liste Intelligente : La plupart des optimiseurs utilisent une liste de valeurs générique et fixe (comme une règle avec des graduations fixes). Gefen, cependant, observe le robot spécifique qu'il entraîne et apprend la liste de graduations parfaite juste pour ce robot. Il utilise une méthode mathématique intelligente (Programmation Dynamique) pour créer une règle sur mesure qui s'adapte parfaitement aux données, minimisant ainsi les erreurs.
  • Stabilité : Une fois qu'il a appris cette liste au tout début, il continue d'utiliser la même liste pendant tout le processus. Il n'a pas besoin de redessiner la règle chaque jour, ce qui permet de gagner du temps et de maintenir la stabilité.

Les Résultats : Un sac à dos plus léger, une performance identique

Les auteurs ont testé Gefen sur divers modèles, allant de petits classificateurs d'images à de grands modèles de langage (comme Llama 3).

  • Mémoire : Gefen a réduit la mémoire nécessaire pour l'optimiseur d'environ 8 fois par rapport à AdamW. Pour un modèle de 13 milliards de paramètres, cela permet de réduire la mémoire de 97 Go à seulement 1,5 Go.
  • Vitesse : Parce que le sac à dos est plus léger, le robot peut porter un plus gros « micro-batch » (groupe de pratique) à la fois. Dans les tests utilisant plusieurs ordinateurs (FSDP et DDP), cela a permis à l'entraînement de fonctionner 56 % plus vite car les ordinateurs n'attendaient pas que la mémoire se libère.
  • Qualité : Malgré la forte compression et le partage, le robot a appris tout aussi bien qu'avec le lourd sac à dos d'AdamW. La performance finale (précision ou perte) est identique.

Pourquoi cela compte

Voyez cela comme préparer un voyage. AdamW, c'est comme préparer une valise où chaque chaussette possède sa propre boîte individuelle. Gefen, c'est réaliser que vous pouvez rouler toutes vos chaussettes en un seul paquet serré et les mettre dans une petite pochette. Vous gagnez énormément d'espace, mais vous avez toujours toutes vos chaussettes, et vous pouvez atteindre votre destination tout aussi vite.

Le papier affirme que Gefen est un « remplacement direct » (drop-in replacement), ce qui signifie que vous pouvez l'intégrer dans votre code d'entraînement existant sans changer aucun paramètre, et qu'il économisera immédiatement de la mémoire et accélérera potentiellement votre entraînement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →