← Derniers articles
🤖 machine learning

LionMuon: Alternating Spectral and Sign Descent for Efficient Training

L'article présente LionMuon, un optimiseur efficace qui alterne entre les mises à jour de Lion et de Muon tout en partageant un seul tampon de momentum, atteignant des performances supérieures et des coûts de calcul réduits à travers différentes échelles de modèles par rapport aux méthodes existantes telles que AdamW, Lion et Muon.

Auteurs originaux : Arman Bolatov, Artem Riabinin, Nikita Kornilov, Andrey Veprikov, Samuel Horváth, Martin Takáč, Aleksandr Beznosikov

Publié 2026-05-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Arman Bolatov, Artem Riabinin, Nikita Kornilov, Andrey Veprikov, Samuel Horváth, Martin Takáč, Aleksandr Beznosikov

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à un robot géant et complexe (un Modèle de Langage de Grande Taille) comment parler en lui montrant des millions d'exemples. Pour ce faire, vous avez besoin d'un « optimiseur » — un entraîneur qui indique au robot comment ajuster son cerveau (ses paramètres) après chaque exemple qu'il voit.

Le problème est que cet entraîneur doit prendre une décision des milliards de fois. Si l'entraîneur est trop lent ou trop coûteux à exécuter, l'ensemble du projet devient trop onéreux. Si l'entraîneur est trop bon marché mais prend de mauvaises décisions, le robot apprend lentement ou reste bloqué.

Ce papier présente un nouvel entraîneur appelé LionMuon. C'est un hybride ingénieux qui tente de tirer le meilleur de deux styles d'entraînement très différents.

Les Deux Entraîneurs Existants

Pour comprendre LionMuon, nous devons d'abord rencontrer les deux entraîneurs qu'il combine :

  1. L'entraîneur « Signe » (Lion/Signum) :

    • Fonctionnement : Cet entraîneur est incroyablement rapide et peu coûteux. Il ne regarde pas la taille exacte de l'erreur ; il regarde simplement la direction (positive ou négative). C'est comme un GPS qui ne vous dit que « Tournez à gauche » ou « Tournez à droite » sans calculer la distance exacte.
    • Avantages : Il est super efficace. Vous pouvez l'exécuter des milliards de fois sans ruiner votre budget.
    • Inconvénients : Parce qu'il ignore la « magnitude » (l'ampleur du virage nécessaire), il suit parfois un chemin faible ou légèrement hors route. Il est rapide, mais pas toujours le plus précis.
  2. L'entraîneur « Spectral » (Muon) :

    • Fonctionnement : Cet entraîneur est un mathématicien génial. Il examine la carte complète de l'erreur d'un seul coup et calcule la direction parfaite et la plus forte possible pour la corriger. Il utilise des mathématiques matricielles complexes (comme un GPS haut de gamme calculant l'itinéraire absolument le plus court en tenant compte du trafic, du terrain et des limites de vitesse).
    • Avantages : Il trouve le meilleur chemin très rapidement. Le robot apprend plus vite à chaque étape.
    • Inconvénients : Il est coûteux en calculs. Effectuer ces mathématiques complexes prend beaucoup de temps et d'énergie. Si vous utilisez cet entraîneur pour chaque étape unique, la facture de formation explose.

La Nouvelle Solution : LionMuon

Les auteurs ont posé une question simple : « Peut-on avoir la vitesse de l'entraîneur Signe mais la précision de l'entraîneur Spectral ? »

Leur réponse est LionMuon.

Au lieu de choisir l'un ou l'autre, LionMuon agit comme un commutateur intelligent. Il alterne entre les deux entraîneurs selon un calendrier fixe (disons, toutes les 2 étapes) :

  • Étape 1 : Il utilise l'entraîneur Muon pour trouver cette direction parfaite et forte.
  • Étape 2 : Il utilise l'entraîneur Lion pour effectuer un ajustement rapide et peu coûteux basé sur l'élan de la première étape.
  • Étape 3 : Il revient à Muon, et ainsi de suite.

Le Secret :
Habituellement, si vous changez d'entraîneur, vous devez réinitialiser leur mémoire ou utiliser deux banques de mémoire différentes. LionMuon est ingénieux car il partage une seule banque de mémoire entre les deux entraîneurs. Cela signifie qu'il n'a pas besoin de mémoire informatique supplémentaire (RAM) pour fonctionner. Il utilise la même quantité de mémoire que l'entraîneur Lion peu coûteux, ce qui représente la moitié de la mémoire de l'entraîneur standard de l'industrie (AdamW).

Pourquoi est-ce important ?

Le papier affirme qu'en alternant ces étapes, LionMuon obtient le meilleur des deux mondes :

  1. C'est moins cher : Parce qu'il ne fait les mathématiques « parfaites » et coûteuses (Muon) qu'une fois tous les quelques pas, le coût total de formation diminue considérablement (environ 5 % de puissance de calcul en moins pour le même résultat).
  2. C'est plus intelligent : Même s'il saute parfois les mathématiques coûteuses, les étapes « bon marché » sont guidées par la direction forte trouvée à l'étape précédente. Le résultat est que le robot apprend plus vite et atteint un taux d'erreur plus faible que l'utilisation d'un seul entraîneur.
  3. C'est évolutif : Les chercheurs ont testé cela sur des modèles de différentes tailles (de 124 millions à 720 millions de paramètres). Dans tous les cas, LionMuon a été le gagnant, obtenant les meilleurs résultats avec le moins de puissance de calcul.

La Théorie (Le « Pourquoi » cela fonctionne)

Les auteurs n'ont pas seulement deviné ; ils ont fait les mathématiques. Ils ont prouvé que dans certaines conditions (spécifiquement lorsque les données sont bruyantes, ce qui est courant en IA), il existe un « point idéal » pour la fréquence des changements.

Ils ont constaté que si vous changez trop souvent (en faisant Muon à chaque étape), c'est trop coûteux. Si vous changez trop rarement, vous perdez l'amélioration de la précision. Leurs mathématiques montrent que pour la plupart des modèles d'IA modernes, changer toutes les 2 étapes (un Muon, un Lion) est le parfait équilibre.

Analogie de Résumé

Imaginez que vous grimpez une montagne dans le brouillard.

  • Lion est un coureur rapide qui devine simplement la direction en fonction du vent. Il avance vite mais peut zigzaguer.
  • Muon est un pilote d'hélicoptère lent et coûteux qui utilise une caméra thermique pour trouver le chemin absolument le plus raide et le plus sûr.
  • LionMuon est une équipe où le pilote d'hélicoptère vole une fois pour trouver le meilleur chemin, puis le coureur rapide court le long de ce chemin pendant un moment avant que l'hélicoptère ne revienne vérifier.

Le résultat ? Vous atteignez le sommet plus vite et avec moins de carburant que si vous vous étiez confié à l'hélicoptère pour tout le trajet ou si vous aviez simplement deviné tout le long.

L'essentiel : LionMuon est une nouvelle méthode efficace pour entraîner l'IA qui économise de l'argent et du temps tout en rendant l'IA plus intelligente, sans nécessiter de mémoire informatique supplémentaire.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →