← Derniers articles
🤖 machine learning

How Much Orthogonalization Does Muon Need?

Cet article démontre qu'un programme d'orthogonalisation de Newton-Schulz cubique en cinq étapes à faible coût atteint une qualité d'entraînement comparable aux variantes plus coûteuses de Muon, révélant qu'une haute précision de la décomposition polaire n'est pas strictement nécessaire pour un entraînement efficace des réseaux de neurones.

Auteurs originaux : Hua Huang

Publié 2026-06-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hua Huang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot massif et complexe (un réseau de neurones) une nouvelle tâche. Pour l'aider à apprendre, vous lui donnez une mise à jour de « momentum » — une impulsion dans la direction qu'il pense être la bonne en se basant sur son expérience passée. Cependant, parfois, cette impulsion devient désordonnée ou « biaisée », comme une voiture qui essaie de tourner sur une route glissante où les roues patinent dans différentes directions.

Le Muon optimizer est un outil conçu pour corriger ces impulsions désordonnées. Il prend cette mise à jour biaisée et la « redresse » pour que le robot se déplace efficacement. Mathématiquement, ce processus de redressement est appelé orthogonalisation. Imaginez cela comme prendre une feuille de papier froissée et la repasser pour qu'elle soit parfaitement plate avec des lignes parfaitement droites et perpendiculaires.

Le Problème : À quel point le repassage doit-il être « parfait » ?

Le document pose une question très pratique : Avons-nous vraiment besoin de repasser ces mises à jour de manière parfaite ?

Dans le monde des mathématiques, il existe des façons « parfaites » de repasser une matrice (comme utiliser un fer à repasser haut de gamme, coûteux et long à utiliser). La méthode Muon standard utilise un processus complexe en 5 étapes (appelé méthode « quintique ») pour rendre la mise à jour très proche de la perfection. C'est comme utiliser un fer à vapeur professionnel : il faut 15 passages pour que le papier soit parfaitement plat.

Les auteurs se sont demandé : Avons-nous réellement besoin qu'il soit aussi parfait ? Ou pouvons-nous faire en sorte que le robot apprenne tout aussi bien avec une méthode légèrement plus rapide et moins coûteuse ?

La Solution : Le raccourci « Cubique »

Les auteurs ont développé une nouvelle méthode plus simple appelée Cubic5.

  • L'ancienne méthode (Muon-Jordan) : Utilise une formule complexe en 5 étapes qui nécessite 15 calculs lourds (multiplications de matrices) pour redresser la mise à jour.
  • La nouvelle méthode (Cubic5) : Utilise une formule plus simple en 5 étapes qui ne nécessite que 10 calculs lourds.

Voyez cela de cette façon :

  • L'ancienne méthode est comme embaucher une équipe de 15 personnes pour plier soigneusement une carte.
  • La nouvelle méthode est comme embaucher 10 personnes qui plient la carte tout aussi bien, mais en moins de temps.

Ils ont dérivé cette nouvelle méthode en réalisant que pour l'entraînement de l'IA, l'« impulsion » n'a pas besoin d'être mathématiquement parfaite au dernier chiffre après la virgule. Elle doit simplement être « assez bonne » pour que le robot continue d'apprendre efficacement. Ils ont fixé une « cible relaxée » : tant que la mise à jour est approximativement droite, le robot apprendra très bien.

Ce qu'ils ont découvert : « Assez bon » est en réalité excellent

Les chercheurs ont testé leur nouvelle méthode « Cubic5 » par rapport aux anciennes méthodes « parfaites » et même par rapport à une méthode théoriquement « parfaite » (utilisant un outil mathématique super précis appelé SVD) sur différents modèles d'IA, allant de petits modèles (comme GPT-2) à des modèles très larges (avec des milliards de paramètres).

Voici ce qu'ils ont découvert :

  1. La qualité de l'entraînement est la même : Qu'ils aient utilisé la méthode coûteuse en 15 étapes, la nouvelle méthode en 10 étapes, ou même l'outil mathématique super précis (SVD), les modèles d'IA ont fini par apprendre presque exactement la même chose. Le « score » final (perte de validation) était presque identique.
  2. Plus d'étapes ne signifient pas toujours mieux : Étonnamment, ajouter des étapes à la méthode « parfaite » ne faisait pas toujours mieux apprendre l'IA. Parfois, la méthode plus simple fonctionnait tout aussi bien.
  3. Le « repassage » n'a pas besoin d'être parfait : La découverte la plus importante est que l'IA ne se soucie pas de savoir si la mise à jour est mathématiquement « parfaite ». Elle se soucie de savoir si la mise à jour est utile. La nouvelle méthode moins coûteuse remodèle la mise à jour juste assez pour que l'IA apprenne, sans perdre de temps en une précision inutile.

L'essentiel

Le document conclut que le Muon n'a pas besoin d'être parfaitement orthogonalisé pour bien fonctionner.

La nouvelle méthode Cubic5 est une alternative à « faible coût ». Elle économise environ un tiers du travail de calcul (le gros du travail) nécessaire pour redresser les mises à jour, tout en produisant des résultats pratiquement indiscernables des méthodes plus coûteuses.

En termes de la vie quotidienne : Si vous cuisinez un gâteau, l'ancienne méthode consistait à mesurer la farine avec une balance laser au microgramme près. La nouvelle méthode revient à utiliser une tasse à mesurer standard. Le document prouve que pour cette recette spécifique (l'entraînement de l'IA), la tasse standard fonctionne tout aussi bien que la balance laser, mais elle est beaucoup plus rapide et facile à utiliser. Cela permet à l'IA de s'entraîner plus rapidement sans sacrifier la qualité du résultat final.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →