← Derniers articles
💻 computer science

Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws

Cet article démontre que le choix de l'optimiseur modifie fondamentalement les lois d'échelle spectrales des modèles Transformer, révélant que des optimiseurs comme Muon peuvent atteindre une utilisation nettement supérieure de la capacité spectrale dans des régimes difficiles à apprendre par rapport à AdamW, établissant ainsi l'optimisation comme un axe critique et indépendant de mise à l'échelle des représentations qui rivalise avec la conception architecturale.

Auteurs originaux : Nandan Kumar Jha, Brandon Reagen

Publié 2026-05-22
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nandan Kumar Jha, Brandon Reagen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous construisez une bibliothèque massive (un Modèle de Langage à Grande Échelle) pour stocker et récupérer les connaissances humaines. Vous avez un plan pour les étagères de la bibliothèque (l'Architecture), et vous avez un bibliothécaire qui organise les livres (l'Optimiseur).

Pendant des années, les chercheurs ont cru que si vous rendiez simplement la bibliothèque plus grande (en ajoutant plus d'étagères/de paramètres) et que vous lui donniez plus de livres (des données), le travail du bibliothécaire s'améliorerait automatiquement de manière prévisible. Ils supposaient que le type de bibliothécaire n'avait pas grande importance, tant qu'il faisait le travail.

Ce papier soutient que qui est le bibliothécaire compte autant que la taille de la bibliothèque. En fait, le bibliothécaire détermine comment les nouvelles étagères sont réellement utilisées.

Voici la répartition des découvertes du papier en utilisant des analogies simples :

1. Les Deux Types de « Capacité de Bibliothèque »

Les chercheurs ont examiné comment le modèle utilise son « espace cérébral » interne (spécifiquement les réseaux feed-forward, ou FFN). Ils ont mesuré cela de deux manières :

  • Rang Doux (La « Diffusion ») : Imaginez une bibliothèque où les livres sont répartis uniformément sur chaque étagère. L'espace est utilisé largement, mais peut-être pas en profondeur. C'est une capacité « diffuse ».
  • Rang Dur (La « Concentration ») : Imaginez une bibliothèque où les livres les plus importants, rares et complexes sont serrés sur des étagères spécifiques et de haute qualité, tandis que d'autres étagères sont vides. C'est une capacité « dominante ». Il s'agit d'avoir quelques moyens très puissants pour représenter des idées complexes.

2. Le Problème avec le « Bibliothécaire Standard » (AdamW)

Le bibliothécaire le plus courant, AdamW, est bon pour répartir les livres. Lorsqu'on lui donne une bibliothèque plus grande (plus de largeur), il remplit les étagères largement (le Rang Doux augmente).

Cependant, lorsqu'il s'agit des livres rares et difficiles (les tokens « Queue » — comme des faits obscurs ou des concepts complexes), AdamW peine à les organiser en étagères fortes et concentrées.

  • Le Résultat : Même si vous doublez la taille de la bibliothèque, AdamW ne double pas sa capacité à gérer les choses difficiles. Il étale simplement la confusion sur plus d'espace. Le papier appelle cela une « faible mise à l'échelle du rang dur ».

3. Le « Super Bibliothécaire » (Muon)

Les chercheurs ont testé un bibliothécaire différent appelé Muon.

  • Le Résultat : Lorsque Muon obtient une bibliothèque plus grande, il ne se contente pas d'étaler les choses. Il construit activement des étagères fortes et concentrées pour les livres rares et difficiles.
  • La Magie : Muon transforme l'espace ajouté en puissance utilisable beaucoup plus rapidement. Si la capacité d'AdamW à gérer les concepts difficiles croît lentement (comme une marche lente), celle de Muon croît en ligne droite (comme un sprint). Dans les termes du papier, Muon atteint une mise à l'échelle linéaire là où AdamW est coincé dans un schéma de croissance « faible ».

4. Le « Piège de la Perplexité » (Pourquoi nous avons manqué cela auparavant)

Vous pourriez demander : « Si Muon est tellement meilleur pour organiser, pourquoi ne l'avons-nous pas remarqué plus tôt ? N'obtient-il pas simplement des scores d'erreur plus bas ? »

Le papier révèle un piège : Vous pouvez avoir le même score final avec des structures internes totalement différentes.

  • Si vous entraînez le « Bibliothécaire Standard » (AdamW) pendant très longtemps, il peut éventuellement égaler le score de test final (perplexité) du « Super Bibliothécaire » (Muon).
  • Cependant : À l'intérieur du cerveau, ils sont complètement différents. Le Bibliothécaire Standard a une structure désordonnée et diffuse. Le Super Bibliothécaire a une structure nette et organisée.
  • La Conclusion : Le fait que deux modèles obtiennent le même score de test ne signifie pas qu'ils « pensent » de la même manière. Le Super Bibliothécaire construit en réalité une meilleure carte interne du monde, même si la note finale semble similaire.

5. Le Problème du « Livre Rare »

Le langage suit une distribution de la loi de Zipf : quelques mots sont utilisés constamment (comme « le » ou « est »), mais la plupart des mots sont rares.

  • AdamW va bien avec les mots courants mais se perd avec les rares.
  • Muon brille spécifiquement avec les connaissances rares et de la longue traîne. Il met à l'échelle sa capacité à gérer ces tokens rares presque parfaitement à mesure que le modèle grossit.

6. Le Bibliothécaire vs Le Plan (Architecture)

Les chercheurs ont demandé : « Le bibliothécaire est-il plus important que la conception de la bibliothèque ? »
Ils ont testé la modification de la conception de la bibliothèque (comme changer le nombre de têtes d'attention ou supprimer les signaux de position).

  • La Découverte : Changer le Bibliothécaire (l'optimiseur) a eu un impact plus grand sur la façon dont le modèle apprenait que changer le Plan (l'architecture).
  • En fait, un « Super Bibliothécaire » pouvait faire fonctionner une conception de bibliothèque standard mieux qu'un « Bibliothécaire Standard » ne pouvait faire fonctionner une nouvelle conception fancy. Le bibliothécaire et le plan sont une équipe ; vous ne pouvez pas simplement choisir un plan et supposer que n'importe quel bibliothécaire fera l'affaire.

Résumé

Le papier conclut que l'optimisation est un citoyen de première classe dans la conception de l'IA.

  • Ancienne Vision : « Rends le modèle plus grand, et il deviendra plus intelligent. »
  • Nouvelle Vision : « Rends le modèle plus grand, mais choisis le bon optimiseur pour s'assurer que cette taille supplémentaire se transforme réellement en intelligence utile et concentrée, en particulier pour les choses difficiles et rares. »

Si vous voulez un modèle qui comprend vraiment la « longue traîne » des connaissances humaines, vous ne pouvez pas vous fier uniquement aux outils standards. Vous avez besoin d'un optimiseur qui sait construire des étagères fortes et concentrées pour les livres difficiles, et pas seulement remplir l'espace vide.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →