← Derniers articles
💬 NLP

Is Finer Better? The Limits of Microscaling Formats in Large Language Models

Cet article révèle que la diminution de la taille des blocs dans la quantification par micro-mise à l'échelle peut paradoxalement dégrader la performance du modèle en raison de l'interaction entre des distributions de tenseurs étroites et une plage dynamique d'échelle limitée, conduisant les auteurs à proposer un nouveau format FP8 non signé E5M3 pour les échelles qui maintient la précision tout en éliminant le besoin d'opérations de mise à l'échelle globales.

Auteurs originaux : Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

Publié 2026-01-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vue d'ensemble : Réduire la taille du modèle

Imaginez qu'un grand modèle de langage (LLM) est comme une immense bibliothèque de connaissances. Pour faire tenir cette bibliothèque dans un petit sac à dos (afin qu'elle s'exécute rapidement sur des téléphones ou économise de l'énergie), les scientifiques ont essayé de réduire la taille des livres. Ils font cela en « quantifiant » les données, ce qui signifie arrondir les nombres pour utiliser moins de bits (comme écrire « 3,14 » simplement sous la forme « 3 »).

Récemment, une nouvelle technique appelée Microscaling est devenue populaire. Au lieu d'utiliser une seule règle pour mesurer toute la bibliothèque, ils ont commencé à utiliser de minuscules règles individuelles pour de petits groupes de livres. La logique était la suivante : « Plus le groupe est petit, plus nous pouvons mesurer les livres à l'intérieur avec précision. »

La surprise : Plus petit n'est pas toujours mieux

Les chercheurs de cet article ont découvert un bug étrange. Ils s'attendaient à ce que rendre les groupes (ou « blocs ») plus petits rende toujours le modèle plus intelligent. Mais ils ont constaté le contraire avec certains modèles.

L'analogie : La règle avec des graduations manquantes
Imaginez que vous mesuriez un tout petit caillou.

  • L'ancienne méthode : Vous utilisez une règle géante avec des marques tous les pouces. Vous ne pouvez pas bien mesurer le caillou, alors vous devinez.
  • La nouvelle méthode (Microscaling) : Vous passez à une minuscule règle qui s'adapte parfaitement au caillou. Cela devrait être mieux, n'est-ce pas ?
  • Le problème : La petite règle a une caractéristique défaillante. Son « point zéro » et ses plus petites graduations sont trop éloignés. Si le caillou est trop petit, la règle ne peut pas le voir du tout. Elle indique simplement : « C'est zéro. »

L'article a montré que lorsque les « blocs » de données deviennent trop petits, la « règle » (appelée échelle ou scale) utilisée pour les mesurer perd en précision. Elle ne peut plus représenter des nombres très petits. Ainsi, même si vous mesurez un groupe plus petit, vous perdez en réalité plus d'informations car la règle est trop maladroite pour des choses aussi infimes.

Cela a provoqué un phénomène que les auteurs appellent la « Perplexity Inversion » (inversion de la perplexité). Habituellement, à mesure que l'on réduit la taille des blocs, le modèle devient meilleur. Mais avec ce bug, une fois que les blocs deviennent trop petits, le modèle devient soudainement moins bon.

Pourquoi cela arrive-t-il ?

Les chercheurs ont creusé les mathématiques et ont trouvé le coupable : L'échelle (The Scale).

Dans ce système, chaque groupe de nombres possède un nombre d'« échelle » qui indique à l'ordinateur la taille des nombres dans ce groupe.

  1. Groupes larges : Si un groupe contient de grands nombres et de petits nombres, l'échelle est grande. La règle fonctionne bien.
  2. Groups étroits : Si un groupe ne contient que des nombres minuscules (comme 0,0001), l'échelle doit être minuscule pour les mesurer avec précision.
  3. Le bug : Le matériel actuel utilise un type de règle spécifique (appelée FP8 E4M3) qui a une plage limitée. Elle ne peut pas gérer des échelles qui sont trop petites. Lorsque la taille du bloc diminue, les nombres à l'intérieur deviennent si petits que la « plus petite valeur réglable » de la règle est encore trop grande. L'ordinateur arrondit tout à zéro, et le modèle oublie l'information.

La solution : Une meilleure règle

Les auteurs n'ont pas seulement signalé le problème ; ils ont construit un meilleur outil pour le corriger.

Ils ont proposé un nouveau format appelé FP8 Unsigned E5M3 (UE5M3).

  • La correction : Considérez l'ancienne règle comme ayant 4 marques pour la « taille » (exposant) et 3 marques pour le « détail » (mantisse).
  • L'amélioration : Ils ont pris un bit inutilisé (un petit interrupteur) et l'ont transformé en une marque de « taille » supplémentaire. Maintenant, la règle a 5 marques pour la taille et 3 pour le détail.

Pourquoi cela aide :
Cette nouvelle règle peut mesurer des nombres beaucoup, beaucoup plus petits sans les arrondir à zéro. Elle étend le « bas » de la règle afin de voir clairement ces minuscules cailloux.

Les résultats

Les chercheurs ont testé cette nouvelle règle sur plusieurs modèles d'IA (comme Llama et Granite).

  • Sans la correction : Lorsqu'ils rendaient les blocs très petits, les modèles devenaient confus et commettaient plus d'erreurs.
  • Avec la nouvelle règle (UE5M3) : Les modèles restaient précis, même avec des blocs minuscules. En fait, elle a performé aussi bien qu'une solution de contournement complexe où il fallait manuellement étirer les nombres avant de les mesurer, mais sans nécessiter cette étape supplémentaire et coûteuse.

Résumé

Cet article nous enseigne que dans la compression de l'IA, plus petit n'est pas toujours mieux. Si vous réduisez trop la taille de vos groupes de données, vous risquez de casser l'outil de mesure que vous utilisez pour les lire. En modifiant simplement la conception de cet outil de mesure (en ajoutant un bit supplémentaire de plage), ils ont corrigé le bug, permettant aux modèles d'IA d'être compressés plus efficacement sans perdre leur intelligence.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →