← Derniers articles
🤖 machine learning

TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization

Ce papier présente TORQ, un cadre de quantification post-entraînement sans entraînement qui utilise des rotations orthogonales à deux niveaux pour résoudre théoriquement les déséquilibres structurels dans la quantification des activations MXFP4, réduisant ainsi considérablement l'écart de précision entre l'inférence en 4 bits et les modèles de pleine précision sur les grands modèles de langage.

Auteurs originaux : Zukang Xu, Xing Hu, Dawei Yang

Publié 2026-05-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zukang Xu, Xing Hu, Dawei Yang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de ranger une bibliothèque massive et chaotique de livres (les « activations » à l'intérieur d'une IA intelligente) dans de minuscules boîtes d'expédition uniformes (le format « MXFP4 ») afin qu'elles puissent être expédiées rapidement et à moindre coût.

L'article soutient que simplement enfoncer ces livres dans les boîtes ne fonctionne pas bien. Les livres sont trop désordonnés, et les boîtes ont une forme très spécifique et rigide. Cela cause deux problèmes principaux, que les auteurs appellent TORQ (Rotation Orthogonale à Deux Niveaux).

Voici comment l'article explique le problème et leur solution, en utilisant des analogies simples :

Le Problème : Deux Façons Dont L'Emballage Échoue

1. Le Problème du « Voisin Bruyant » (Déséquilibre de Variance Inter-bloc)
Imaginez que votre bibliothèque est divisée en groupes de 32 livres. Dans le système actuel, chaque groupe reçoit une seule « étiquette de taille » (un facteur d'échelle) pour l'ensemble du groupe.

  • Le Problème : Dans la plupart des groupes, les livres sont petits et légers. Mais dans quelques groupes, il y a une seule encyclopédie géante et lourde.
  • Le Résultat : À cause de ce seul livre lourd, l'étiquette pour tout le groupe doit être réglée sur « Extra Grand ». Cela signifie que tous les petits livres légers de ce même groupe sont maintenant forcés dans une boîte géante. Ils sont écrasés, perdus, ou réduits à zéro parce que la boîte est trop grande pour contenir leurs petits détails. Quelques groupes « bruyants » ruinent la précision pour tout le monde.

2. Le Problème de l'« Étagère Vide » (Déséquilibre d'Utilisation du Codebook Intra-bloc)
Les boîtes d'expédition (MXFP4) sont livrées avec une liste pré-imprimée de tailles spécifiques qu'elles peuvent contenir (un « codebook »). Ces tailles sont espacées comme les barreaux d'une échelle : petit, moyen, grand, extra-grand.

  • Le Problème : Les données réelles de l'IA sont comme une foule de personnes où 90 % sont très petites et seulement 10 % sont grandes.
  • Le Résultat : Presque toutes les données tombent sur les barreaux « petits » de l'échelle. Les barreaux « moyens » et « grands » restent complètement vides et inutilisés. C'est comme avoir un entrepôt rempli de caisses géantes, mais vous n'utilisez que les toutes petites, tandis que les grandes prennent la poussière. C'est un gaspillage massif d'espace et de potentiel.

La Solution : TORQ (La Grande Réorganisation)

Au lieu d'essayer de forcer les livres désordonnés à s'adapter aux boîtes, les auteurs proposent de faire tourner les livres avant qu'ils ne soient emballés. Pensez-y comme mélanger un jeu de cartes pour que les cartes lourdes et les cartes légères soient mélangées uniformément, et que les personnes grandes et les personnes petites soient réparties.

Ils le font en deux étapes :

Étape 1 : Le Mélange Macro (Réparer le « Voisin Bruyant »)

  • L'Analogie : Imaginez que vous avez 100 groupes de livres. Certains groupes sont lourds, d'autres sont légers. Les auteurs utilisent un tour de mathématiques (basé sur le théorème de Schur-Horn) pour échanger des livres entre les groupes.
  • L'Objectif : Ils déplacent les livres « lourds » des groupes lourds vers les groupes légers, et vice versa.
  • Le Résultat : Maintenant, chaque groupe a à peu près le même poids total. Aucun groupe unique n'est dominé par un seul livre géant. Cela permet à l'« étiquette de taille » de chaque groupe d'être réglée sur une taille moyenne parfaite, préservant les détails des petits livres.

Étape 2 : Le Mélange Micro (Réparer l'« Étagère Vide »)

  • L'Analogie : Maintenant que les groupes sont équilibrés, regardez à l'intérieur d'un groupe. Les livres sont toujours regroupés dans la section « petite ». Les auteurs font tourner les livres à l'intérieur du groupe.
  • L'Objectif : Ils font tourner les livres pour qu'ils se répartissent uniformément sur toute l'échelle des tailles. Au lieu que 90 % des livres soient « petits », ils sont maintenant distribués de sorte que certains touchent les barreaux « moyens » et d'autres les barreaux « grands ».
  • Le Résultat : Ils utilisent chaque barreau de l'échelle. Aucun espace n'est gaspillé. Le « codebook » est pleinement utilisé.

Le Résultat

En effectuant cette rotation en deux étapes avant que l'IA ne soit compressée (un processus appelé Quantification Post-Entraînement, ce qui signifie qu'ils n'ont pas besoin de réapprendre l'IA), ils obtiennent des résultats étonnants :

  • Précision : Ils ont réussi à réduire l'IA à une précision de 4 bits (de minuscules boîtes) sans perdre beaucoup de sa « puissance cérébrale ». Dans les tests, leur méthode (TORQ) était bien plus intelligente que les méthodes précédentes, obtenant des scores proches de l'IA complète, non compressée.
  • Vitesse et Taille : Parce que les boîtes sont plus petites, l'IA fonctionne plus vite et occupe moins de mémoire sur des appareils comme les téléphones ou les serveurs.
  • Pas de Travail Supplémentaire : La « rotation » est calculée une fois puis intégrée dans les poids de l'IA. Lorsque l'IA fonctionne, elle ne ressent aucun ralentissement supplémentaire ; la rotation se produit automatiquement dans le cadre des mathématiques.

En bref : L'article dit : « N'essayez pas de serrer une foule désordonnée et inégale dans une boîte rigide. Au lieu de cela, mélangez doucement la foule pour que tout le monde soit réparti uniformément, et ensuite mettez-les dans la boîte. Cela fait fonctionner la boîte parfaitement. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →