← Derniers articles
🤖 AI

FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

Cet article présente FOCUS, un cadre de quantification post-entraînement qui améliore la précision du FP4 pour les grands modèles de langage en employant une mise à l'échelle par relaxation couplée (Coupled-Relaxation Scaling) pour découpler les échelles de quantification apprenables des contraintes matérielles, ainsi qu'une mise à l'échelle à double granularité (Dual-Granularity Scaling) pour une adaptation plus fine des poids, atteignant des performances de pointe sans surcoût d'inférence supplémentaire.

Auteurs originaux : Xianglong Yan, Hong Liu, Chengzhu Bao, Tianao Zhang, Guanghua Yu, Jianchen Zhu, Yulun Zhang

Publié 2026-08-04
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xianglong Yan, Hong Liu, Chengzhu Bao, Tianao Zhang, Guanghua Yu, Jianchen Zhu, Yulun Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de faire tenir une bibliothèque de connaissances massive et complexe dans un petit sac à dos portable. C'est le combat quotidien des « Large Language Models » (LLM), ces cerveaux informatiques super intelligents capables d'écrire des histoires, de résoudre des problèmes mathématiques et de discuter comme des humains. Le problème est que ces cerveaux sont si volumineux qu'ils nécessitent une quantité énorme de mémoire et de puissance pour fonctionner, ce qui les rend coûteux et lents à utiliser sur des appareils du quotidien. Pour y remédier, les scientifiques utilisent une astuce appelée « quantification ». Considérez cela comme la traduction d'un film en haute définition, 4K, vers un format de résolution inférieure afin qu'il puisse tenir sur un vieux téléphone. L'objectif est de réduire la taille des données sans perdre le fil de l'histoire. Récemment, un nouveau format super minuscule appelé « FP4 » a émergé, supporté par les puces informatiques modernes, qui promet de réduire encore davantage ces modèles. Cependant, il y a un piège : compresser les données de manière aussi étroite fait souvent « oublier » des choses au modèle ou le rend confus, entraînant une perte de précision. La grande question est la suivante : comment réduire la taille du modèle jusqu'à cette dimension minuscule sans ruiner son intelligence ?

Ce document présente une nouvelle méthode ingénieuse appelée FOCUS pour résoudre exactement ce problème. Les chercheurs ont réalisé que la méthode actuelle pour réduire la taille de ces modèles était trop rigide. Imaginez que vous prépariez une valise. La règle standard dit : « Vous devez utiliser exactement les mêmes petites boîtes préfabriquées pour emballer vos vêtements, et vous devez utiliser ces mêmes boîtes pour les déballer plus tard. » Le document soutient que c'est absurde. Bien que vous deviez utiliser les petites boîtes pour stocker les vêtements (car c'est ce qui rentre dans la valise), vous n'avez pas besoin d'utiliser ces mêmes petites boîtes pour déterminer comment plier les vêtements au départ. Vous pourriez utiliser un ruban à mesurer géant et flexible pour planifier l'emballage, puis simplement faire tenir le résultat dans les petites boîtes.

FOCUS utilise cette intuition pour améliorer la préparation de ces modèles pour le format minuscule FP4. Il introduit deux astuces principales :

  1. Coupled-Relaxation Scaling (CRS) : C'est le « ruban à mesurer flexible ». Dans l'ancienne méthode, l'ordinateur devait utiliser une règle très grossière et de faible précision pour décider comment réduire les nombres, et il devait utiliser cette même règle grossière pour les réassembler. FOCUS dit : « Utilisons une règle super précise et de taille réelle pour faire le calcul de réduction, et ensuite compressons le résultat dans la boîte grossière. » Cela permet à l'ordinateur de trouver une bien meilleure façon d'emballer les données sans enfreindre les règles du format minuscule.
  2. Dual-Granularity Scaling (DGS) : Il s'agit d'emballer des articles plus petits. L'ancienne méthode traitait un groupe entier de 32 nombres comme un seul gros bloc, utilisant une seule règle pour tous. Mais que se passe-t-il si certains nombres de ce groupe sont énormes et d'autres minuscules ? FOCUS divise ce grand groupe en sous-groupes plus petits (comme découper une grande pizza en parts) et donne à chaque part sa propre règle personnalisée. Cela permet à l'ordinateur de s'adapter aux détails spécifiques des données, plutôt que de forcer tout le monde dans une boîte unique et standardisée.

Les résultats sont impressionnants. Lorsque les chercheurs ont testé FOCUS sur plusieurs modèles d'IA différents (comme Qwen et LLaMA), il a systématiquement surpassé toutes les autres méthodes. Par exemple, sur un modèle appelé Qwen3-4B, FOCUS a réussi à récupérer 98,2 % de la précision du modèle original en utilisant le format NVFP4, et 96,2 % avec MXFP4. Il s'agit d'un bond significatif par rapport aux techniques précédentes, qui peinaient souvent à rester au-dessus de 90 % ou 94 %.

Crucialement, le document montre que FOCUS ne rend pas le modèle plus lent ou plus difficile à utiliser. Même si l'ordinateur effectue des calculs supplémentaires pendant la préparation du modèle (lors de la phase d'« entraînement » ou de « calibration »), le modèle final s'exécute aussi rapidement que n'importe quel autre modèle FP4. Il faut environ 19 minutes pour préparer un modèle Qwen3-4B sur un seul GPU haut de gamme, ce qui est en fait plus rapide que certaines méthodes concurrentes. Les chercheurs soulignent qu'il s'agit d'une méthode de « post-entraînement », ce qui signifie qu'ils n'ont pas besoin de réapprendre le modèle à partir de zéro ; ils ne font qu'ajuster les instructions d'emballage.

En résumé, FOCUS suggère qu'en assouplissant les règles sur la manière de calculer la réduction (tout en gardant strict le format de stockage final), nous pouvons faire tenir ces cerveaux d'IA géants dans de minuscules espaces sans perdre leur intelligence. C'est un peu comme réaliser que l'on peut plier une chemise parfaitement en utilisant une grande table, même si l'on n'a qu'un petit tiroir pour la ranger. Le document prouve que cette approche fonctionne mieux que les anciennes méthodes rigides, offrant une voie pour faire fonctionner des IA puissantes sur des appareils qui ne peuvent actuellement pas les gérer.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →