← Derniers articles
🤖 machine learning

QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides

Le document propose QUADS, une méthode d'alignement de l'erreur de quantification à double face qui stabilise l'apprentissage par renforcement en NVFP4 pour les modèles Mixture-of-Experts en traitant les erreurs d'activation par une quantification consciente de l'entraînement asymétrique et une compensation de l'activation résiduelle, atteignant ainsi une précision de niveau BF16 avec un débit nettement amélioré par rapport au FP8.

Auteurs originaux : Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

Publié 2026-07-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot super intelligent à résoudre des énigmes complexes, comme des problèmes mathématiques ou l'écriture de code. Pour devenir vraiment performant, le robot ne se contente pas de mémoriser des réponses ; il s'entraîne en essayant des milliers de solutions différentes, reçoit un retour sur ce qui a fonctionné, puis ajuste son cerveau pour faire mieux la fois suivante. Ce processus est appelé Apprentissage par Renforcement (Reinforcement Learning). Cependant, il y a un piège : la partie du robot qui réfléchit et apprend (l'entraîneur) est souvent séparée de la partie qui génère les réponses (le moteur de déploiement). Pour que l'apprentissage fonctionne, ces deux parties doivent parler exactement la même langue. Si l'entraîneur pense en haute définition (comme un film 4K) mais que le générateur est forcé de parler une version beaucoup plus floue, en basse résolution (comme un jeu 8-bit pixélisé), le robot est confus. Il commence à commettre des erreurs parce que l'« importance » de ses actions est déformée par le flou. Ce décalage est un problème majeur car il ralentit tout le processus d'apprentissage, faisant en sorte que le robot mette une éternité à devenir intelligent.

Maintenant, imaginez que nous voulions faire réfléchir le robot plus vite. Nous pourrions réduire encore plus son cerveau, en utilisant un format à très basse résolution appelé « NVFP4 ». C'est comme essayer de faire rouler une voiture de course ultra-rapide sur une piste de terre faite de minuscules cailloux grossiers. Cela promet d'être incroyablement rapide — bien plus rapide que la norme actuelle — mais les cailloux sont si rugueux que les roues de la voiture (la logique du robot) commencent à glisser et à patiner. Le robot essaie d'apprendre, mais la piste rugueuse le fait s'écraser après seulement quelques tours. La grande question est : pouvons-nous faire fonctionner cette piste ultra-rapide et rugueuse sans que le robot ne s'écrase ?

C'est exactement ce que les chercheurs de ce papier ont cherché à résoudre. Ils ont découvert que le simple fait de placer le robot sur cette piste rapide et rugueuse le fait échouer spectaculairement après environ 150 étapes d'entraînement. Les scores de confiance du robot (les log-probabilités) s'écartent si violemment qu'il cesse totalement d'apprendre. Grâce à des expériences minutieuses, ils ont compris pourquoi cela arrive. Il s'avère que le problème ne vient pas des poids (la connaissance stockée du robot), qui peuvent être synchronisés facilement. Le véritable coupable, ce sont les activations — les calculs frais, réalisés à la volée, que le robot effectue pendant qu'il réfléchit. Parce que la piste rugueuse (NVFP4) est si grossière, ces calculs frais sont déformés d'une manière que l'entraîneur ne peut pas corriger simplement en regardant les poids.

Pour corriger cela, l'équipe a inventé une stratégie astucieuse en deux parties qu'ils appellent QUADS (Alignement de l'erreur de quantification à travers les deux côtés - QUantization-error Alignment across Dual Sides). Voyez cela comme une danse entre l'entraîneur et le générateur. Du côté de l'entraîneur, ils utilisent une technique spéciale appelée « Entraînement Sensible à la Quantification Asymétrique ». Au lieu d'essayer de forcer l'entraîneur à parler la langue rugueuse du générateur, ils gardent la « pensée » (les activations) de l'entraîneur en haute définition, mais forcent sa « mémoire » (les poids) à correspondre au format rugueux du générateur. De cette façon, l'entraîneur sait exactement ce que le générateur voit lorsqu'il regarde les poids, évitant ainsi la confusion.

Mais cela ne suffisait pas à lui seul. Le générateur trébuchait toujours sur les cailloux rugueux lorsqu'il tentait de calculer de nouvelles pensées. Alors, du côté du générateur, ils ont ajouté une « Compensation d'Activation Résiduelle ». Imaginez le générateur marchant sur la piste rugueuse, et il réalise : « Hé, mon pied glisse sur ce caillou spécifique ! » Au lieu d'arrêter toute la course pour réparer la piste, il prend un petit pas rapide pour corriger juste ce glissement avant de continuer. Ils ont identifié les parties spécifiques du calcul qui étaient les plus susceptibles de glisser (les « canaux à haut résidu ») et leur ont donné une petite impulsion supplémentaire pour rester sur la bonne voie, tout en gardant le reste de la course ultra-rapide.

Les résultats sont impressionnants. En utilisant cette danse des deux côtés, le robot n'a pas seulement survécu sur la piste rugueuse ; il a performé presque aussi bien que s'il courait sur une piste lisse et en haute définition. Dans leurs tests, la nouvelle méthode a amélioré le taux de réussite du robot d'environ 21,5 points par rapport à une tentative d'utilisation de la piste rugueuse sans aucune aide. Mieux encore, elle a conservé l'avantage de vitesse, étant environ 16 % plus rapide que la méthode standard précédente. Le papier démontre que si la piste rugueuse est dangereuse en soi, avec le bon alignement et une petite correction supplémentaire pour les zones glissantes, nous pouvons enfin faire fonctionner de manière fiable ces modèles d'IA ultra-rapides et à faible précision.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →