← Derniers articles
🤖 machine learning

Hardware-Aware FP4 FlashAttention-4

Ce document introduit le Hardware-Aware FP4 FlashAttention-4, une méthode qui surmonte les limitations des cœurs tensorielsels FP4 de Blackwell en employant Direct-P pour l'inférence non causale et un chemin causal avec des gradients FP8, atteignant jusqu'à 2,13× plus de débit de propagation avant et 1,14× plus de rapidité pour les mises à jour d'entraînement sur un seul GPU tout en évitant les problèmes de divergence observés dans l'entraînement MXFP4.

Auteurs originaux : Robert Hu

Publié 2026-09-04✓ Author reviewed
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Robert Hu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde de l'intelligence artificielle, les modèles les plus puissants reposent sur un mécanisme appelé « attention » pour comprendre le contexte. Imaginez un lecteur parcourant un long document ; l'attention permet au modèle de se concentrer sur les mots les plus pertinents d'une phrase tout en ignorant les autres, reliant des idées à travers de vastes distances. Pour ce faire, l'ordinateur effectue une série massive de calculs, comparant chaque mot à tous les autres pour déterminer leurs relations. Pendant des années, ces calculs ont été effectués avec des nombres de haute précision, semblable à l'utilisation d'une règle dotée de graduations minuscules et précises pour mesurer un bâtiment. Cela garantit que le modèle apprend correctement, mais c'est lent et consomme énormement d'énergie. À mesure que les modèles grandissent, le besoin de vitesse devient critique. Des chercheurs ont récemment développé des puces capables d'utiliser des nombres beaucoup plus petits et plus grossiers — des valeurs de virgule flottante à quatre bits — pour effectuer ces comparaisons beaucoup plus rapidement. Cependant, le simple passage à ces nombres plus petits ne suffit pas ; le logiciel qui gère le flux de données doit également changer, sinon les gains de vitesse disparaissent.

Un chercheur chez Graphcore a abordé ce goulot d'étranglement spécifique avec une nouvelle méthode qu'ils appellent Direct-P. Son travail se concentre sur la passe « forward » (directe) de l'attention, où le modèle traite l'information pour générer une réponse, et la passe « backward » (retour), où il apprend de ses erreurs. Le chercheur a découvert que si les nouvelles puces peuvent multiplier les nombres incroyablement vite, l'étape intermédiaire — la conversion des scores bruts en probabilités — ralentissait tout le processus. C'était comme avoir une ligne de montage super rapide qui s'arrêtait sans cesse parce qu'un ouvrier devait mesurer soigneusement chaque pièce avant de la transmettre. Le chercheur a constaté que la méthode standard pour gérer cette conversion, qui impliquait une mise à l'échelle et un arrondi complexes, créait un embouteillage qui annulait les avantages de vitesse du nouveau matériel.

Pour résoudre cela, le cherchenaire a redessiné le processus de conversion pour le rendre direct et rationalisé. Au lieu de calculer une probabilité précise puis de l'arrondir, sa méthode projette directement les scores bruts vers les codes spécifiques utilisés par le matériel. Cela élimine les étapes intermédiaires qui causaient des retards. Lorsqu'ils ont testé cette approche sur la dernière génération de puces de centres de données, les résultats ont été frappants. Pour certaines formes courantes de données, la nouvelle méthode a traité l'information plus de deux fois plus vite que la norme précédente, qui reposait sur des nombres de plus haute précision. Elle y est parvenue tout en maintenant une précision suffisante pour des tâches complexes comme la génération de vidéos et la compréhension du langage. Dans des tests impliquant un modèle de génération de vidéo, la nouvelle méthode était presque deux fois plus rapide que l'approche standard, produisant des résultats qui, bien que finis et utilisables, montraient une dérive mesurable et des scores de similitude inférieurs par rapport à la version plus lente et plus précise.

Cependant, l'histoire ne concerne pas seulement la vitesse ; elle concerne aussi ce qui se passe lorsque le modèle tente d'apprendre. Le chercheur a exploré s'il pouvait utiliser ces nombres ultra-rapides et de faible précision pour l'ensemble du processus d'apprentissage, y compris la passe « backward » où le modèle met à jour ses connaissances. Il a découvert que si la passe « forward » pouvait fonctionner à pleine vitesse, la passe « backward » nécessitait un compromis prudent. Lorsqu'ils ont essayé d'utiliser le format de quatre bits le plus rapide pour les valeurs de probabilité pendant l'entraînement, le processus d'apprentissage est devenu instable et le modèle n'a pas réussi à progresser. Les nombres étaient devenus trop grossiers, provoquant la rupture du signal d'apprentissage. Par conséquent, le chercheur a déterminé que pour que l'entraînement reste stable, ils devaient utiliser un format de huit bits légèrement plus précis pour les valeurs de probabilité, même si le reste du calcul utilise le format plus rapide à quatre bits. Cette approche hybride leur a permis d'accélérer l'ensemble du cycle d'entraînement d'environ 14 % sur une seule puce puissante, un gain significatif pour les modèles à grande échelle.

Le chercheur a également examiné les limites physiques des puces informatiques elles-mêmes. Il a découvert que la vitesse du calcul n'était plus le problème principal ; le problème était la manière dont les données étaient stockées et déplacées à l'intérieur de la puce. La puce possède une zone de mémoire petite et ultra-rapide où elle conserve les nombres pendant qu'elle travaille dessus. Le chercheur a constaté que cet espace mémoire était complètement plein, ne laissant aucune place pour superposer les différentes étapes du calcul. C'était comme une cuisine où le plan de travail est si encombré d'ingrédients que le chef ne peut pas commencer à couper le légume suivant avant d'avoir fini le actuel, même si le couteau est incroyablement tranchant. Parce que l'espace mémoire était entièrement occupé, la puce ne pouvait pas travailler sur plusieurs étapes à la fois, ce qui limitait la vitesse à laquelle l'ensemble du processus pouvait devenir plus rapide.

Ce travail met en lumière un changement crucial dans notre façon de concevoir l'accélération de l'intelligence artificielle. Il ne suffit pas de construire des calculateurs plus rapides ; l'ensemble du flux de travail doit être redessiné pour correspondre aux capacités du matériel. Le chercheur a démontré qu'en changeant la façon dont les probabilités sont calculées et en gérant soigneusement le flux de données, il pouvait débloquer des améliorations de vitesse massives. Pourtant, il a également prouvé qu'il existe des limites concrètes. Les contraintes de mémoire de la puce signifient que même avec les mathématiques les plus rapides, il existe un plafond à l'ampleur du chevauchement possible. La voie à suivre, suggèrent-ils, ne réside pas seulement dans une arithmétique plus rapide, mais dans des manières plus intelligentes d'organiser les données afin que les ressources de la puce ne soient jamais en attente. Cet équilibre entre la vitesse brute et la gestion prudente des données est ce qui permettra à la prochaine génération d'intelligence artificielle de fonctionner efficacement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →