← Derniers articles
💻 computer science

FlashAttention for Scalable Vector Architectures

Ce document introduit FlashAttention-V, une implémentation de FlashAttention par blocs optimisée pour les architectures vectorielles évolutives qui accélère considérablement l'inférence des transformers sur CPU en exploitant le parallélisme inter-têtes et un accès mémoire efficace, atteignant jusqu'à 42x de vitesse en pré-remplissage (prefill) et 11x en décodage, tout en mettant en évidence les goulots d'étranglement structurels dans les formats de quantification actuels pour l'exécution à longs vecteurs.

Auteurs originaux : Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs

Publié 2026-08-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les systèmes d'intelligence artificielle modernes, des agents conversationnels qui rédigent des courriels aux assistants de codage qui débuguent des logiciels, reposent sur un type spécifique de programme informatique appelé transformeur. Ces programmes sont conçus pour comprendre le langage en observant comment les mots se rapportent les uns aux autres dans une phrase. Pour ce faire, ils utilisent un mécanisme appelé l'attention, qui agit comme un projecteur, permettant au système de se concentrer sur les parties les plus pertinentes du texte tout en ignorant le reste. Bien que ces systèmes soient souvent exécutés sur de massifs centres de données dotés de cartes graphiques puissantes, il existe un besoin croissant de les faire fonctionner sur des appareils plus petits et du quotidien, tels que des ordinateurs portables, des tablettes et même des puces spécialisées présentes dans l'Internet des Objets. Ces appareils plus petits utilisent souvent un type de processeur différent, conçu pour gérer de nombreux calculs à la fois en traitant les données sous forme de longues lignes, appelées architectures vectorielles. Cependant, un obstacle majeur est apparu : le mécanisme d'attention est incroyablement gourmand en mémoire, exigeant que le processeur récupère et stocke constamment de grandes quantités de données, ce qui ralentit l'ensemble du processus.

Des chercheurs de l'Université de technologie de Chalmers et de l'Université de Glasgow ont abordé ce problème en repensant la manière dont le mécanisme d'attention fonctionne sur ces processeurs vectoriels. Ils ont créé une nouvelle méthode appelée FlashAttention-V, qui modifie la façon dont l'ordinateur organise son travail pour l'adapter à la forme unique de ces processeurs. Au lieu de forcer le processeur à traiter une petite pièce de donnée à la fois, la nouvelle méthode regroupe plusieurs calculs indépendants en une seule ligne de données large. Imaginez une chaîne de montage d'usine où les ouvriers manipulent habituellement un article à la fois ; cette nouvelle approche permet de saisir tout un plateau d'articles et de les traiter tous d'un coup, réduisant considérablement le temps passé à faire des allers-retours vers les étagères de stockage. En réorganisant l'ordre des opérations et en compactant davantage les données, les chercheurs ont découvert qu'ils pouvaient rendre ces appareils plus petits nettement plus rapides, en particulier lorsqu'ils traitent de courtes rafales de texte ou lorsque l'appareil génère de nouveaux mots un par un.

L'équipe a testé leur nouvelle approche sur plusieurs modèles de langage différents, notamment TinyLlama, Llama 3.2 et Qwen2.5, en utilisant à la fois du matériel réel et des simulations informatiques détaillées. Sur une carte de développement physique appelée Banana Pi BPI-F3, qui utilise un processeur RISC-V, la nouvelle méthode s'est révélée être une amélioration massive. Lorsque l'appareil se préparait à lire une courte entrée, la nouvelle approche était douze à quatorze fois plus rapide que la version standard non optimisée. Lorsque l'appareil générait du texte mot par mot, elle était quatre à cinq fois plus rapide. Les chercheurs ont également effectué des simulations approfondies pour voir comment la méthode se comporterait si les processeurs étaient construits avec des lignes de données encore plus larges, capables de gérer des blocs d'informations beaucoup plus importants à la fois. Ces simulations ont montré qu'à mesure que les lignes de données s'élargissaient, les gains de vitesse continuaient de grimper, atteignant quarante-deux fois la vitesse de la version de base dans les meilleurs scénarios de préparation d'entrées.

Cependant, l'étude a également révélé une limite distincte à la vitesse que ces appareils peuvent atteindre. Les chercheurs ont découvert que, si la partie attention du programme bénéficie grandement de ces lignes de données plus larges, d'autres parties du système, spécement les couches qui convertissent les nombres en prédictions, ne le bénéficient pas. Ces couches utilisent une méthode spécifique de stockage des nombres appelée quantification, qui compresse les données pour gagner de l'espace. La façon dont ces données sont actuellement emballées crée un décalage structurel avec les lignes de données larges, forçant le processeur à effectuer un travail supplémentaire et inefficace pour séparer et recombiner les nombres. Les simulations ont montré que pour ces couches spécifiques, le temps économisé par le traitement de plus de données à la fois était totalement absorbé par le temps passé à les réorganiser. Cela signifie que, bien que le mécanisme d'attention puisse être rendu incroyablement rapide, la vitesse globale du système est actuellement freinée par ces autres composants, suggérant que les améliorations futures nécessiteront un changement dans la manière dont ces nombres sont stockés, et pas seulement dans la manière dont ils sont traités.

Les conclusions offrent une voie claire pour rendre l'intelligence artificielle plus accessible sur les appareils du quotidien. La nouvelle méthode, FlashAttention-V, parvient à combler le fossé entre la conception des modèles de langage modernes et les capacités des processeurs vectoriels évolutifs. Elle prouve qu'en réorganisant simplement la façon dont l'ordinateur envisage ses tâches et en emballant les données plus efficacement, des gains de performance significatifs sont possibles sans nécessiter de nouveau matériel. La recherche confirme que pour les tâches courtes et la génération de texte en temps réel, ces processeurs optimisés peuvent être très efficaces. Pourtant, elle sert également de mise en garde, indiquant que les méthodes actuelles de compression de données pour ces appareils pourraient atteindre un mur, et que débloquer tout le potentiel des futurs processeurs plus larges dépendra probablement de la résolution de l'énigme consistant à stocker et à déplacer ces nombres compressés de manière plus intelligente.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →