← Derniers articles
🤖 AI

Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

Vortex est un système qui combine un front-end intégré à Python avec un back-end efficace pour permettre le prototypage et le déploiement rapides d'algorithmes d'attention parcimonieuse, permettant aux agents IA de découvrir automatiquement des conceptions qui atteignent jusqu'à 3,46× un débit supérieur à l'attention complète tout en étendant ces gains aux architectures émergentes à grande échelle.

Auteurs originaux : Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

Publié 2026-06-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigez une bibliothèque immense (un Grand Modèle de Langage, ou LLM) où un bibliothécaire (l'IA) doit écrire une histoire très longue, un mot à la fois.

Chaque fois que le bibliothécaire écrit un nouveau mot, il doit regarder tout ce qu'il a écrit jusqu'à présent pour s'assurer que le nouveau mot convient. Dans une bibliothèque traditionnelle, le bibliothécaire doit parcourir chaque étagère, vérifier chaque livre et lire chaque phrase pour trouver les parties pertinentes. À mesure que l'histoire s'allonge (des milliers de mots), ce processus de « marche et de vérification » devient incroyablement lent et épuisant. C'est le problème de l'Attention Totale (Full Attention).

L'Attention Éparse (Sparse Attention) est comme donner un raccourci intelligent au bibliothécaire : « Ne regarde que les 5 dernières pages et les 3 chapitres les plus importants du début ». Cela permet de gagner énormément de temps. Cependant, construire ces raccourcis est actuellement un cauchemar pour les ingénieurs. C'est comme essayer de construire une nouvelle voie ferrée sur mesure pour chaque nouvelle idée de raccourci que vous avez. Si vous voulez tester une nouvelle idée, vous devez reconstruire toute la voie de zéro, ce qui prend des semaines.

Entrez dans Vortex.

Vortex est un nouveau système qui agit comme un « Constructeur de Voies Ferrées Universelles » pour ces raccourcis. Voici comment il fonctionne, en utilisant des analogies simples :

1. Le Problème : La Bibliothèque « Segmentée »

Les bibliothèques modernes ne stockent pas les livres dans une seule rangée continue. Pour économiser de l'espace, elles stockent les livres dans des boîtes éparpillées et non contiguës (appelées Attention Segmentée ou Paged Attention).

  • L'Ancienne Méthode : Si vous vouliez dire à un ordinateur de « regarder des boîtes spécifiques et éparpillées », vous deviez écrire un code complexe et de bas niveau pour trouver chaque boîte, la saisir et la mettre en ordre. C'était comme demander à un robot de trouver des grains de sable spécifiques sur une plage en les déterrant un par un.
  • La Méthode Vortex : Vortex introduit une nouvelle façon de penser appelée vTensor. Il donne au bibliothécaire une « carte magique ». Vous n'avez pas besoin de savoir où les boîtes sont physiquement localisées ; vous dites simplement : « Je veux les 5 boîtes les plus pertinentes », et la carte magique gère les détails complexes pour les trouver dans le stockage éparpillé.

2. Le Langage : vFlow (Le « Livre de Recettes »)

Vortex est accompagné d'un langage de programmation appelé vFlow.

  • L'Analogie : Imaginez que vous êtes un chef cuisinier. Au lieu d'écrire du code pour dire à l'ordinateur comment couper chaque carotte, vous écrivez simplement une recette : « Prenez les carottes, coupez-les et mélangez-les avec les oignons ».
  • Comment cela aide : Les chercheurs (et même les agents d'IA) peuvent écrire des « recettes » pour de nouveaux types de raccourcis (algorithmes d'attention éparse) en quelques lignes de code. Ils n'ont pas besoin d'être des experts dans les détails matériels complexes. Ils décrivent simplement ce qu'ils veulent faire, et Vortex détermine comment le faire efficacement.

3. L'Agent d'IA : L'« Inventeur Autonome »

C'est la partie la plus excitante. L'article montre que Vortex est si facile à utiliser que des agents d'IA (des programmes informatiques conçus pour agir comme des humains) peuvent l'utiliser pour inventer eux-mêmes de nouveaux raccourcis.

  • L'Expérience : Les chercheurs ont demandé à des agents d'IA d'« inventer 20 nouvelles façons d'accélérer le travail du bibliothécaire ».
  • Le Résultat : Les agents d'IA n'ont pas seulement copié de vieilles idées ; ils ont créé des recettes entièrement nouvelles et diverses. L'un de ces raccourcis générés par l'IA a rendu le bibliothécaire 3,46 fois plus rapide que la méthode standard, sans perdre aucune précision dans l'histoire.
  • La Boucle : L'IA a continué à essayer, à échouer et à ajuster ses recettes pendant 18 heures. Elle a fini par trouver un équilibre parfait entre vitesse et précision que les humains auraient pu manquer.

4. Les Résultats : Accélérer le Futur

Vortex n'est pas seulement destiné aux petits modèles ; il fonctionne sur les bibliothèques les plus grandes et les plus complexes du monde.

  • Les Grands Modèles : L'équipe a testé Vortex sur un modèle massif (MiniMax-M2.7) de 229 milliards de paramètres, tournant sur des puces de supercalculateur (NVIDIA B200). Même là, les raccourcis de Vortex ont rendu le système 1,37 fois plus rapide.
  • Nouvelles Architectures : Ils l'ont également utilisé sur un nouveau type de conception de bibliothèque appelée MLA (utilisée par des modèles comme DeepSeek et GLM). Ils ont conçu un raccourci personnalisé pour celle-ci en vFlow et ont obtenu une accélération de 4,7 fois.

Résumé

Considérez Vortex comme un traducteur et une équipe de construction réunis en un seul.

  1. Il traduit les règles matérielles complexes et désordonnées en recettes simples et lisibles.
  2. Il permet aux humains et aux agents d'IA d'inventer, de tester et de déployer rapidement de nouveaux « raccourcis » pour lire des textes longs.
  3. Il transforme ce qui était autrefois un projet d'ingénierie de plusieurs mois en une question d'heures, nous permettant de trouver des moyens plus rapides de faire fonctionner les modèles d'IA sans sacrifier leur intelligence.

L'article affirme qu'en facilitant l'expérimentation, Vortex a déjà aidé des agents d'IA à découvrir des algorithmes nettement plus rapides que tout ce qui est actuellement utilisé en production, prouvant que nous pouvons rendre l'IA plus rapide et plus efficace sans attendre de nouveaux matériels.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →