← Derniers articles
🤖 machine learning

MPK: A Compiler and Runtime for Mega-Kernelizing Tensor Programs

Mirage Persistent Kernel (MPK) est un nouveau système de compilation et d'exécution qui transforme automatiquement les programmes tensoriels multi-GPU en un méga-noyau unique à haute performance en utilisant des représentations de graphes au niveau des SM pour permettre le pipeline inter-opérateurs et le chevauchement fin de la computation et de la communication, réduisant ainsi considérablement la latence d'inférence des LLM par rapport aux approches traditionnelles de type noyau par opérateur.

Auteurs originaux : Xinhao Cheng, Zhihao Zhang, Yu Zhou, Jianan Ji, Jinchen Jiang, Zepeng Zhao, Ziruo Xiao, Zihao Ye, Yingyi Huang, Ruihang Lai, Hongyi Jin, Bohan Hou, Mengdi Wu, Yixin Dong, Anthony Yip, Zihao Ye, Songti
Publié 2026-06-11
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xinhao Cheng, Zhihao Zhang, Yu Zhou, Jianan Ji, Jinchen Jiang, Zepeng Zhao, Ziruo Xiao, Zihao Ye, Yingyi Huang, Ruihang Lai, Hongyi Jin, Bohan Hou, Mengdi Wu, Yixin Dong, Anthony Yip, Zihao Ye, Songting Wang, Wenqin Yang, Xupeng Miao, Tianqi Chen, Zhihao Jia

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigez une usine massive et à grande vitesse qui construit des structures complexes (comme des modèles d'IA). Dans la manière actuelle de faire les choses, chaque étape du processus de construction est gérée par une équipe spécialisée différente.

L'Ancienne Méthode : L'Usine « Stop-and-Go »
Actuellement, la plupart des systèmes d'IA fonctionnent comme une usine où l'Équipe A construit un mur, puis crie « Terminé ! » et s'arrête. Le gestionnaire de l'usine (le système d'exploitation de l'ordinateur) doit tout interrompre, vérifier la paperasse, puis appeler l'Équipe B pour peindre le mur. Une fois que l'Équipe B a fini, elle s'arrête et le gestionnaire appelle l'Équipe C pour installer les fenêtres.

Cela crée beaucoup de temps perdu :

  1. Le signal « Stop » : Chaque fois qu'une équipe termine, il y a une pause obligatoire pour s'assurer que tout le monde est prêt pour l'équipe suivante. C'est comme un feu rouge à chaque intersection.
  2. Le travail inutile du gestionnaire : Le gestionnaire passe trop de temps à courir d'une équipe à l'autre, distribuant de nouvelles instructions, au lieu de laisser les équipes travailler.
  3. Pas de chevauchement : Même si l'Équipe B n'a besoin que d'une petite partie du mur que l'Équipe A vient de terminer, l'Équipe B doit attendre que le mur entier soit construit avant de pouvoir commencer. Elle ne peut pas commencer à peindre la première brique pendant que le reste du mur est encore en cours de construction.

La Nouvelle Méthode : MPK (Mirage Persistent Kernel)
L'article présente MPK, qui consiste à transformer cette usine en une ligne d'assemblage unique, continue et super efficace, dirigée par une seule équipe géante et auto-gérée.

Voici comment MPK change la donne, en utilisant des analogies simples :

1. « Le Grand Noyau Unique » (La Méga-Usine)

Au lieu d'appeler différentes équipes une par une, MPK lance une seule équipe massive qui reste sur le chantier du début à la fin. Cette équipe ne s'arrête pas entre les étapes. Elle n'attend pas qu'un gestionnaire lui dise quoi faire ensuite ; elle continue simplement d'avancer.

  • Le bénéfice : Cela élimine les délais de type « stop-and-go ». C'est comme un train qui ne s'arrête jamais en gare pour changer de locomotive ; il continue simplement sa route.

2. « La Carte au Niveau SM » (Le Plan Détaillé)

L'article introduit une nouvelle façon de dessiner le plan, appelée tGraph.

  • Ancien plan : « Construire le Mur A, puis Peindre le Mur A. » (Trop vaste et vague).
  • Plan MPK : « L'Ouvrier 1 construit la Brique 1, l'Ouvrier 2 construit la Brique 2, l'Ouvrier 3 peint la Brique 1 pendant que l'Ouvrier 4 construit la Brique 3. »
  • La magie : MPK décompose le travail jusqu'au niveau des ouvriers individuels (appelés SM ou Streaming Multiprocessors). Il sait exactement quel ouvrier a besoin de quelle pièce de donnée et quand. Cela permet à différents ouvriers de faire des tâches différentes (comme construire et peindre) en même temps, tant qu'ils ne se gênent pas les uns les autres.

3. « Le Runtime Auto-Piloté » (Le Contremaître Intelligent)

À l'intérieur de cette grande équipe, il y a un système intelligent et auto-géré (le In-Kernel Runtime).

  • Pas d'intermédiaire : Au lieu d'un gestionnaire à l'extérieur de l'usine qui crie des instructions, les ouvriers se parlent directement.
  • Juste-à-temps vs Prêt à l'emploi :
    • Si une tâche est complexe et dépend de choses imprévisibles (comme la longueur d'une phrase dans un chat), le système attend que l'étape précédente soit réellement terminée avant de commencer la suivante (Just-in-Time).
    • Si une tâche est prévisible, le système la prépare et l'organise avant même que l'étape précédente ne soit terminée (Ahead-of-Time).
  • Le résultat : Les ouvriers ne restent jamais inactifs à attendre des instructions. Ils sont toujours occupés.

4. « La Mémoire Partagée par Pages » (La Boîte à Outils Partagée)

Dans l'ancienne usine, chaque équipe avait sa propre boîte à outils verrouillée. Si l'Équipe A avait besoin d'un marteau, elle devait attendre que l'Équipe B finisse et remette le marteau en place.

  • La solution de MPK : Ils utilisent une « Mémoire Partagée par Pages ». Imaginez une immense boîte à outils partagée où les outils sont organisés en petites pages mobiles. Dès qu'un ouvrier a fini d'utiliser un outil, il le remet sur l'étagère, et l'ouvrier suivant peut immédiatement s'en saisir. Cela permet aux ouvriers de récupérer le matériel pour leur prochain travail tout en terminant leur travail actuel.

Pourquoi est-ce important ?

L'article a testé ce système sur des modèles de langage étendus (les cerveaux derrière les chatbots d'IA) en utilisant des GPU NVIDIA puissants.

  • Vitesse : MPK a rendu l'IA 1,7 fois plus rapide que les meilleurs systèmes existants dans certains cas.
  • Latence : Il a réduit le temps nécessaire pour générer un seul mot de texte, se rapprochant très près des limites physiques du matériel.
  • Facilité d'utilisation : Le meilleur dans tout ça ? Vous n'avez pas besoin d'être un expert en usine pour l'utiliser. Vous pouvez prendre un modèle d'IA standard (écrit en PyTorch) et le « MPK-ifier » avec seulement quelques lignes de code. Le système comprend automatiquement comment décomposer le travail et gérer les ouvriers.

En résumé :
MPK prend une usine chaotique où les équipes s'arrêtent et redémarrent constamment, et la transforme en une ligne d'assemblage fluide, continue et auto-gérée. En décomposant le travail en les plus petites pièces possibles et en laissant les ouvriers se coordonner directement, il élimine tout le temps perdu, rendant l'inférence de l'IA nettement plus rapide et plus efficace.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →