← Nieuwste papers
🤖 machine learning

MPK: A Compiler and Runtime for Mega-Kernelizing Tensor Programs

Mirage Persistent Kernel (MPK) is een nieuw compiler- en runtime-systeem dat multi-GPU tensorprogramma's automatisch transformeert naar een enkele hoogperformante mega-kernel met behulp van SM-niveau graafrepresentaties om cross-operator pipelining en fijne granuliteit in de overlap van berekening en communicatie mogelijk te maken, waardoor de LLM-inferentielatentie aanzienlijk wordt verminderd in vergelijking met traditionele kernel-per-operator-benaderingen.

Oorspronkelijke auteurs: Xinhao Cheng, Zhihao Zhang, Yu Zhou, Jianan Ji, Jinchen Jiang, Zepeng Zhao, Ziruo Xiao, Zihao Ye, Yingyi Huang, Ruihang Lai, Hongyi Jin, Bohan Hou, Mengdi Wu, Yixin Dong, Anthony Yip, Zihao Ye, Songti
Gepubliceerd 2026-06-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xinhao Cheng, Zhihao Zhang, Yu Zhou, Jianan Ji, Jinchen Jiang, Zepeng Zhao, Ziruo Xiao, Zihao Ye, Yingyi Huang, Ruihang Lai, Hongyi Jin, Bohan Hou, Mengdi Wu, Yixin Dong, Anthony Yip, Zihao Ye, Songting Wang, Wenqin Yang, Xupeng Miao, Tianqi Chen, Zhihao Jia

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, razendsnelle fabriek runt die complexe structuren bouwt (zoals AI-modellen). In de huidige manier van werken wordt elke stap van het constructieproces afgehandeld door een ander gespecialiseerd team.

De Oude Manier: De "Stop-en-Go" Fabriek
Op dit moment werken de meeste AI-systemen als een fabriek waar Team A een muur bouwt, en dan "Gereed!" roept en stopt. De fabrieksmanager (het besturingssysteem van de computer) moet dan alles pauzeren, de papierwinkel controleren en vervolgens Team B oproepen om de muur te schilderen. Zodra Team B klaar is, stoppen ze en roept de manager Team C op om de ramen te installeren.

Dit creëert veel verloren tijd:

  1. Het "Stop"-signaal: Elke keer dat een team klaar is, is er een verplichte pauze om te controleren of iedereen klaar is voor de volgende stap. Dit is als een rood stoplicht bij elk kruispunt.
  2. Het drukbezette werk van de manager: De manager brengt te veel tijd door met heen en weer rennen tussen de teams om nieuwe instructies uit te delen, in plaats van de teams het werk te laten doen.
  3. Geen overlap: Zelfs als Team B slechts een klein deel van de muur nodig heeft dat Team A net heeft voltooid, moet Team B wachten tot de volledige muur is gebouwd voordat ze kunnen beginnen. Ze kunnen niet beginnen met het schilderen van de eerste baksteen terwijl de rest van de muur nog wordt gebouwd.

De Nieuwe Manier: MPK (Mirage Persistent Kernel)
Het paper introduceert MPK, wat het veranderen van die fabriek in één enkele, continue, superefficiënte assemblageband is die wordt gerund door één groot, zelfsturend team.

Hier is hoe MPK het spel verandert, met behulp van eenvoudige analogieën:

1. "Eén Grote Kernel" (De Mega-Fabriek)

In plaats van teams één voor één aan te roepen, lanceert MPK één enkel, enorm team dat van begin tot eind aan de slag blijft. Dit team stopt niet tussen de stappen door. Ze wachten niet tot een manager hen vertelt wat ze de volgende stap moeten doen; ze blijven gewoon doorgaan.

  • Het voordeel: Het elimineert de "stop-en-go" vertragingen. Het is als een trein die nooit stopt bij stations om van locomotief te wisselen; hij blijft gewoon doorrollen.

2. De "SM-Level Map" (De Gedetailleerde Blauwdruk)

Het paper introduceert een nieuwe manier om de blauwdruk te tekenen, genaamd een tGraph.

  • Oude Blauwdruk: "Bouw Muur A, daarna Schilder Muur A." (Te groot en vaag).
  • MPK Blauwdruk: "Werker 1 bouwt Baksteen 1, Werker 2 bouwt Baksteen 2, Werker 3 schildert Baksteen 1 terwijl Werker 4 Baksteen 3 bouwt."
  • De Magie: MPK breekt het werk af tot het niveau van individuele werkers (genaamd SM's of Streaming Multiprocessors). Het weet precies welke werker welk stukje data nodig heeft en wanneer. Dit maakt het mogelijk dat verschillende werkers verschillende taken uitvoeren (zoals bouwen en schilderen) op exact hetzelfde moment, zolang ze elkaar maar niet in de weg zitten.

3. De "Zelfrijdende" Runtime (De Slimme Voorman)

Binnen dit enorme team is er een slim, zelfsturend systeem (de In-Kernel Runtime).

  • Geen Tussenpersoon: In plaats van een manager buiten de fabriek die instructies schreeuwt, praten de werkers rechtstreeks met elkaar.
  • Just-in-Time versus Ready-to-Go:
    • Als een taak lastig is en afhankelijk is van onvoorspelbare zaken (zoals hoe lang een zin in een chat is), wacht het systeem tot de vorige stap daadwerkelijk voltooid is voordat de volgende stap begint (Just-in-Time).
    • Als een taak voorspelbaar is, zet het systeem de taken op een rij en bereidt ze voor voordat de vorige stap zelfs maar klaar is (Ahead-of-Time).
  • Het Resultaat: De werkers zitten nooit stil te wachten op instructies. Ze zijn altijd bezig.

4. De "Paged Shared Memory" (De Gedeelde Gereedschapskist)

In de oude fabriek had elk team hun eigen afgesloten gereedschapskist. Als Team A een hamer nodig had, moesten ze wachten tot Team B klaar was en de hamer teruglegde.

  • De MPK-oplossing: Ze gebruiken een "Paged Shared Memory". Stel je een enorme, gedeelde gereedschapskist voor waarin gereedschappen zijn georganiseerd in kleine, verplaatsbare pagina's. Zodra een werker klaar is met een gereedschap, legt hij het terug op de plank, zodat de volgende werker het onmiddellijk kan pakken. Dit stelt werkers in staat om materialen voor hun volgende klus te pakken terwijl ze nog bezig zijn met hun huidige klus.

Waarom is dit belangrijk?

Het paper heeft dit systeem getest op Large Language Models (de hersens achter AI-chatbots) met behulp van krachtige NVIDIA GPU's.

  • Snelheid: MPK maakte de AI in sommige gevallen 1,7 keer sneller dan de beste bestaande systemen.
  • Latentie: Het verminderde de tijd die nodig is om een enkel woord tekst te genereren, waardoor het zeer dicht bij de fysieke limieten van de hardware kwam.
  • Gebruiksgemak: Het beste deel? Je hoeft geen expert in fabrieken te zijn om het te gebruiken. Je kunt een standaard AI-model (geschreven in PyTorch) nemen en dit "MPK-ify-en" met slechts een paar regels code. Het systeem begrijpt automatisch hoe het het werk moet opdelen en de werkers moet beheren.

Samenvattend:
MPK neemt een chaotische fabriek waar teams constant stoppen en starten, en verandert dit in een soepele, continue, zelfsturende assemblageband. Door het werk af te breken tot de kleinste mogelijke stukjes en de werkers direct te laten coördineren, wordt alle verloren tijd geëlimineerd, wat AI-inferentie aanzienlijk sneller en efficiënter maakt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →