← Nieuwste papers
💬 NLP

Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference

Ada-MK is een nieuw optimalisatiekader dat runtime dynamische planning elimineert en het gebruik van gedeeld geheugen reduceert door middel van DAG-gebaseerde zoekopdrachten en geheugensplitsing tijdens het compileren, waardoor de eerste industriële implementatie van MegaKernels in commerciële online advertentiesystemen mogelijk wordt om een doorvoerverhoging van tot 50,2% ten opzichte van vLLM op NVIDIA-GPU's te bereiken.

Oorspronkelijke auteurs: Wenxin Dong, Mingqing Hu, Guanghui Yu, Qiang Fu, Peng Xu, Hui Xu, Yue Xing, Xuewu Jiao, Shuanglong Li, Lin Liu

Gepubliceerd 2026-05-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wenxin Dong, Mingqing Hu, Guanghui Yu, Qiang Fu, Peng Xu, Hui Xu, Yue Xing, Xuewu Jiao, Shuanglong Li, Lin Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een snelle bezorgdienst runt voor een enorme online winkel (zoals een zoekmachine of een advertentieplatform). Elke keer als een klant een vraag stelt, moet je systeem een antwoord woord voor woord genereren. In de wereld van Large Language Models (LLMs) heet dit "inference".

Het probleem is dat voor elk gegenereerd woord, je computer duizenden kleine instructies naar zijn grafische kaart (GPU) moet sturen. Het is alsof een bezorger bij het postkantoor moet stoppen, een pakketje moet ophalen, naar een magazijn moet rijden, het moet afleveren, terug moet rijden en dit duizenden keren moet herhalen voor slechts één zin. Deze "stop-en-ga"-overhead verspillen een enorme hoeveelheid tijd—ongeveer 15% van de totale reistijd gaat alleen maar zitten in deze kleine stops, niet in het daadwerkelijk leveren van de goederen.

Het Grote Idee: De "MegaKernel"
Om dit op te lossen, bedachten onderzoekers een concept genaamd een MegaKernel. In plaats van bij elke kleine taak bij het postkantoor te stoppen, stel je je een super-efficiënte vrachtwagen voor die aan het begin alles wat hij nodig heeft ophaalt, de hele route zonder te stoppen aflegt en alles aan het einde aflevert. Het voegt al die kleine stops samen tot één grote, continue reis. Dit elimineert de "stop-en-ga"-vertraging.

Er is echter een addertje onder het gras. Het specifieke type vrachtwagen (GPU) dat door het bedrijf wordt gebruikt (NVIDIA Ada/L20) is kleiner en heeft minder opslagruimte in de cabine dan de nieuwere, chiquerere vrachtwagens (Hopper/Blackwell).

  • Oude Oplossing 1 (Handmatig afgesteld): Experts bouwden handmatig een aangepaste vrachtwagen voor deze specifieke kleine cabine. Het was snel, maar als je de lading (het AI-model) of de weg (de hardware) veranderde, ging de vrachtwagen kapot. Het was niet verplaatsbaar.
  • Oude Oplossing 2 (Automatisch afgesteld): Ze probeerden een vrachtwagen te bouwen die automatisch zijn laadruimte onderweg kon aanpassen. Maar de bestuurder moest constant een kaart raadplegen en beslissingen nemen tijdens het rijden ("Is het rek vol? Moet ik stoppen?"). Deze constante beslissingen vertraagden de vrachtwagen, wat onacceptabel is wanneer je binnen milliseconden moet leveren.

De Nieuwe Oplossing: Ada-MK
De auteurs van dit artikel creëerden Ada-MK, een nieuw systeem dat deze problemen oplost voor de kleinere "Ada"-vrachtwagens. Hier is hoe ze dit deden, met behulp van eenvoudige analogieën:

1. De "Slimme Inpak"-strategie (Adaptief Gedeeld Geheugen)

De kleine vrachtwagen heeft een klein opbergvak (Shared Memory). Als je te veel probeert in te pakken, blijft de vrachtwagen steken.

  • De Innovatie: In plaats van te proberen een hele koffer in het kleine vak te proppen, sneden ze de koffer in tweeën (K-dimension splitsing). Ze pakken alleen de helft van de spullen in, leveren deze af, en pakken dan de andere helft.
  • Het Resultaat: Dit verlaagt de piekopslag die nodig is met 50%. Ze bedachten ook hoe ze de lege ruimte direct na het afleveren van één pakket opnieuw konden gebruiken om het volgende op te halen, zodat de vrachtwagen nooit stilzit en wacht op ruimte.

2. De "Vooraf Uitgestippelde Route" (Offline DAG-zoekopdracht)

De oude "automatisch afgestelde" vrachtwagens namen beslissingen tijdens het rijden, wat file veroorzaakte (branch penalties).

  • De Innovatie: Het team gebruikte een krachtige computer om miljoenen mogelijke routes te simuleren voordat de vrachtwagen de garage ooit verliet. Ze legden elke bocht en stop vast in een gedetailleerd diagram (een DAG).
  • Het Resultaat: Zodra de beste route was gevonden, "verhardden" ze deze. De bestuurder hoeft niet meer na te denken of een kaart te raadplegen tijdens het rijden; ze volgen gewoon het vooraf uitgestippelde pad perfect. Dit verwijdert alle vertragingen door besluitvorming, waardoor de rit ongelooflijk soepel en snel wordt.

3. Het "Hybride Vloot"-concept (Heterogene Motor)

Ze realiseerden zich dat voor sommige delen van de reis (het laden van een enorme batch pakketten aan het begin, "Prefill" genoemd), de oude standaardvrachtwagens eigenlijk beter waren. Maar voor de uiteindelijke levering (woord voor woord genereren, "Decode" genoemd), was hun nieuwe MegaKernel-vrachtwagen superieur.

  • De Innovatie: Ze bouwden een hybride systeem. Ze hielden de standaardvrachtwagens voor het zware tillen aan het begin, maar wisselden naadloos over naar hun nieuwe MegaKernel-vrachtwagen voor de fase van de uiteindelijke levering.
  • Het Resultaat: Je krijgt het beste van twee werelden: hoge snelheid voor het begin en ultra-lage latentie voor het einde, zonder dat je het hele bezorgnetwerk hoeft te herbouwen.

De Real-world Impact

Het team testte dit op Baidu's commerciële online advertentiesysteem.

  • Snelheid: In scenario's waar snelheid cruciaal is (kleine batches, korte antwoorden), was hun systeem tot 23,6% sneller dan de standaard industriële tools en 50,2% sneller dan een populaire open-source tool genaamd vLLM.
  • Betrouwbaarheid: Het werkte consistent over verschillende soorten AI-modellen en taken.
  • Eerste in zijn soort: Dit is de eerste keer dat een "MegaKernel" succesvol is ingezet in een echt, live commercieel advertentiesysteem.

Samenvattend
Het artikel beschrijft een manier om AI-chatbots en ad-systemen veel sneller te maken op specifieke, kleinere computerchips. Ze deden dit door data efficiënter in te pakken, de hele bezorgroute van tevoren te plannen zodat de bestuurder nooit hoeft na te denken, en hun nieuwe snelle bezorgmethode te combineren met bestaande tools. Het resultaat is een systeem dat antwoorden aanzienlijk sneller levert, vooral wanneer veel gebruikers één voor één vragen stellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →