KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators
KForge is een cross-platform framework dat gebruikmaakt van twee samenwerkende LLM-agenten om iteratief hoogperformante kernels voor AI-accelerators te genereren en te verfijnen, waarbij significante verbeteringen in doorvoer wordt bereikt op zowel NVIDIA B200 als Intel Arc B580 hardware vergeleken met bestaande handmatig getunede en compiler-geoptimaliseerde baselines.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, razendsnelle bezorgdienst runt. Je wagenpark bestaat niet uit slechts één type vrachtwagen; het is een mix van piepkleine scooters voor de stadse straatjes, zware vrachtwagens voor de snelwegen en elektrische busjes voor milieuzones. Elk voertuig is perfect voor een specifieke taak, maar ze spreken allemaal een andere taal en hebben verschillende motorregels.
In de wereld van Kunstmatige Intelligentie (AI) is dit precies wat er vandaag de dag gebeurt. AI-systemen worden "agentic", wat betekent dat ze niet alleen een vraag beantwoorden, maar taken opdelen in stappen, tools gebruiken en coördineren met andere AI-agenten. Sommige stappen vereisen zware wiskunde (zoals een vrachtwagen), terwijl andere stappen snelle, lichte denkwerk vereisen (zoals een scooter). Om het hele systeem snel te laten verlopen, moet je elke stap op de specifieke computerchip (accelerator) draaien die daar het beste bij past.
Het Probleem: De Vertaalnachtmerrie
Het probleem is dat het schrijven van deze "motorkode" (genaamd kernels) voor deze verschillende chips ongelooflijk moeilijk is. Het is also kind met het schrijven van een handleiding voor een Ferrari, een tractor en een motorfiets tegelijkertijd, maar de handleidingen zijn in verschillende talen geschreven (CUDA, Metal, SYCL, etc.).
- De Oude Manier: Menselijke experts besteden jaren aan het handmatig schrijven en verfijnen van deze code. Het is traag, duur en moeilijk op te schalen.
- Het Nieuwe Probleem: Zelfs wanneer we proberen AI te gebruiken om deze code te schrijven, faalt het vaak. De AI kan code schrijven die er juist uitziet, maar de motor doet crashen, of de AI kan code schrijven die werkt op een NVIDIA-chip, maar volledig faalt op een Intel-chip.
De Oplossing: KForge (Het AI-monteursteam)
Het paper introduceert KForge, een nieuw systeem dat fungeert als een team van twee gespecialiseerde AI-monteurs die samenwerken om deze motoren automatisch te repareren en te optimaliseren.
In plaats van één AI die alles probeert te doen, splitst KForge de taak op:
- De Generator (De Bouwer): Deze AI schrijft de code. Als de code crasht of niet compileert, krijgt hij een "rood licht" en probeert hij het opnieuw, waarbij de fouten worden hersteld.
- De Analist (De Tuner): Zodra de code werkt, kijkt deze AI naar het "dashboard" (profiling data). Het ziet zaken als "deze motor verspilt brandstof" of "de wielen draaien te snel". Het geeft de Bouwer specifieke instructies over hoe de code aangepast kan worden om sneller te worden.
Ze werken in een lus: Bouwen → Testen → Analyseren → Bijstellen → Herhalen. Dit gaat door totdat de code niet alleen correct is, maar ook razendsnel.
De Resultaten: Twee Verschillende Races
De auteurs testten KForge in twee zeer verschillende scenario's om te zien hoe goed het werkt:
Race 1: De Zwaargewicht Kampioen (NVIDIA B200)
Hier moest KForge het opnemen tegen een codebase die door NVIDIA-engineers over vele jaren heen tot perfectie is gebracht (TensorRT-LLM). Het was alsof een rookie-monteur probeerde te winnen van een Formule 1-pitcrew.- Het Resultaat: KForge slaagde erin om een snelheidstoename van 2,12% uit te persen. In de wereld van high-performance computing is het verslaan van een kampioen met zelfs maar 1% een enorme prestatie. Het is alsof je een fractie van een seconde van een wereldrecord rondetijd afhaalt.
Race 2: Het Nieuwe Circuit (Intel Arc B580)
Hier was er geen "kampioen" om te verslaan. De hardware was nieuw en er was geen bestaande high-performance code om van te kopiëren. KForge moest de motor vanaf nul opbouwen.- Het Resultaat: KForge genereerde code die 5,13 keer sneller was dan de standaard, niet-geoptimaliseerde code die momenteel voor deze chip beschikbaar is. Het bracht in feits een nieuwe, krachtige motor tot leven waar voorheen alleen een trage, basisversie was.
Waarom dit ertoe doet
Het paper betoogt dat naarmate AI complexer wordt, we niet kunnen vertrouwen op mensen om handmatig code te schrijven voor elke nieuwe chip. KForge laat zien dat een AI-team kan:
- Code vertalen naar verschillende hardwaremerken (NVIDIA, Intel, Apple, AMD).
- Zijn eigen fouten herstellen.
- Leren van prestatiegegevens om in de loop van de tijd sneller te worden.
Kortom, KForge is een hulpmiddel dat helpt om AI-systemen efficiënt te laten draaien op elke computerchip, of die chip nu een goed afgestelde veteraan is of een gloednieuw model, door het moeilijke werk van het schrijven van de low-level motorkode te automatiseren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.