← Nieuwste papers
🤖 machine learning

CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning

Het artikel introduceert CUDA-L2, een systeem dat grote taalmodellen en reinforcement learning gebruikt om Half-precision General Matrix Multiply (HGEMM) kernels automatisch te optimaliseren, waarbij significante prestatiewinsten wordt behaald ten opzichte van gevestigde baselines zoals torch.matmul, cuBLAS en cuBLASLt door systematisch configuratieruimtes te verkennen op schalen die onpraktisch zijn voor menselijke ingenieurs.

Oorspronkelijke auteurs: Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

Gepubliceerd 2026-07-14
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je het perfecte gebak probeert te bakken. Jarenlang hebben de beste bakkers ter wereld (menselijke experts) het recept voor een specifiek type gebak genaamd "Matrix Vermenigvuldiging" verfijnd. Dit gebak is het geheime ingrediënt in bijna elke moderne AI-hersenen. Deze bakkers hebben jarenlang gewerkt om het sneller te maken, maar ze liepen tegen een muur aan: telkens wanneer de grootte van het gebak veranderde (van een klein cupcake tot een enorme bruidstaart), moesten ze weer helemaal opnieuw beginnen, en de trucjes die voor de ene maat werkten, faalden vaak bij een andere maat. Het is alsof je een kleine lepel probeert te gebruiken om een enorme soep te eten; het gereedschap past gewoon niet.

Maak kennis met CUDA-L2, een nieuw team van "AI-bakkers" gebouwd door een superintelligente taalmodel te combineren met een videogame-achtig leersysteem genaamd Reinforcement Learning (RL). In plaats van een mens te vragen om het beste recept te raden, speelt CUDA-L2 een enorm spel van "proberen, falen, leren en opnieuw proberen".

De Grote Ontdekking: De AI Bakt Snellere Cakes

De belangrijkste bevinding van dit paper is dat CUDA-L2 automatisch deze matrixvermenigvuldigings-"recepten" (kernels genoemd) kan ontwerpen en ze sneller kan bakken dan de beste door mensen gemaakte recepten die momenteel beschikbaar zijn.

De onderzoekers hebben dit getest op 1.000 verschillende cake-groottes (combinaties van dimensies M, N en K variërend van 64 tot 16.384). Deze maten dekken exact de dimensies die worden gebruikt in beroemde open-source AI-modellen zoals Qwen, Llama en DeepSeek.

Hier is hoeveel sneller de AI bakt vergeleken met de huidige kampioenen, gemeten op een A100 GPU:

  • Vs. Het Standaard Gereedschap (torch.matmul): In een continue baksessie (offline modus) is CUDA-L2 22,0% sneller. In een drukke keuken waar bestellingen willekeurig binnenkomen (server modus), is het 28,7% sneller.
  • Vs. De Gouden Standaard (cuBLAS): Zelfs tegenover NVIDIA's eigen hooggeoptimaliseerde bibliotheek wint CUDA-L2. Het is 19,2% sneller in continue modus en 26,0% sneller in de drukke server modus.
  • Vs. De "Auto-Optimizer" (cuBLASLt-AutoTuning): Dit is de belangrijkste vergelijking. cuBLASLt-AutoTuning is een tool die tot wel 100 verschillende recepten probeert om het beste te vinden. CUDA-L2 verslaat het nog steeds met 11,4% in continue modus en 15,9% in server modus.

Het paper is zeer zeker over deze cijfers omdat ze direct zijn gemeten door de code duizenden keren uit te voeren, en niet alleen zijn geraden of gesimuleerd.

Wat de AI NIET Deed

Het is belangrijk om te weten wat dit systeem niet doet. Het paper stelt expliciet dat de huidige versie van CUDA-L2 beperkt is tot de A100 architectuur. Echter, het framework is ontworpen voor brede toepasbaarheid, en het team werkt er actief aan om het uit te breiden naar andere GPU-architecturen, waaronder oudere Ampere-chips zoals de RTX 3090, evenals nieuwere Hopper (bijv. H100) en Blackwell (bijv. B200) chips. Het paper betoogt ook tegen het idee dat menselijke experts matrixvermenigvuldiging hebben "opgelost"; het feit dat de AI betere recepten heeft gevonden, bewijst dat menselijke afstemming verre van perfect is.

Hoe de AI Leerde Beter te Bakken

De AI gokte niet zomaar; het leerde specifieke, slimme trucs die zelfs menselijke experts zouden kunnen missen omdat ze te druk zijn om elke enkele mogelijkheid te controleren.

  1. De Cake Opvullen (Padding): Stel je voor dat je een cake hebt die 8.192 inch breed is, maar je bakvorm past alleen perfect als de breedte deelbaar is door 160. 8.192 is niet deelbaar door 160. Een mens zou zeggen: "Ik gebruik een vormmaat van 128 omdat die past." Maar de AI zei: "Ik voeg een klein beetje extra beslag toe (padding) om de cake 8.320 inch breed te maken, zodat ik de 160-inch vorm kan gebruiken." Dit kleine beetje extra werk maakte het hele proces eigenlijk sneller.
  2. De Ping-Pong Strategie: Normaal gesproken laad je ingrediënten, mengt ze, en laadt dan de volgende lading. De AI bedacht een "ping-pong" methode: terwijl de mixer werkt aan Batch A, is de assistent al bezig met het laden van de ingrediënten voor Batch B. Dit betekent dat de mixer nooit hoeft te wachten.
  3. De "Gestaffelde" Levering: Soms realiseerde de AI zich dat het tegelijkertijd vragen om twee ingrediënten (A en B) een verkeersopstopping in de keuken veroorzaakt. In plaats daarvan vroeg het om ingrediënt A, begon met mengen, en vroeg daarna pas om ingrediënt B. Dit hield de keuken soepel draaiende.
  4. De Juiste Vorm Kiezen: De AI leerde dat voor kleine cakes, kleine vormen het beste werken. Maar voor gigantische cakes zijn veel grotere vormen nodig. Het ontdekte de perfecte maat voor elke enkele cake-dimensie, een taak die een mens een leven lang zou kosten om voor 1.000 verschillende maten te berekenen.

Het Verschil tussen "Server" en "Offline"

Het paper merkte ook iets interessants op over de keukenomgeving.

  • Offline Modus: Stel je een fabriekslijn voor waar cakes één na de ander worden gebakken zonder te stoppen. De oven blijft heet en de arbeiders zitten in een ritme. Hier was de AI 11,4% tot 22,0% sneller dan de concurrentie.
  • Server Modus: Stel je een druk restaurant voor waar bestellingen op willekeurige tijden binnenkomen. De oven kan afkoelen tussen de bestellingen door, en de werkers moeten weer opwarmen. In deze "echte wereld" chaos werd het voordeel van de AI zelfs groter, waarbij het de concurrentie versloeg met 15,9% tot 28,7%. Het paper suggereert dat dit komt omdat de recepten van de AI beter zijn in het afhandelen van deze "cold starts" en onvoorspelbare pauzes.

De Conclusie

Het paper concludeert dat zelfs voor de meest kritieke, zwaar geoptimaliseerde taken zoals matrixvermenigvuldiging, LLM-gestuurde Reinforcement Learning betere oplossingen kan vinden dan mensen door een ruimte van mogelijkheden te verkennen die te groot is voor een persoon om te controleren. Hoewel deze specifieke versie van CUDA-L2 momenteel beperkt is tot A100 GPU's, is het framework ontworpen om in de toekomst naar andere chips te worden uitgebreid.

Kortom: de AI heeft niet alleen het recept aangepast; het heeft geheel nieuwe manieren ontdekt om de cake te bakken die mensen niet hadden bedacht, wat bewijst dat zelfs in een veld dat zo volwassen is als GPU-optimalisatie, er nog steeds veel ruimte is voor verbetering.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →