← Nieuwste papers
🤖 machine learning

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

Dit artikel stelt een nieuw drielaags matrixopslagformaat en een hybride SpMM-kernel voor die gezamenlijk sparse en CUDA-cores benutten om matig ongestructureerde sparse LLM-inferentie op moderne GPU's mogelijk te maken, waarbij de eerste kernel-niveau versnelling ten opzichte van dense matrixvermenigvuldiging wordt bereikt en state-of-the-art methoden zoals SpInfer en FlashLLM wordt overtroffen.

Oorspronkelijke auteurs: Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

Gepubliceerd 2026-07-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek met boeken hebt (een Large Language Model) die verhalen kan schrijven, vragen kan beantwoorden en kan programmeren. Om deze boeken te laten werken, moet een supersnelle robot (de GPU) miljoenen pagina's met getallen (gewichten) doorlezen om het volgende woord te bepalen. Het probleem? De robot is zo druk met lezen dat hij moe wordt en het duur is om te laten draaien.

Wetenschappers probeerden een slimme truc: ze gooiden de saaie, onbelangrijke pagina's weg om de bibliotheek lichter te maken. Dit wordt "pruning" genoemd. Maar er is een addertje onder het gras: als je te veel pagina's weggooit, wordt het verhaal vreemd en maakt het geen zin meer. Het ideale evenwicht is het bewaren van ongeveer de helft van de pagina's (50% sparsity).

Het Grote Probleem
Je zou denken dat een lichtere bibliotheek sneller te lezen is, toch? Niet dus. De leesmachine van de robot (de GPU) is gebouwd om dichte, volledige pagina's heel snel te lezen. Wanneer de pagina's verspreid zijn en er stukjes missen (unstructured sparsity), raakt de robot in de war. Hij besteedt zoveel tijd aan het zoeken naar de ontbrekende pagina's en het organiseren van de snippers dat hij eigenlijk langzamer beweegt dan wanneer hij gewoon de zware, volledige bibliotheek zou lezen. Bestaande tools voor dit "verspreide" lezen waren ofwel te traag, of vereisten dat de robot extra wiskunde uitvoerde die de snelheidswinst tenietdeed.

De Nieuwe Oplossing: Een Drielagig Archiefsysteem
De auteurs van dit paper hebben een gloednieuw archiefsysteem gebouwd om de robot deze verspreide pagina's efficiënt te laten lezen. Ze noemen het een "drielagig" formaat, en het werkt als een supergeorganiseerde bibliothecaris:

  1. De "Sparse-TC" Laag (De VIP-sectie): De bibliothecaris pakt eerst de pagina's die toevallig in een net, vooraf goedgekeurd patroon passen (zoals elke 4e pagina met 2 belangrijke aantekeningen). Deze gaan rechtstreeks naar de snelste, gespecialiseerde leesarmen van de robot (Sparse Tensor Cores). Geen zoekwerk nodig!
  2. De "Slot-Filling" Laag (Het Puzzelstukje): Wat gebeurt er met de extra aantekeningen die niet in het VIP-patroon pasten? In plaats van ze weg te gooien of een rommelige lijst te maken, duwt de bibliothecaris ze in de lege gaten die de VIP-pagina's hebben achtergelaten. Om bij te houden waar ze heen gingen zonder een enorme adresbundel te schrijven, gebruiken ze een "Parallel Differential Distance" code. Denk aan een schattenkaart die simpelweg zegt: "De volgende aanwijzing is 3 stappen naar rechts," in plaats van telkens het volledige adres op te schrijven. Dit bespaart een enorme hoeveelheid ruimte en is snel te decoderen.
  3. De "Residual" Laag (De Rommellade): Een heel klein aantal aantekeningen (minder dan 1%) is te vreemd om ergens in te passen. Deze gaan in een standaard, ouderwetse archiefkast (CSR-formaat). Omdat er zo weinig van zijn, vindt de robot het niet erg om deze lade te controleren.

De Super-Pipeline
De echte magie zit niet alleen in het archiefsysteem; het gaat erom hoe de robot werkt terwijl hij leest. De auteurs hebben een workflow ontworpen waarbij de robot drie dingen tegelijkertijd doet:

  • Hij pakt de volgende brok pagina's uit de grote geheugenplank (Global Memory).
  • Hij decodeert de "3 stappen naar rechts" schattenkaart-aanwijzingen (met standaard cores).
  • Hij verwerkt de getallen voor de VIP-pagina's (met de snelle gespecialiseerde cores).

Door deze taken te overlappen, zit de robot nooit stil te wachten op data. Het is als een chef die tegelijkertijd groenten snijdt, de pan roert en de tafel dekt, in plaats van één ding tegelijk te doen.

De Resultaten: Sneller Dan Voorheen
Toen ze dit testten op een moderne, hogesnelheidsrobot (een NVIDIA H100 GPU met 80 GB geheugen), waren de resultaten indrukwekkend.

  • Snelheid: Hun methode was de eerste die daadwerkelijk sneller was dan het lezen van de zware, volledige bibliotheek. Het draaide tot wel 1,64 keer sneller dan de vorige beste tool (SpInfer) op kernel-niveau.
  • End-to-End: Voor het hele proces van tekst genereren, was het tot wel 1,41 keer sneller dan FlashLLM.
  • Geheugen: Het bespaarde ook ongeveer 21,4% van de geheugenruimte in vergelijking met het lezen van de volledige bibliotheek.

Wat het Niet Doet
De auteurs zijn zorgvuldig in het benoemen van wat het niet is. Het werkt niet het best wanneer de bibliotheek bijna leeg is (hoge sparsity van 90%+); in die gevallen zijn de oude methoden nog steeds beter. Ook is het geoptimaliseerd voor de "decode"-fase (waarbij de robot één woord tegelijk schrijft), wat de meest voorkomende taak is. Wanneer de robot een grote blok tekst tegelijk moet lezen (de "prefill"-fase), kan deze nieuwe methode iets langzamer zijn dan de standaard zware-leesinstrumenten, maar dat is een specifiek scenario dat ze nu niet proberen op te lossen.

Kortom, door de verspreide pagina's te organiseren in een slim, drielagig systeem en de robot constant bezig te houden, hebben ze AI-chatbots sneller en goedkoper kunnen maken zonder ze dommer te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →