← Nieuwste papers
💬 NLP

Efficient INT8 Inference of Small NLP Models on Server CPUs with PyTorch Native Stack

Dit artikel presenteert een native PyTorch-implementatie van SmoothQuant voor INT8-inferentie van kleine NLP-modellen op server-CPU's, waarbij tot 5,8x doorvoersnelheidwinst wordt behaald met verwaarloosbaar nauwkeurigheidsverlies door grafiek-niveau fusie en geoptimaliseerde kernelselectie, waarbij de oplossing inmiddels is upstreamed naar PyTorch en TorchAO.

Oorspronkelijke auteurs: Weiwen Xia, Yuxin Cui, E Cao

Gepubliceerd 2026-08-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Weiwen Xia, Yuxin Cui, E Cao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie vindt een stille revolutie plaats naast de luidruchtige koppen over enorme, alwetende chatbots. Terwijl de publieke aandacht gericht is op gigantische modellen die poëzie kunnen schrijven of complexe logische puzzels kunnen oplossen, vertrouwen de motoren die het dagelijkse internetverkeer aandrijven — zoekresultaten, productaanbevelingen en spamfilters — op kleinere, gespecialiseerde programma's. Deze programma's, vaak gebaseerd op een familie van ontwerpen die bekend staat als BERT, zijn de werkpaarden van de digitale economie. Ze draaien op standaard computerservers, het soort dat in datacenters over de hele wereld wordt aangetroffen, in plaats van op gespecialiseerde, dure grafische kaarten. Voor deze systemen doen snelheid en kosten er meer toe dan brute omvang. De uitdaging voor ingenieurs is lang geweest hoe ze deze modellen sneller kunnen laten draaien zonder de nauwkeurigheid op te offeren die ze nuttig houdt. Een krachtige manier om dit te doen is door de wiskunde die de computer uitvoert te vereenvoudigen, waarbij een fractie van de precisie wordt ingeruild voor een enorme winst in snelheid, een techniek die bekend staat als kwantisatie.

Een team van onderzoekers bij Intel Corporation heeft nu een brug gebouwd die deze kleinere taalmodellen direct binnen de meest populaire softwaretools die vandaag de dag door ontwikkelaars worden gebruikt, met deze vereenvoudigde wiskunde kan laten draaien. Hun werk richt zich op een specifieke methode genaamd SmoothQuant, die een model voorbereidt om de vereenvoudigde wiskunde te verwerken zonder het vermogen om taal te begrijpen te verliezen. Door deze methode te integreren in de standaard PyTorch-softwarestack, hebben zij een pad gecreëerd dat geen speciale externe tools of complexe herschrijvingen vereist. Het resultaat is een systeem dat een standaard taalmodel kan nemen en het aanzienlijk sneller kan laten draaien op moderne serverprocessoren, terwijl de antwoorden die het geeft net zo correct blijven als voorheen.

De onderzoekers begonnen met een veelvoorkomend probleem: zelfs hoewel moderne computerprocessors ingebouwde instructies hebben om vereenvoudigde wiskunde snel af te handelen, wisten de softwaretools die worden gebruikt om deze modellen te bouwen vaak niet efficiënt gebruik te maken van deze instructies. Wanneer een model werd voorbereid voor snelheid, bleef de software vaak steken op de stappen die nodig waren om gegevens te converteren of vereenvoudigde berekeningen te beheren, waardoor de snelheid die de hardware beloofde, werd verspild. Om dit op te lossen, combineerde het team drie verschillende stukken technologie tot één naadloze workflow. Eerst gebruikten ze een tool genaamd TorchAO om het model voor te bereiden, waarbij de gegevens werden gladgestreken zodat ze veilig vereenvoudigd konden worden. Vervolgens gebruikten ze een compiler genaamd TorchInductor om de gehele stroom van de berekeningen van het model te bekijken en deze samen te voegen, waarbij onnodige stappen werden verwijderd die normaal gesproken de boel vertragen. Ten slotte leerden ze het systeem om de absoluut snelste manier te kiezen om de kernwiskundige operaties uit te voeren, afhankelijk van of de computerprocessor een nieuwer model is met geavanceerde mogelijkheden of een ouder, betrouwbaar model dat nog steeds wijdverspreid in gebruik is.

Om hun creatie te testen, voerde het team experimenten uit op twee verschillende generaties Intel-serverprocessors. Ze testten het systeem op drie verschillende typen taalmodellen, variërend van grote, complexe versies tot kleinere, compactere versies. De resultaten waren opmerkelijk. Op de nieuwere processors draaide het systeem tot wel 5,8 keer sneller dan de standaard, niet-geoptimaliseerde versie. Op de oudere processors slaagde het er nog steeds in om bijna drie keer zo snel te draaien. Misschien wel het belangrijkste: de snelheid ging niet ten koste van de kwaliteit. Wanneer de onderzoekers de modellen testten op real-world taken, zoals het beantwoorden van vragen uit een tekst of het beoordelen van het sentiment van een zin, kregen de vereenvoudigde modellen net zo vaak de juiste antwoorden als de originele, tragere versies. In veel gevallen was het verschil in nauwkeurigheid zo klein dat het zelfs niet gemeten kon worden.

Het team keek ook nauwgezet naar waarom de snelheidswinsten optraden, met behulp van een methode die de grenzen in kaart brengt van hoe snel een computer gegevens kan verplaatsen versus hoe snel hij kan rekenen. Ze ontdekten dat voor de nieuwere processors de snelheid werd beperkt door hoe snel gegevens konden worden verplaatst, terwijl voor de oudere processors de snelheid werd beperkt door hoe snel de wiskunde kon worden uitgevoerd. Hun systeem slaagde erin om beide deze grenzen effectief te navigeren. Ze ontdekten dat door de gegevens vooraf voor te bereiden en de noodzaak weg te nemen voor de computer om te stoppen en informatie te reorganiseren terwijl hij aan het werk was, ze het volledige potentieel van de hardware konden ontsluiten. Ze vonden zelfs een slimme workaround voor oudere processors die een specifieke instructie voor vereenvoudigde wiskunde misten, waardoor ze een andere, beschikbare instructie konden gebruiken om vergelijkbare resultaten te behalen.

Dit werk is belangrijk omdat het een aanzienlijke barrière wegneemt voor bedrijven die deze modellen efficiënt willen inzetten. Voorheen betekende het verkrijgen van dit niveau van prestaties vaak het gebruik van gespecialiseerde tools die moeilijk te onderhouden waren of vereisten dat men de standaard softwareomgeving verliet. Nu kunnen ontwikkelaars simpelweg de tools gebruiken die ze al kennen om dezelfde hoge prestaties te krijgen. De onderzoekers hebben hun code gedeeld met de bredere gemeenschap, wat betekent dat iedereen die deze standaardtools gebruikt, nu direct toegang heeft tot deze snelheidsboost. De studie bevestigt dat het mogelijk is om de werkpaarden van het internet sneller en efficiënter te maken zonder de fundamentele aard van de modellen of de software waarop ze draaien te veranderen. Door zorgvuldig te optimaliseren hoe de computer de wiskunde afhandelt, heeft het team aangetoond dat de toekomst van efficiënte kunstmatige intelligentie op standaardservers niet alleen een mogelijkheid is, maar een realiteit die vandaag de dag al klaar is voor gebruik.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →