← Nieuwste papers
💬 NLP

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

Het artikel introduceert WIDE, het eerste end-to-end differentieerbare framework dat token-niveau dynamische breedtepruning voor LLM's mogelijk maakt door middel van een fijmazige selectie van attention heads en FFN-kanalen, gekoppeld aan een gespecialiseerd kernel co-design om significante end-to-end inferentieversnelling te bereiken terwijl de hoge nauwkeurigheid behouden blijft.

Oorspronkelijke auteurs: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

Gepubliceerd 2026-07-31
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een gigantisch, ongelooflijk slim robotbrein te draaien op een piepklein, op batterijen werkend apparaat. Dit robotbrein is een Large Language Model (LLM), een type kunstmatige intelligentie dat verhalen kan schrijven, wiskundige problemen kan oplossen en kan chatten als een mens. Maar er is een addertje onder het gras: deze hersenen zijn enorm. Ze zijn zo groot en hongerig naar stroom dat ze meestal supercomputers nodig hebben om te draaien, wat ze traag en duur maakt om te gebruiken op je telefoon of laptop.

Om dit op te lossen, proberen wetenschappers deze hersenen te "prunen" (snoeien). Denk bij snoeien aan het bijhouden van een enorme, overwoekerde heg. Je knipt de takken weg die niet veel werk verrichten om de plant kleiner en sneller te maken. Een lange tijd was de beste manier om dit te doen door hele secties van de heg permanent af te knippen, ongeacht wat de plant die dag aan het doen was. Maar dit is een beetje onhandig; soms knip je een tak weg die eigenlijk nodig was voor een specifieke taak, waardoor de robot vergeetachtig wordt. Recentelijk zijn er slimmere methoden uitgevonden die de robot laten beslissen terwijl hij nadenkt welke delen hij moet gebruiken. Echter, deze slimme methoden waren nog steeds een beetje te grof—ze gebruikten ofwel een hele sectie, of ze sloegen het geheel over, alsof je besluit een hele kamer te gebruiken of het hele huis leeg laat.

Deze paper introduceert een nieuw systeem genaamd WIDE (Width-based Inference with Dynamic Execution). Het is alsof je de robot een superprecieze dimmer geeft voor elke enkele gloeilamp in zijn brein. In plaats van hele kamers aan of uit te zetten, laat WIDE de robot dynamisch beslissen, voor elk woord dat hij verwerkt, precies welke kleine groepen neuronen (de cellen van het brein) moeten oplichten en welke donker moeten blijven. De onderzoekers hebben een speciale "verkeerregelaar" (een router) gebouwd die leert om deze razendsnelle beslissingen te nemen. Ze hebben ook een nieuwe manier ontworend waarop de hardware van de computer deze beslissingen kan afhandelen zonder in de war te raken of te vertragen. Het resultaat? De robot blijft net zo slim als voorheen, maar hij werkt veel sneller en verbruikt minder energie, zelfs wanneer ze de helft van de capaciteit van zijn brein hebben weggehaald.

Het Probleen: De "Alles-of-Niets"-valstrik

Stel je voor dat je een chef-kok bent die een enorme keuken runt. Je hebt honderden chefs (neuronen) die samenwerken om een maaltijd te bereiden. In de oude dagen, als je tijd wilde besparen, zou je misschien de helft van het keukenpersoneel permanent ontslaan. Dit werkt prima als je altijd hetzelfde simpele gerecht kookt, maar als je plotseling een complexe taart moet bakken, heb je misschien net de enige bakker ontslagen die je nodig had. Dit is wat er gebeurt bij statische pruning: het model wordt één keer en voor altijd bijgesneden, ongeacht de specifieke vraag die het beantwoordt.

Toen kwam dynamische pruning, wat leek op het inhuren van een manager die de chefs kon vertellen: "Hé, voor deze specifieke bestelling is alleen de grillstation nodig; de bakkerij kan pauze houden." Dit was beter, maar de manager was nog steeds een beetje onhandig. Ze zouden zeggen: "Sla de hele bakkerij over," zelfs als de bakkerij slechts twee ovens van de tien nodig had. Het was een "alles-of-niets"-beslissing voor grote delen van de keuken.

Het probleem is dat moderne AI-modellen zo complex zijn dat het overslaan van een heel blok vaak nuttige informatie weggooit, wat de kwaliteit van het antwoord schaadt. Bovendien, als de manager elke seconde het schema blijft veranderen, raakt het keukenpersoneel in de war en wordt de werkelijke koksnelheid niet veel sneller door alle schakeloverhead.

De Oplossing: WIDE's "Dimmer"

De auteurs van deze paper, werkzaam bij het Ningbo Institute of Digital Twin en LMU München, kwamen met WIDE. In plaats van hele afdelingen te ontslaan of hele kamers over te slaan, laat WIDE het model beslissen, voor elk woord (token) dat het verwerkt, precies welke kleine groepen neuronen geactiveerd moeten worden.

Denk aan het brein van het model als een gigantisch rooster van lichtschakelaars.

  • Oude Dynamische Methoden: "Zet de hele linker vleugel van het huis uit."
  • WIDE: "Voor dit specifieke woord, zet de lichten in de keuken aan, maar alleen de lampen boven het fornuis en de koelkast. Laat de rest van de keuken donker."

WIDE doet dit door een lichtgewicht "router" (een kleine beslisser) aan elke laag van het model te koppelen. Deze router kijkt naar het huidige woord en vraagt: "Heb ik deze groep aandachtskoppen (de delen die naar andere woorden kijken) nodig?" en "Heb ik deze groep FFN-kanalen (de delen die de betekenis verwerken) nodig?". Het maakt een binaire keuze: gebruik deze groep of sla deze over.

Cruciaal is dat WIDE niet stopt bij het nemen van de beslissing; het lost ook het hardware-hoofdpijnprobleem op. Meestal, als je een computer vertelt om willekeurige delen van een berekening over te slaan, raakt de computer in de knoop met het vinden van de juiste data. WIDE gebruikt een slimme truc genaamd mask reordering. Stel je voor dat je een rommelige stapel post hebt waarbij sommige brieven voor bezorging zijn en andere afval. In plaats van het afval weg te gooien en dan pas te proberen de post te sorteren, schudt WIDE de stapel eerst zodat alle "bewaar"-brieven netjes in een blok bovenaan liggen en alle "afval"-brieven onderaan. Hierdoor kan de computer het "bewaar"-blok zeer efficiënt verwerken zonder telkens te hoeven stoppen om elke individuele brief te controleren.

Wat ze vonden: Snelheid en Slimheid

De onderzoekers testten WIDE op populaire AI-modellen zoals Llama 3.1 (8 miljard parameters) en Llama 3.2 (3 miljard parameters). Ze vergeleken het met de beste bestaande methoden voor zowel statische als dynamische pruning.

Hier is wat de cijfers suggereren:

  • Slimmere Pruning: Wanneer ze 50% van de capaciteit van het model wegknipt (een zeer agressieve trim), behield WIDE de intelligentie van het model veel beter dan iedereen anders. Bijvoorbeeld, op het Llama 3.1-model behield WIDE 86,42% van de oorspronkelijke nauwkeurigheid na pruning, terwijl de op één na beste dynamische methode (SkipGPT) slechts 59,42% behield. Zelfs zonder extra fine-tuning was WIDE al beter dan de beste statische methoden.
  • Snelheid in de echte wereld: De paper mat hoe veel sneller het model daadwerkelijk draaide. Voor de "prefill"-fase (het lezen van een lange prompt) was WIDE 1,68 keer sneller dan het originele model. Voor de "decode"-fase (het genereren van het antwoord woord voor woord) was het 1,55 keer sneller.
  • Magie op Kernel-niveau: Als je alleen naar de wiskundige berekeningen kijkt (zonder andere overheaden), was de versnelling nog spectaculender, oplopend tot 1,98x voor prefill en 4,95x voor decoding. Dit suggereert dat de bottleneck de inefficiënte manier was waarop eerdere methoden het "overslaan" afhandelden, en dat W Ends' nieuwe hardware-ontwerp dat heeft opgelost.

De auteurs ontdekten ook dat het model leerde om zeer strategisch te zijn. Het sloeg niet zomaar willekeurige delen over; het leerde de "saaie" woorden (zoals "de" of "een") over te slaan en de "belangrijke" woorden (zoals "rennen" of "racebaan") te behouden. In één test sloeg het model 66% van het aandachtswerk over, maar slechts 28% van het verwerkingswerk, wat aantoont dat het precies wist waar het energie kon besparen.

De Kern van het Verhaal

WIDE suggereert dat de toekomst van efficiënte AI niet alleen gaat over het model kleiner maken, maar over het model slimmer maken in hoe het zijn resterende onderdelen gebruikt. Door over te stappen van "sla de hele kamer over" naar "dim de specifieke lichten", en door de keuken opnieuw te ontwerpen om deze dimmers efficiënt te verwerken, hebben de auteurs een framework gecreëerd dat grote AI-modellen aanzienlijk sneller en efficiënter maakt zonder ze vergeetachtig te maken.

Hoewel de resultaten veelbelovend zijn, merkt de paper op dat dit een specifieke oplossing is voor GPU-hardware (de chips in computers) en steunt het op een tweetraps trainingsproces waarbij het model eerst leert om beslissingen te nemen en vervolgens een snelle opfrisbeurt krijgt om eventueel verloren nauwkeurigheid terug te winnen. Het is een belangrijke stap voorwaarts in het toegankelijk maken van krachtige AI op alledaagse apparaten, en bewijst dat je geen gigantisch brein nodig hebt om slim te zijn—je moet alleen weten welke delen van je brein je op het juiste moment moet gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →