← Nieuwste papers
🤖 machine learning

NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching

NeuroPrefetcher is een opslagbewust LLM-inferentiesysteem dat significante snelheidsverbeteringen realiseert op geheugenbeperkte edge-apparaten door de temporele lokaliteit van MLP-neuronactiviteit te exploiteren om preventief alleen de noodzakelijke gewicht-delta's uit de opslag voor te laden, in plaats van te vertrouwen op reactieve demand paging.

Oorspronkelijke auteurs: Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo

Gepubliceerd 2026-08-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn de motoren achter moderne kunstmatige intelligentie, in staat om te schrijven, te redeneren en te vertalen met een vloeiendheid die ooit onmogelijk leek. Deze systemen werken door tekst woord voor woord te verwerken, waarbij ze het volgende woord in een sequentie voorspellen op basis van de enorme patronen die ze tijdens de training hebben geleerd. Om dit te doen, vertrouwen ze op enorme digitale bibliotheken van getallen, genaamd gewichten, die in het geheugen van de computer worden opgeslagen. Hoe groter en krachtiger het model, hoe meer geheugen het vereist. Er is echter een aanzienlijke kloof ontstaan: terwijl deze modellen exponentieel in omvang zijn gegroeid, heeft het beschikbare geheugen in draagbare apparaten zoals laptops, tablets en gespecialiseerde edge-computers die groei niet bijgehouden. Dit creëert een fundamenteel probleem voor het draaien van geavanceerde intelligentie buiten enorme datacentra. Wanneer een model te groot is om in het geheugen van een apparaat te passen, moet het systeem constant gegevens uitwisselen tussen het snelle geheugen en de tragere, grotere opslagschijf, een proces dat de prestaties meestal tot stilstand brengt.

Onderzoekers aan Kennesaw State University en Samsung hebben een nieuwe aanpak voor dit probleem ontwikkeld door een systeem te creëren genaamd NeuroPrefetcher, waarmee deze overgedimensioneerde modellen efficiënt kunnen draaien op apparaten met zeer beperkt geheugen. In plaats van te proberen het model te verkleinen of het te dwingen om te passen, accepteert hun systeem dat het model groter is dan het beschikbare geheugen en behandelt het de opslagschijf als een actief onderdeel van het berekeningsproces. De sleutel tot hun succes ligt in een eenvoudige observatie over hoe deze modellen denken. Wanneer het model één woord genereert, activeert het een specifieke set interne paden. Wanneer het het daaropvolgende woord genereert, gebruikt het bijna exact dezelfde paden opnieuw. De onderzoekers ontdekten dat tussen de 82 en 85 procent van de actieve paden hetzelfde blijft van het ene woord naar het volgende. Dit betekent dat voor het overgrote deel van het werk de benodigde gegevens al in het geheugen van het apparaat aanwezig zijn, wachtend om gebruikt te worden.

De innovatie van NeuroPrefetcher ligt in de manier waarop het de kleine hoeveelheid gegevens beheert die wel verandert. Traditionele systemen wachten tot het model een stuk gegevens nodig heeft voordat ze naar de opslagschijf gaan om het op te halen, een reactief proces dat ervoor zorgt dat de computer pauzeert en wacht. NeuroPrefetcher werkt anders door vooruit te kijken. Het gebruikt een kleine, gespecialiseerde voorspeller die het huidige woord analyseert en precies raadt welke nieuwe paden nodig zullen zijn voor het volgende woord. Omdat het weet wat er komt, kan het alleen de specifieke, ontbrekende stukjes gegevens van de opslagschijf ophalen terwijl de computer bezig is met het berekenen van het huidige woord. Dit verandert een chaotisch stop-en-go-proces in een soepele, continue stroom. Het systeem laadt in feite alleen de kleine fractie van de nieuwe informatie die nodig is voor, en negeert de enorme massa aan gegevens die al in het geheugen aanwezig is.

Om dit idee te testen, bouwde het team een volledig systeem en draaide het op een krachtig edge-apparaat dat bekend staat als de Jetson AGX Orin, dat over een unieke geheugenarchitectuur beschikt die gedeeld wordt tussen de processor en de grafische eenheid. Ze testten het systeem met grote taalmodellen zoals Mistral-7B en Llama-3-8B onder strikte geheugenlimieten, waarbij omstandigheden werden gesimuleerd waarin het model aanzienlijk groter was dan het beschikbare geheugen. In deze uitdagende omstandigheden presteerde de standaardmethode voor het draaien van deze modellen, die vertrouwt op het besturingssysteem voor het beheren van gegevensuitwisseling, slecht en liet het apparaat vaak vastlopen. In contrast hiermee hield NeuroPrefetcher het apparaat in beweging en bereikte een versnelling van bijna acht tot twaalf keer sneller dan de standaardmethode. Het systeem slaagde erin woorden te genereren met een snelheid van meer dan drie per seconde, terwijl de standaardaanpak moeite had om zelfs maar één woord per seconde te produceren.

De onderzoekers onderzochten ook hoe het systeem zich gedroeg wanneer het beschikbare geheugen veranderde. Ze ontdekten dat het systeem kon adapteren door meer van het werk van het model naar de opslagschijf te verschuiven wanneer het geheugen krap was, en meer werk terug te verschuiven naar het snelle geheugen wanneer er meer ruimte beschikbaar was. Zelfs in de meest beperkte geheugenomstandigheden behield het systeem een hoge prestatie omdat het de enorme dataoverdrachten vermeed die deze operaties gewoonlijk vertragen. In plaats van hele lagen van het "brein" van het model heen en weer te bewegen, verplaatste het slechts de kleine, veranderende segmenten van de gegevens. Deze aanpak bleek zo effectief dat het systeem de snelste optie bleef, zelfs in vergelijking met andere geavanceerde tools, waarvan er velen helemaal niet konden draaien onder deze specifieke beperkingen.

Een cruciaal onderdeel van dit werk was het waarborgen dat de snelheidswinsten niet ten koste gingen van de intelligentie. De onderzoekers maten de kwaliteit van de geproduceerde tekst door het systeem en vonden dat deze zeer dicht bij de kwaliteit van het volledige, ongecomprimeerde model bleef. Het systeem behield de nauwkeurigheid van de voorspellingen van het model en behield meer dan 90 procent van de oorspronkelijke prestaties, zelfs bij het gebruik van de meest agressieve geheugenbesparende instellingen. Dit bevestigde dat de strategie om alleen de noodzakelijke gegevens te verplaatsen, de capaciteit van het model om taal te begrijpen en te genereren niet aantastte. Het systeem leerde effectief de gegevens te negeren die niet nodig waren voor de onmiddellijke volgende stap, door zijn middelen alleen te richten op wat ertoe deed.

De studie benadrukt een verschuiving in hoe we kunnen nadenken over het draaien van kunstmatige intelligentie op alledaagse apparaten. Jarenlang was de oplossing voor het draaien van grote modellen op kleine hardware om de modellen kleiner te maken of ze te comprimeren, wat soms hun capaciteiten kan verminderen. NeuroPrefetcher suggereert een ander pad: houd het volledige model intact en beheer de beweging van de gegevens met extreme precisie. Door te voorspellen wat het model als volgende nodig heeft en alleen die specifieke verandering op te halen, verandert het systeem de opslagschijf van een flessenhals in een behulpzame partner. Deze aanpak maakt het mogelijk dat krachtige intelligentie werkt op apparaten die voorheen te klein waren om het te bevatten, wat de deur opent voor lokale uitvoering van geavanceerde AI zonder dat er een verbinding met een verre server nodig is. De resultaten laten zien dat met de juiste beheersing van de datastroom, de fysieke limieten van het geheugen kunnen worden overwonnen zonder de kracht van het model zelf op te offeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →