AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices
Dit artikel introduceert AHASD, een asynchrone heterogene mobiele architectie op taakniveau die NPU-PIM-samenwerking benut met nieuwe besturingsmechanismen om tot 4,2 hogere doorvoer en 5,6 betere energie-efficiëntie te bereiken voor speculatieve decoding in grote taalmodellen in vergelijking met bestaande basismethoden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een lang verhaal te schrijven, maar je hebt een strikte regel: je moet een zeer wijze, trage en dure redacteur (het Doelmodel) om de handtekening vragen voor elk enkel woord dat je schrijft, voordat je het volgende woord mag schrijven. Dit maakt het schrijven ongelooflijk traag.
Om het tempo op te voeren, huur je een snelle, energieke assistent (het Conceptmodel) in om de volgende paar woorden voor je te raden. Je schrijft deze gokken op, waarna de wijze redacteur ze allemaal in één keer controleert. Als de gokken goed zijn, behoud je ze en ga je verder. Als ze slecht zijn, gooi je ze weg en begin je opnieuw. Dit heet Speculatieve Decoding.
Echter, op een mobiele telefoon heeft dit proces twee grote problemen:
- Het "Wachtspel": Soms raadt de assistent 2 woorden, soms 20. Als de assistent traag is, zit de redacteur inactief te wachten. Als de assistent snel is, zit de redacteur inactief te wachten op de volgende batch. Ze houden voortdurend elkaars hand vast, wachtend op elkaar om klaar te zijn, wat tijd kost.
- Het "Slechte Gok" Probleem: Soms wordt de assistent te zelfverzekerd en raadt een heel alinea onzin omdat de context lastig is. De redacteur moet het hele ding verwerpen, waardoor alle energie die de assistent heeft gestoken in het raden, verloren gaat.
Het artikel introduceert AHASD, een nieuw systeem dat deze problemen op mobiele telefoons oplost met behulp van een speciaal type computerchip genaamd PIM (Processing-in-Memory) en een standaard AI-chip genaamd een NPU.
Hier is hoe AHASD werkt, met eenvoudige analogieën:
1. De "Niet-gesynchroniseerde Dans" (Asynchrone uitvoering op taalniveau)
In oude systemen moesten de assistent en de redacteur in perfecte synchronie dansen. Als de assistent stopte, stopte de redacteur.
AHASD breekt de keten. Het laat de assistent (die draait op de geheugenchip, PIM) en de redacteur (die draait op de processor, NPU) onafhankelijk van elkaar werken.
- De Analogie: Stel je een fabrieksassemblagelijn voor. In plaats van dat de arbeider wacht tot de machine klaar is voordat hij de volgende stap start, pakt de arbeider voortdurend nieuwe onderdelen uit een bak (de wachtrij) en werkt eraan terwijl de machine nog steeds de vorige batch verwerkt. Ze wachten niet op elkaar; ze houden de lijn gewoon in beweging. Dit elimineert de "dode tijd" waarin één apparaat niets doet.
2. De "Zekerheidsradar" (Entropie-geschiedenisbewust raden)
De assistent wordt soms te zelfverzekerd en begint wild te raden wanneer hij voorzichtig zou moeten zijn.
AHASD geeft de assistent een "Zekerheidsradar". Hij kijkt naar de geschiedenis van zijn recente gokken.
- De Analogie: Denk aan een weerman. Als hij de laatste drie dagen ongelijk heeft gehad over regen, voorspelt hij geen regen voor de volgende dag, zelfs niet als de wolken er hetzelfde uitzien. Op dezelfde manier, als de gokken van de assistent een lage "zekerheid" hebben (hoge entropie), zegt het systeem tegen hem: "Stop met vooruit raden! Wacht tot de redacteur het huidige woord bevestigt voordat je het volgende woord raadt." Dit voorkomt dat de assistent energie verspilt aan gokken die zeker weggegooid zullen worden.
3. De "Slimme Timer" (Tijdbewuste voorverificatie)
Soms is de assistent klaar met zijn werk, maar is de redacteur nog druk. De assistent zou kunnen beginnen met opnieuw raden, maar als hij te veel raadt, kan het zijn dat de redacteur geen werk meer heeft om te controleren en inactief blijft zitten.
AHASD gebruikt een "Slimme Timer" om precies te bepalen wanneer de assistent moet pauzeren en een snelle "mini-check" (voorverificatie) zelf moet uitvoeren.
- De Analogie: Stel je een chef-kok (de assistent) voor die groenten snijdt terwijl een sous-chef (de redacteur) een saus kookt. De chef weet precies hoe lang de saus zal duren. Als de chef ziet dat de saus over 5 seconden klaar is, stopt de chef met snijden en doet hij een snelle smaaktest (voorverificatie) op de groenten om zeker te weten dat ze klaar zijn. Dit zorgt ervoor dat de sous-chef op het exacte moment dat de saus klaar is, verse groenten heeft klaarliggen, zodat de sous-chef nooit hoeft te staan en te wachten.
De Resultaten
De auteurs bouwden een simulatie van dit systeem op een mobiele telefoonchip. Ze ontdekten dat:
- Snelheid: Het tot 4,2 keer sneller is dan het gebruik van alleen een standaard grafische kaart (GPU) en 1,5 keer sneller dan eerdere pogingen om mobiele chips te combineren met geheugenverwerking.
- Batterijduur: Het is tot 5,6 keer energiezuiniger dan een standaard GPU en 1,24 keer beter dan het vorige beste mobiele systeem.
- Kosten: Al deze nieuwe, fancy functies nemen slechts ongeveer 3% van de extra ruimte op de geheugenchip in beslag, wat een zeer kleine prijs is voor zo'n grote snelheidswinst.
Kortom, AHASD is alsof je de AI van je telefoon een team van werknemers geeft die stoppen met op elkaar wachten, hun eigen zekerheid controleren voordat ze raden, en hun pauzes perfect timen om het werk soepel te laten stromen zonder batterijvermogen te verspillen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.