← Nieuwste papers
🤖 machine learning

Efficient On-Device Diffusion LLM Inference with Mobile NPU

Dit artikel introduceert llada.cpp, het eerste NPU-bewuste inferentiekader dat on-device diffusie-LLM's versnelt door gebruik te maken van multi-block speculatieve decodering, dual-path progressieve revisie en een swap-geoptimaliseerde geheugenruntime om de beperkingen van mobiele hardware te overwinnen en een latentiereductie tot 42x te bereiken in vergelijking met CPU-baselines.

Oorspronkelijke auteurs: Tuowei Wang, Yanfan Sun, Ju Ren

Gepubliceerd 2026-06-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tuowei Wang, Yanfan Sun, Ju Ren

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je smartphone een drukke keuken is, en de chef (de AI) probeert een verhaal te schrijven.

Het Probleem: De Langzame Chef die één woord tegelijk schrijft

Traditioneel schrijven AI-modellen (zoals die in je telefoon) verhalen één woord tegelijk. Het is alsof een chef eerst een ui moet snijden, dan moet wachten tot het fornuis warm is, dan een wortel moet snijden, en dan weer moet wachten. Zelfs als het fornuis krachtig is, wordt de chef gedwongen langzaam te werken omdat hij slechts één ding tegelijk kan doen. Dit maakt het genereren van lange teksten op een telefoon traag en verbruikt veel batterij.

Het Nieuwe Idee: De "Diffusion" Chef

Een nieuw type AI, genaamd een Diffusion Large Language Model (dLLM), probeert anders te zijn. In plaats van één woord tegelijk te schrijven, begint het met een hele pagina aan "ruis" (willekeurige onzin) en probeert het dit in één keer op te schonen tot een echte zin. Het is alsof een chef een hele stapel ingrediënten op het aanrecht gooit en probeert deze gelijktijdig te arrangeren tot een perfecte salade.

Dit klinkt geweldig omdat het de super-snelle "NPU" (Neural Processing Unit) van de telefoon — een gespecialiseerde chip ontworpen voor massaal, parallel rekenwerk — veel beter benut. Er is echter een addertje onder het gras:

  1. Het "Lege Pan" Probleem: Naarmate de chef dichter bij het voltooien van de salade komt, hoeven er minder ingrediënten aangepast te worden. De krachtige NPU eindigt met wachten omdat er niet genoeg werk is om te doen. De snelheid wordt zo verspild.
  2. Het "Oeps, Ik Verander van Gedachte" Probleem: Soms arrangeert de chef een woord, maar realiseert hij zich dan: "Wacht, dit past niet bij de volgende zin." De AI moet dan teruggaan om het te herstellen. Dit doen op de snelle NPU is rommelig en vertraagt alles.
  3. Het "Kleine Koelkast" Probleem: De NPU heeft een zeer kleine, speciale "koelkast" (geheugen) waar hij de ingrediënten klaarhoudt om te koken. Als het recept te groot is, moet de chef constant ingrediënten in en uit de koelkast wisselen, wat veel tijd kost en energie verspilt.

De Oplossing: llada.cpp

De auteurs hebben een nieuw systeem gebouwd genaamd llada.cpp om deze drie problemen op te lossen. Zie dit als een nieuwe set keukenregels waarmee de chef de krachtige NPU efficiënt kan gebruiken.

1. Multi-Block Speculative Decoding: "Vooruitkijken naar het Volgende Recept"

De Analogie: Stel je voor dat de chef de huidige salade aan het afmaken is (Blok A), maar de NPU raakt verveeld omdat er nog maar één blaadje te snijden is. In plaats van te wachten, zegt het systeem: "Hé, laten we de ingrediënten voor de volgende salade (Blok B) alvast gaan voorbereiden, voor het geval dat."
Hoe het werkt: Zelfs als het huidige blok nog niet 100% voltooid is, begint het systeem stiekem alvast aan toekomstige woorden te werken. Dit houdt de krachtige NPU bezig en volledig benut, zodat hij niet stilzit. Als de toekomstige woorden kloppen, is dat geweldig! Zo niet, dan gooit het systeem ze gewoon weg en gaat het verder.

2. Dual-Path Progressive Revision: "De Snelle Baan vs. De Langzame Baan"

De Analogie: De NPU is een Formule 1-raceauto: hij is ongelooflijk snel, maar kan niet goed scherpe bochten maken. De CPU is een betrouwbare, langzame SUV: hij is erg goed in het maken van kleine, lastige aanpassingen.
Hoe het werkt: Wanneer de AI zeker is over een woord, houdt de NPU het vast. Maar als de AI onzeker is en een woord moet "herzien", stopt llada.cpp de snelle NPU-raceauto niet. In plaats daarvan stuurt het de "reparatiewerkzaamheden" stilletjes naar de tragere, flexibelere CPU-SUV op de achtergrond. De NPU blijft razendsnel vooruit racen met de nieuwe woorden, terwijl de CPU rustig de oude woorden corrigeert.

3. Swap-Optimized Memory Runtime: "De Georganiseerde Voorraadkast"

De Analogie: De kleine koelkast van de NPU is zo klein dat als je ingrediënten willekeurig erin gooit, je de hele tijd de deur moet openen en sluiten om dingen te wisselen.
Hoe het werkt: llada.cpp werkt als een supergeorganiseerde voorraadkastbeheerder. Het kijkt van tevoren naar het hele recept en bepaalt precies welke ingrediënten nu in de koelkast moeten liggen en welke kunnen wachten. Het bereidt ook de volgende batch ingrediënten voor terwijl de chef momenteel aan het koken is, zodat de deur nooit lang dicht blijft. Dit elimineert de "wachttijd" die wordt veroorzaakt door het verplaatsen van gegevens.

De Resultaten

De auteurs hebben dit getest op echte smartphones (zoals de OnePlus Ace5 Pro).

  • Snelheid: Ze ontdekten dat llada.cpp de AI 17 tot 42 keer sneller maakte dan de oude methode op een telefoon.
  • Kwaliteit: De verhalen die geschreven werden, waren net zo goed als voorheen; de snelheid ging niet ten koste van de nauwkeurigheid.
  • Batterij: Omdat de NPU het werk snel afhandelde en niet onnodig inactief was, verbruikte de telefoon in totaal minder energie.

Kortom, llada.cpp is een slimme manager die de AI van de telefoon leert hoe hij zijn super-snelle brein (de NPU) kan gebruiken zonder in de file te komen staan, waardoor mobiele AI direct en responsief aanvoelt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →