← Nieuwste papers
🤖 machine learning

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

Dit artikel introduceert LlamaWeb, een WebGPU-backend voor llama.cpp die geheugenefficiënte, prestatieportabele en multi-precisie LLM-inferentie in browsers realiseert door gebruik te maken van statisch geheugenplanning, een instelbare kernelbibliotheek en getemplateerde GPU-kernels, wat resulteert in een aanzienlijk verminderd geheugengebruik en een verhoogde decode-doorvoer ten opzichte van bestaande frameworks op diverse hardware.

Oorspronkelijke auteurs: Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

Gepubliceerd 2026-05-21
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente AI-assistent (een Large Language Model, of LLM) direct in je webbrowser wilt draaien, zoals Chrome of Safari. Meestal zijn deze AI-breuken zo groot en geheugenhongerig dat ze enorme, dure servers nodig hebben om te draaien. Het doel van dit paper is om die gigantische hersenen te verkleinen, zodat ze in je laptop of telefoon passen zonder je browser te laten crashen, terwijl het snel en privé blijft.

De auteurs hebben een nieuw hulpmiddel gebouwd dat LlamaWeb heet. Denk hierbij aan een gespecialiseerde "vertaler" die de populaire AI-engine llama.cpp in staat stelt de taal van webbrowsers te spreken (specifiek een technologie genaamd WebGPU).

Hier is hoe ze de drie grootste problemen oplosten, met behulp van alledaagse analogieën:

1. Het Geheugenprobleem: "De Verhuiswagen vs. De Inpaklijst"

Het Probleem: Bestaande browser-AI-tools waren als een chaotisch verhuisbedrijf. Ze bleven onderweg nieuwe dozen (geheugen) grijpen, soms te veel, waardoor de browser crashte of tot een slakkegang vertraagde. Ze maakten ook onnodige kopieën van het meubilair (modelgewichten) voordat ze het verplaatsten.

De LlamaWeb-oplossing:

  • Statische Planning: In plaats van onderweg dozen te grijpen, bekijkt LlamaWeb het hele huis voordat de truck arriveert en berekent precies hoeveel dozen het nodig heeft. Het pakt alles in een enkele, vooraf op maat gemaakte "geheugenaar" direct aan het begin. Geen extra dozen meer grijpen halverwege de verhuizing.
  • Direct Laden: In plaats van het meubilair uit te laden in de oprit (CPU-geheugen) en het vervolgens in de truck (GPU-geheugen) te laden, laadt LlamaWeb het meubilair direct vanuit het magazijn in de truck.
  • Het Resultaat: Ze ontdekten dat LlamaWeb 29–33% minder geheugen gebruikt dan zijn concurrenten. Het is alsof je een hele woonkamer in een busje past die eerder slechts een bank kon bevatten.

2. Het Prestatieprobleem: "De Universele Afstandsbediening vs. De Op Maat Gemaakte Afstandsbediening"

Het Probleem: Het internet zit vol met verschillende computers: sommige hebben NVIDIA-graphicskaarten, andere Apple-chips, sommige zitten in telefoons en sommige in laptops. Bestaande tools waren als een "universele afstandsbediening" die probeerde op alles te werken, maar geen gebruik maakte van de speciale knoppen op een specifieke tv, wat resulteerde in trage prestaties.

De LlamaWeb-oplossing:

  • Instelbare Kernen: LlamaWeb is als een slimme afstandsbediening die zichzelf kan herprogrammeren. Bij het opstarten controleert het op welke soort "tv" (hardware) het draait. Als het op een krachtige NVIDIA-kaart draait, gebruikt het hoogwaardige "subgroep"-functies. Als het op een telefoon draait, schakelt het over naar een efficiëntere modus.
  • Het Resultaat: Op vier verschillende soorten graphicskaarten was LlamaWeb 45–69% sneller in het genereren van tekst (decoderen) dan andere browser-tools. Het is niet zomaar een universele afstandsbediening; het is een afstandsbediening die precies weet hoe het het beste beeld van je specifieke tv haalt.

3. Het Formaatprobleem: "Het Zwitsers Zakmes"

Het Probleem: AI-ontwikkelaars bedenken voortdurend nieuwe manieren om AI-modellen te comprimeren (zogenaamde "quantisatie") om ze kleiner te maken. Sommige zijn 4-bit, sommige 8-bit, sommige 1-bit. Oude tools waren als een schroevendraaier die alleen op één type schroef paste. Als er een nieuwe schroef uitkwam, was het hulpmiddel nutteloos.

De LlamaWeb-oplossing:

  • Gegoten Kernen: LlamaWeb is gebouwd als een Zwitsers zakmes. Het heeft een "sjabloon"-systeem dat direct het gereedschapshoofd kan vervangen om bij elke schroef (quantisatieformaat) te passen, zonder dat de hele mes opnieuw gebouwd hoeft te worden.
  • Het Resultaat: Het ondersteunt 23 verschillende gewichtsformaten, terwijl concurrenten slechts 6 of 7 ondersteunden. Dit betekent dat als een ontwikkelaar morgen een nieuwe, super-efficiënte compressiemethode bedenkt, LlamaWeb dit waarschijnlijk direct kan draaien zonder een software-update nodig te hebben.

De Grote Duidelijke Resultaten

Het team testte dit op 16 verschillende apparaten van 8 verschillende fabrikanten (waaronder NVIDIA, Apple, Intel, AMD en mobiele chips).

  • Geheugen: Het bespaarde een enorme hoeveelheid RAM, waardoor crashes op apparaten met beperkt geheugen (zoals iPhones) werden voorkomen.
  • Snelheid: Het was aanzienlijk sneller dan andere browsergebaseerde AI-tools.
  • Veelzijdigheid: Het kan bijna elk model draaien dat door de llama.cpp-gemeenschap wordt ondersteund, wat een enorme bibliotheek is van meer dan 177.000 modellen.

Een Voorbehoud: Hoewel LlamaWeb een kampioen is in het genereren van tekst woord voor woord (de "decode"-fase), is het momenteel iets trager in het lezen van de initiële prompt (de "prefill"-fase) in vergelijking met sommige concurrenten. De auteurs merken echter op dat naarmate browsertechnologie verbetert, dit gat naar verwachting zal sluiten.

Kortom, LlamaWeb is een nieuwe engine die het mogelijk, privé en efficiënt maakt om krachtige AI in je browser te draaien, zodat je computer niet smelt terwijl je chat met een AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →