← Neueste Arbeiten
🤖 machine learning

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

Dieser Artikel stellt LlamaWeb vor, ein WebGPU-Backend für llama.cpp, das durch die Nutzung statischer Speicherplanung, einer einstellbaren Kernel-Bibliothek und templierter GPU-Kernels eine speichereffiziente, leistungstransportable und mehrpräzise LLM-Inferenz in Browsern ermöglicht und im Vergleich zu bestehenden Frameworks auf unterschiedlicher Hardware zu einer signifikant reduzierten Speichernutzung sowie einer erhöhten Decodierdurchsatzrate führt.

Ursprüngliche Autoren: Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

Veröffentlicht 2026-05-21
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten einen superintelligenten KI-Assistenten (ein Large Language Model, oder LLM) direkt in Ihrem Webbrowser ausführen, etwa in Chrome oder Safari. Normalerweise sind diese KI-Gehirne so riesig und speicherhungrig, dass sie massive, teure Server benötigen, um zu laufen. Das Ziel dieses Papers ist es, dieses riesige Gehirn so zu verkleinern, dass es in Ihren Laptop oder Ihr Smartphone passt, ohne Ihren Browser zum Absturz zu bringen, und dabei gleichzeitig Geschwindigkeit und Privatsphäre zu bewahren.

Die Autoren haben ein neues Werkzeug namens LlamaWeb entwickelt. Stellen Sie es sich als einen spezialisierten „Übersetzer" vor, der es der beliebten KI-Engine llama.cpp ermöglicht, die Sprache von Webbrowsern zu sprechen (insbesondere eine Technologie namens WebGPU).

Hier ist, wie sie die drei größten Probleme gelöst haben, unter Verwendung alltäglicher Analogien:

1. Das Speicherproblem: „Der Umzugswagen gegen die Packliste"

Das Problem: Bestehende Browser-KI-Tools waren wie eine chaotische Umzugsfirma. Sie griffen unterwegs ständig nach neuen Kartons (Speicher), manchmal zu vielen, was dazu führte, dass der Browser abstürzte oder sich auf ein Schleudertempo verlangsamte. Zudem fertigten sie unnötige Kopien der Möbel (Modellgewichte) an, bevor sie diese verfrachteten.

Die LlamaWeb-Lösung:

  • Statische Planung: Anstatt unterwegs Kartons zu ergattern, betrachtet LlamaWeb das gesamte Haus, bevor der LKW eintrifft, und berechnet genau, wie viele Kartons benötigt werden. Es packt alles in einen einzigen, vorab dimensionierten „Speicherbereich" (Memory Arena) direkt zu Beginn. Kein weiteres Ergattern von Kartons während des Umzugs mehr.
  • Direktes Laden: Anstatt die Möbel im Einfahrtsbereich (CPU-Speicher) auszuladen und dann in den LKW (GPU-Speicher) zu laden, lädt LlamaWeb die Möbel direkt vom Lagerhaus in den LKW.
  • Das Ergebnis: Sie stellten fest, dass LlamaWeb 29–33 % weniger Speicher verbraucht als seine Konkurrenten. Es ist, als würde man ein ganzes Wohnzimmer in einen Lieferwagen packen, der zuvor nur ein Sofa hätte aufnehmen können.

2. Das Leistungsproblem: „Die Universalfernbedienung gegen die maßgeschneiderte Fernbedienung"

Das Problem: Das Internet ist voller verschiedener Computer: Manche haben NVIDIA-Grafikkarten, manche Apple-Chips, manche sind in Smartphones und manche in Laptops. Bestehende Tools waren wie eine „Universalfernbedienung", die versuchte, mit allem zu funktionieren, aber keine der speziellen Tasten auf einem bestimmten Fernseher nutzte, was zu langsamer Leistung führte.

Die LlamaWeb-Lösung:

  • Anpassbare Kernel: LlamaWeb ist wie eine intelligente Fernbedienung, die sich selbst neu programmieren kann. Beim Start prüft sie, auf welchem „Fernseher" (Hardware) sie läuft. Befindet sie sich auf einer leistungsstarken NVIDIA-Karte, nutzt sie Hochgeschwindigkeits-„Subgroup"-Funktionen. Befindet sie sich auf einem Smartphone, wechselt sie in einen effizienteren Modus.
  • Das Ergebnis: Auf vier verschiedenen Arten von Grafikkarten war LlamaWeb beim Generieren von Text (Decodieren) 45–69 % schneller als andere Browser-Tools. Es ist nicht nur eine Universalfernbedienung; es ist eine Fernbedienung, die genau weiß, wie sie das beste Bild von Ihrem spezifischen Fernseher holt.

3. Das Formatproblem: „Das Schweizer Taschenmesser"

Das Problem: KI-Entwickler erfinden ständig neue Wege, KI-Modelle zu komprimieren (sogenannte „Quantisierung"), um sie kleiner zu machen. Manche sind 4-Bit, manche 8-Bit, manche 1-Bit. Alte Tools waren wie ein Schraubendreher, der nur auf eine bestimmte Schraubenart passte. Wenn eine neue Schraube herauskam, war das Werkzeug nutzlos.

Die LlamaWeb-Lösung:

  • Vorlagenbasierte Kernel: LlamaWeb ist wie ein Schweizer Taschenmesser aufgebaut. Es verfügt über ein „Vorlagen"-System, das den Werkzeugkopf sofort austauschen kann, um jede Schraube (Quantisierungsformat) zu passen, ohne dass das gesamte Messer neu gebaut werden muss.
  • Das Ergebnis: Es unterstützt 23 verschiedene Gewichteformate, wohingegen Konkurrenten nur 6 oder 7 unterstützten. Das bedeutet, wenn ein Entwickler morgen eine neue, super-effiziente Komprimierungsmethode erfindet, kann LlamaWeb diese wahrscheinlich sofort ausführen, ohne dass ein Software-Update erforderlich ist.

Die Gesamtergebnisse

Das Team testete dies auf 16 verschiedenen Geräten von 8 verschiedenen Herstellern (einschließlich NVIDIA, Apple, Intel, AMD und mobilen Chips).

  • Speicher: Es sparte eine enorme Menge an RAM und verhinderte Abstürze auf Geräten mit begrenztem Speicher (wie iPhones).
  • Geschwindigkeit: Es war deutlich schneller als andere browserbasierte KI-Tools.
  • Vielseitigkeit: Es kann fast jedes Modell ausführen, das von der llama.cpp-Community unterstützt wird, was eine riesige Bibliothek von über 177.000 Modellen darstellt.

Eine Einschränkung: Während LlamaWeb beim Generieren von Text Wort für Wort (die „Decode"-Phase) ein Champion ist, ist es derzeit beim Lesen der ursprünglichen Eingabeaufforderung (die „Prefill"-Phase) im Vergleich zu einigen Konkurrenten etwas langsamer. Die Autoren weisen jedoch darauf hin, dass sich diese Lücke schließen wird, sobald sich die Browser-Technologie verbessert.

Kurz gesagt ist LlamaWeb eine neue Engine, die das Ausführen leistungsstarker KI in Ihrem Browser möglich, privat und effizient macht und sicherstellt, dass Ihr Computer nicht schmilzt, während Sie mit einer KI chatten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →