← Neueste Arbeiten
🤖 machine learning

Lever: Speculative LLM Inference on Smartphones

Dieser Beitrag stellt Lever vor, ein durchgängiges System, das die spekulative Dekodierung über die Phasen des Entwurfs, der Verifikation und der Ausführung hinweg optimiert, um eine effiziente, latenzarme Inferenz großer Sprachmodelle auf Smartphones zu ermöglichen, indem Flash-Speicher und mobile Hardwarebeschränkungen genutzt werden.

Ursprüngliche Autoren: Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

Veröffentlicht 2026-05-19
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Der „schwere Koffer" auf einem „Fahrrad"

Stellen Sie sich vor, Sie möchten mit einem Fahrrad (Ihrem Smartphone) durch ein Land fahren. Sie haben einen sehr schweren, hochwertigen Koffer (ein leistungsfähiges Large Language Model oder LLM), der das gesamte Wissen enthält, das Sie benötigen.

  • Das Problem: Das Fahrrad hat nur einen winzigen Korb (den schnellen Speicher des Telefons, oder DRAM). Er kann den ganzen Koffer nicht aufnehmen.
  • Die aktuelle Umgehungslösung: Sie müssen den Koffer im Kofferraum (dem langsamen Flash-Speicher des Telefons) lassen. Jedes Mal, wenn Sie einen Schritt machen müssen (ein Wort generieren), müssen Sie anhalten, den Kofferraum öffnen, die benötigte Seite herausziehen, sie lesen und wieder hineinstellen. Dieses „Anhalten und Weiterfahren" ist unglaublich langsam. Es ist, als würde man versuchen, Fahrrad zu fahren und dabei ständig anzuhalten, um im Kofferraum zu wühlen.

Die Idee: „Raten", um Zeit zu sparen

Das Papier stellt ein System namens Lever vor. Es verwendet einen Trick namens Speculative Decoding (spekulative Dekodierung).

Stellen Sie es sich wie ein Raten-Spiel vor:

  1. Der kleine Assistent (Draft Model): Sie haben einen kleinen, schnellen Assistenten, der im Fahrradkorb sitzt (im schnellen Speicher). Dieser Assistent ist gut darin, zu erraten, was als Nächstes kommt.
  2. Der große Chef (Target Model): Der schwere Koffer im Kofferraum ist der „Große Chef". Er ist sehr klug, aber der Zugriff auf ihn ist langsam.
  3. Die Strategie: Anstatt den Großen Chef nach einem Wort zu fragen, errät der kleine Assistent schnell einen ganzen Satz (oder einen Baum möglicher Sätze). Dann öffnen Sie den Kofferraum nur einmal, um den Großen Chef zu fragen: „Habe ich diese Vermutungen richtig?"

Wenn der Große Chef sagt: „Ja, die ersten drei Wörter sind korrekt", erhalten Sie drei Wörter zum Preis einer einzigen Fahrt zum Kofferraum. Das spart eine enorme Menge an Zeit.

Die drei Hürden (und wie Lever sie löst)

Die Autoren stellten fest, dass diese „Raten"-Idee zwar auf leistungsstarken Servern hervorragend funktioniert, auf Telefonen jedoch aus drei spezifischen Gründen scheitert. Hier ist, wie Lever diese Probleme löst:

1. Das Dilemma der „Baumgröße" (Drafting)

  • Das Problem: Wenn der kleine Assistent zu wenige Wörter errät, müssen Sie den Kofferraum immer noch zu oft öffnen. Wenn er zu viele errät, wird das Gehirn des Telefons überfordert, alle diese Vermutungen zu prüfen, und es verlangsamt sich.
  • Die Lever-Lösung: Lever fungiert wie ein kluger Gärtner. Er lässt nicht einfach einen zufälligen Busch aus Vermutungen wachsen. Er berechnet sorgfältig: „Lohnt sich dieser Zweig von Vermutungen den Aufwand?" Er lässt nur Zweige wachsen, die wahrscheinlich akzeptiert werden und deren Prüfung nicht zu viel Energie kostet. Er baut einen „perfekt dimensionierten" Baum aus Vermutungen auf, der Geschwindigkeit und Genauigkeit ausbalanciert.

2. Das Problem der „verschwendeten Mühe" (Verification)

  • Das Problem: Selbst mit einem guten Baum muss der Große Chef möglicherweise einen Zweig prüfen, der sich als falsch herausstellt. Auf einem Telefon ist das Prüfen eines falschen Zweigs eine Verschwendung von wertvollem Akku und Zeit.
  • Die Lever-Lösung: Lever installiert einen Verkehrspolizisten (einen leichten Prädiktor) auf halber Strecke im Denkprozess des Großen Chefs. Bevor der Große Chef den ganzen Satz fertig gelesen hat, betrachtet der Verkehrspolizist die Hinweise und sagt: „Hey, dieser Zweig sieht falsch aus; hör auf, ihn zu prüfen!" Dies spart dem Telefon unnötige Arbeit, ist aber vorsichtig genug, um niemals eine korrekte Antwort zu verwerfen.

3. Das Problem der „Werkzeug-Untauglichkeit" (Execution)

  • Das Problem: Smartphones haben verschiedene Arten von „Gehirnen" (CPUs und NPUs). Die NPU ist hervorragend darin, Mathematik für viele Dinge gleichzeitig zu betreiben, aber sie hasst seltsame, unregelmäßige Aufgaben. Ratspiele sind oft unregelmäßig.
  • Die Lever-Lösung: Lever fungiert wie ein kluger Projektmanager. Er weiß, wann er die schnelle NPU und wann die flexible CPU einsetzen muss.
    • Er gruppiert ähnliche Vermutungen zusammen, damit die NPU effizient an ihnen arbeiten kann (wie ein Fließband in einer Fabrik).
    • Er behält die endgültige „Entscheidungsfindung" (das Herausfinden, welches Wort tatsächlich ausgewählt werden soll) für die CPU, damit die NPU keine Energie damit verschwendet, Antworten für Pfade zu berechnen, die niemals genutzt werden.

Die Ergebnisse

Das Papier testete Lever auf echten Smartphones (wie dem OnePlus 12) mit verschiedenen KI-Modellen.

  • Verglichen mit der alten Methode (Öffnen des Kofferraums für jedes einzelne Wort): Lever ist 2,93-mal schneller.
  • Verglichen mit anderen Raten-Methoden, die für Server entwickelt wurden: Lever ist 1,50-mal schneller.

Das Fazit

Lever ist ein System, das es Ihrem Telefon ermöglicht, riesige, intelligente KI-Modelle auszuführen, ohne einzufrieren. Dies erreicht es, indem es ein kleines, schnelles „Raten"-Modell verwendet, um die schwere Arbeit zu erledigen, während es das langsame, schwere „Prüf"-Modell sorgfältig verwaltet, damit es keine Zeit oder Batterie verschwendet. Es verwandelt einen langsamen, stehenden Prozess in eine flüssige, effiziente Fahrt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →