← Neueste Arbeiten
💬 NLP

LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation

LogitSpec ist eine trainingsfreie, Plug-and-Play-Methodik für spekulatives Decodieren auf Basis von Retrieval, die die Inferenz von LLMs beschleunigt, indem sie die Logits des letzten Tokens nutzt, um das „nächste-nächste" Token zu spekulieren, wodurch der Retrieval-Bereich erweitert wird, um eine bis zu 2,61-fache Beschleunigung und höhere Token-Akzeptanzraten zu erreichen.

Ursprüngliche Autoren: Tianyu Liu, Qitan Lv, Hao Li, Xing Gao, Xiao Sun, Xiaoyan Sun

Veröffentlicht 2026-04-30
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Tianyu Liu, Qitan Lv, Hao Li, Xing Gao, Xiao Sun, Xiaoyan Sun

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Meisterkoch (das Large Language Model oder LLM), der versucht, ein komplexes Rezept zu schreiben. Der alte Weg, dies zu tun, ist sehr langsam: Sie denken an ein Wort, schreiben es auf, warten, bis der Computer überprüft, ob es korrekt ist, denken dann an das nächste Wort und so weiter. Es ist wie ein Brief zu schreiben, Buchstabe für Buchstabe, wobei man nach jedem einzelnen Buchstaben auf einen Stempel der Genehmigung wartet.

Speculative Decoding ist eine neue Methode, um dies zu beschleunigen. Anstatt ein Wort nach dem anderen zu schreiben, stellen Sie einen Sous-Chef (ein Draft-Modell) ein, der für Sie die nächsten paar Wörter errät. Sie überprüfen dann schnell, ob der Sous-Chef richtig lag. Wenn ja, akzeptieren Sie alle diese Wörter auf einmal. Wenn er falsch lag, werfen Sie nur die falschen Vermutungen weg und versuchen es erneut. Dies spart viel Zeit.

Das Einstellen eines Sous-Chefs hat jedoch Probleme:

  1. Sie müssen ihn speziell für Ihre Küche ausbilden (teuer und schwierig).
  2. Er nimmt zusätzlichen Platz in Ihrer Küche ein (Speicher).
  3. Wenn Sie Ihr Hauptrezept ändern, müssen Sie den Sous-Chef neu ausbilden.

Das Problem mit „Retrieval" (Der Bibliotheksansatz)

Einige Forscher versuchten, dies zu lösen, indem sie den Sous-Chef feuerten und stattdessen eine Bibliothek nutzten. Anstatt dass eine Person rät, sucht der Computer in einer riesigen Datenbank vergangener Rezepte nach einem passenden Ausdruck, basierend auf dem, was Sie bereits geschrieben haben.

Der Fehler: Dies ist wie der Versuch, das nächste Wort in einem Satz zu finden, indem man sich nur das unmittelbar vorherige Wort ansieht.

  • Ihr Satz: „Was ist die Fläche des..."
  • Die Vermutung der Bibliothek: Sie sieht „des" und denkt: „Oh, 'des' passt normalerweise zu 'Dreieck'!" (Weil sie einen früheren Satz fand: „Was ist die Fläche des Dreiecks?").
  • Die Realität: Sie wollten eigentlich sagen: „Was ist die Fläche des Kreises?" oder „Was ist die Fläche des Feldes?"
  • Ergebnis: Die Bibliothek bleibt beim falschen Wort hängen, weil sie nur den unmittelbaren Kontext betrachtet, nicht die gesamte Idee.

Die Lösung: LogitSpec (Der Koch mit der „Glaskugel")

Die Autoren dieses Papiers, LogitSpec, erkannten, dass der Hauptkoch (das LLM) tatsächlich eine versteckte Superkraft besitzt, die er nicht oft genug nutzt.

Wenn der Koch das nächste Wort vorhersagt, hat er auch ein „Gefühl" (mathematisch Logits genannt) darüber, was nach diesem nächsten Wort kommt. Obwohl der Koch nur das nächste Wort sagen soll, flüstert sein Gehirn bereits: „Und danach ist es wahrscheinlich 'Kreis'."

LogitSpec nutzt dieses Flüstern, um die Bibliothekssuche zu verbessern.

So funktioniert es, Schritt für Schritt, mit einer kreativen Analogie:

1. Der „Glaskugel"-Schritt

Anstatt nur das letzte Wort („des") zu betrachten, fragt LogitSpec den Koch: „Wenn Sie das Wort zwei Schritte voraus raten müssten, was wäre es?"

  • Der Koch betrachtet seine inneren „Gefühle" und sagt: „Ich wette, das Wort nach 'des' ist 'Kreis'."
  • Dies ist die Next-Next-Token-Spekulation.

2. Der „Super-Such"-Schritt

Jetzt sucht LogitSpec nicht mehr nur nach „des" in der Bibliothek, sondern nach der Phrase „des Kreis".

  • Alte Methode (Vanilla Retrieval): Sucht nach „des". Findet „des Dreiecks", „des Himmels", „des Hundes". (Falsch!)
  • LogitSpec-Methode: Sucht nach „des Kreis". Findet „des Freundeskreis", „des Lebenskreis", „des Feldkreises". (Viel genauer!)

3. Die Verifizierung

Der Computer nimmt diese besseren Vermutungen und überprüft sie gegen den Hauptkoch. Da die Vermutungen nun viel genauer sind, akzeptiert der Hauptkoch sie häufiger.

Warum ist das eine große Sache?

  • Kein zusätzliches Training: Sie müssen keinen neuen Sous-Chef einstellen oder ausbilden. Sie nutzen einfach die bestehenden „Gefühle" (Logits) des Hauptkochs, die bereits vorhanden waren.
  • Plug-and-Play: Es funktioniert mit jedem bestehenden Sprachmodell, ohne dass sein Code oder seine Gewichte geändert werden müssen.
  • Geschwindigkeit: In ihren Tests machte diese Methode den Computer 2,6-mal schneller beim Schreiben von Text. Es bedeutete auch, dass der Computer im Durchschnitt 3,28 Wörter auf einmal akzeptieren konnte, anstatt nur eines.

Das Fazit

Stellen Sie sich LogitSpec als einen Detektiv vor, der nicht nur den Tatort (das letzte Wort) betrachtet, um zu erraten, was als Nächstes passiert. Stattdessen nutzt der Detektiv eine psychische Ahnung (das Logit), um den nächsten Tatort zu erraten, und verwendet diese Ahnung, um die perfekten Beweise in der Bibliothek zu finden.

Indem das System zwei Schritte vorausblickt, hört es auf, sich durch ähnlich aussehende Wörter verwirren zu lassen, und findet die richtigen Wörter viel schneller, wodurch KI Text erheblich schneller schreibt, ohne dass zusätzliches Training oder teure Hardware erforderlich sind.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →