← Neueste Arbeiten
🤖 machine learning

Sparse Prefix Caching for Hybrid and Recurrent LLM Serving

Dieses Papier stellt sparse prefix caching für hybrides und rekurrentes LLM-Serving vor, eine Methode, die die Latenz optimiert, indem sie exakte rekurrente Zustände an spärlichen Checkpoint-Positionen strategisch speichert, um die Berechnung vom tiefsten Übereinstimmungspunkt fortzusetzen, wodurch sie bestehende dichte Caching-Heuristiken übertrifft, während sie exakte Ausgaben bewahrt und keine Kernel-Änderungen erfordert.

Ursprüngliche Autoren: Mikhail Shirokikh, Sergey Nikolenko

Veröffentlicht 2026-05-08
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Mikhail Shirokikh, Sergey Nikolenko

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Koch, der ein komplexes, mehrgängiges Menü für eine Reihe von Gästen zubereitet. In der Welt der Large Language Models (LLMs) ist das „Menü" das Generieren einer Antwort, und die „Zutaten" sind die Wörter (Tokens), die das Modell bereits verarbeitet hat.

Der alte Weg: Die „Alles-oder-Nichts"-Küche

Traditionell prüft der Koch, wenn ein neuer Gast (eine neue Anfrage) eintrifft, ob er etwas Ähnliches wie der letzte Gast bestellt hat.

  • Wenn er exakt denselben Vorspeisenteller bestellt hat: Der Koch verwendet den gesamten Teller erneut.
  • Wenn er etwas leicht Unterschiedliches bestellt hat: Der Koch wirft den gesamten Vorspeisenteller weg und fängt von vorne an zu kochen, selbst wenn die ersten 90 % der Zutaten identisch waren.

In technischen Begriffen wird dies als dichtes Caching bezeichnet. Das System speichert eine Kopie jedes einzelnen Schritts (jedes Tokens) ab, um sie später wiederzuverwenden. Dies funktioniert hervorragend für Standardmodelle, aber für eine neue Art von Modell, genannt Hybrid- oder Rekurrentes Modell, ist dieser Ansatz wie der Versuch, eine Bibliothek voller Bücher zu tragen, nur um einen Satz zu lesen. Es ist zu schwer und nimmt zu viel Speicherplatz in Anspruch.

Die neue Idee: Die „Checkpoint"-Strategie

Dieser Artikel schlägt einen intelligenteren Umgang mit diesen spezifischen Modellen vor. Betrachten Sie den Speicher des Modells nicht als Bibliothek jedes einzelnen Wortes, sondern als einen Zustand des Geistes.

Stellen Sie sich vor, Sie lesen einen sehr langen Roman.

  1. Der alte Weg: Sie kleben ein Lesezeichen auf jede einzelne Seite, damit Sie sofort zurückspringen können. (Zu viele Lesezeichen!).
  2. Der neue Weg (Sparse Prefix Caching): Sie kleben Lesezeichen nur auf Seite 1, Seite 100, Seite 200 usw.

Wenn ein neuer Leser die Geschichte ab Seite 150 fortsetzen möchte:

  • Sie werfen das ganze Buch nicht weg.
  • Sie finden das letzte Lesezeichen (Seite 100).
  • Sie lesen die Geschichte schnell von Seite 101 bis 149 nach, um wieder in den aktuellen Zustand zu gelangen.
  • Dann fahren Sie ab Seite 150 fort.

Da das Modell „rekurrent" ist (es entwickelt seinen Zustand schrittweise weiter), benötigt es nicht die gesamte Historie, sondern nur den Zustand an einem bestimmten Punkt. Dieser Artikel nennt diese Lesezeichen Checkpoints.

Das Problem: Wo platziert man die Lesezeichen?

Jetzt kommt der knifflige Teil. Sie haben ein begrenztes Budget für Lesezeichen (Speicher). Wo sollten Sie sie platzieren, um die meiste Zeit zu sparen?

  • Die „ausgewogene" Strategie: Platzieren Sie die Notizen gleichmäßig (alle 100 Seiten). Das ist sicher, aber vielleicht nicht die schnellste Methode.
  • Die „intelligente" Strategie (Was dieser Artikel tut): Betrachten Sie die Gewohnheiten Ihrer Leser.
    • Wenn die meisten Leute um Seite 50 aufhören zu lesen, platzieren Sie dort ein Lesezeichen.
    • Wenn die Leute normalerweise bis zum Ende lesen, platzieren Sie Lesezeichen nahe dem Ende.
    • Wenn die Leute oft bei Seite 200 aufhören, platzieren Sie dort ein Lesezeichen.

Die Autoren haben eine mathematische Formel (ein „Dynamisches Programm") entwickelt, die wie ein superintelligenter Bibliothekar funktioniert. Sie analysiert vergangene Anfragen, um vorherzusagen, wo zukünftige Leser wahrscheinlich aufhören werden. Anschließend platziert sie die Lesezeichen genau dort, wo sie am nützlichsten sein werden, anstatt sie gleichmäßig zu verteilen.

Die Ergebnisse: Zeit- und Speichereinsparung

Der Artikel testete dies in realen Szenarien, wie zum Beispiel:

  • QuALITY: Ein langes Dokument, bei dem Menschen verschiedene Fragen zum selben Text stellen.
  • System-Prompts: Eine lange Reihe von Anweisungen, gefolgt von vielen verschiedenen Benutzerfragen.

Was sie herausfanden:

  1. Weniger Speicher, gleiche Geschwindigkeit: Durch das „intelligente" Platzieren von Checkpoints basierend darauf, wo Menschen tatsächlich aufhören, konnten sie weniger Lesezeichen (Checkpoints) verwenden als die Standardmethode mit „gleichmäßigem Abstand", während sie dennoch die gleiche Menge an Kochzeit sparten.
  2. Große Gewinne bei knappen Budgets: Die größten Verbesserungen traten auf, wenn nur sehr wenige Lesezeichen zur Verfügung standen. In diesen engen Situationen war die „intelligente" Platzierung viel besser als bloßes Raten oder gleichmäßiges Verteilen.
  3. Exakte Ergebnisse: Im Gegensatz zu einigen Abkürzungen, die die Antwort erraten, garantiert diese Methode, dass die Ausgabe zu 100 % identisch ist mit dem Ergebnis, das man durch die Arbeit von vorne erhalten würde. Sie erledigt es einfach schneller, indem sie die Teile überspringt, die sie bereits kennt.

Das Fazit

Dieser Artikel stellt eine Methode vor, um KI-Modelle, die „rekurrenten" Speicher verwenden, effizienter zu machen. Anstatt jeden einzelnen Schritt zu speichern oder gar nichts zu speichern, speichert es ein paar strategische „Schnappschüsse" des Gehirns des Modells. Indem es Mathematik nutzt, um genau herauszufinden, wo diese Schnappschüsse basierend darauf, wie Menschen die KI tatsächlich nutzen, gespeichert werden sollen, kann das System schneller laufen und weniger Speicher verbrauchen, insbesondere wenn viele Benutzer ähnliche Fragen zu demselben langen Dokument stellen.

Es ist wie ein GPS, das Ihnen nicht nur die gesamte Karte zeigt, sondern genau weiß, welche Abfahrten Sie am wahrscheinlichsten nehmen werden, sodass es nur die Wegbeschreibungen für diese spezifischen Abfahrten speichert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →