SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving
SplitZip ist ein GPU-freundlicher, verlustfreier Kompressor, der den KV-Cache-Transfer in disaggregierter LLM-Bereitstellung beschleunigt, indem er die Redundanz der Fließkomma-Exponenten durch ein Codebuch fester Länge und einen spärlichen Escape-Stream ausnutzt und dabei im Vergleich zu bestehenden Methoden einen signifikant höheren Durchsatz sowie reduzierte Latenz erzielt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie leiten eine riesige, Hochgeschwindigkeits-Bibliothek, in der zwei verschiedene Teams zusammenarbeiten, um komplexe Fragen zu beantworten.
- Team A (Das „Prefill“-Team): Sie sind die Forscher. Sie lesen ein riesiges, langes Dokument (den Prompt des Nutzers) und machen sich detaillierte Notizen. Dieser Teil geht sehr schnell und erfordert viel Gehirnleistung (Rechenleistung).
- Team B (Das „Decode“-Team): Sie sind die Schreiber. Sie nutzen diese Notizen, um die Antwort Wort für Wort zu schreiben. Dieser Teil ist langsamer und erfordert viel Speicher, um die Notizen festzuhalten.
In modernen KI-Systemen arbeiten diese beiden Teams oft in unterschiedlichen Gebäuden (verschiedenen Servern), um Kosten zu sparen und die Arbeitslast auszubalancieren. Das Problem? Team A muss seine Notizen an Team B mailen, bevor Team B mit dem Schreiben beginnen kann. Wenn die Notizen riesig sind (wie wenn der Nutzer nach einem ganzen Buch fragt), dauert das Versenden der Post zu lange. Der Schreiber (Team B) sitzt untätig herum und wartet darauf, dass die Post eintrifft. Diese „Mailing-Verzögerung“ ist der Flaschenhals, der das gesamte System verlangsamt.
Das Problem mit aktuellen „Mailing“-Methoden
Früher versuchten Menschen, die Notizen zu verkleinern (zu komprimieren), um sie schneller versenden zu können.
- Die „verlustbehaftete“ Methode: Einige versuchten, Teile der Notizen wegzuwerfen, um Platz zu sparen. Aber das ist so, als würde man einen Roman zusammenfassen, indem man wahllos Sätze löscht. Es mag zwar Platz sparen, aber die Geschichte (die Antwort der KI) könnte dadurch falsch oder unsinnig werden.
- Die „alte“ verlustfreie Methode: Andere versuchten, die Notizen perfekt zu zippen, ohne auch nur einen einzigen Buchstaben zu verlieren. Aber die Software, die sie verwendeten, war wie eine langsame, altmodische Schreibkraft. Sie war zu langsam, um mit der Geschwindigkeit Schritt zu halten, mit der Team A die Notizen generierte. Bis die Notizen gezippt waren, hatte Team A bereits eine neue Charge erstellt.
Die Lösung: SplitZip
Die Autoren entwickelten ein neues System namens SplitZip. Stellen Sie sich das wie einen superintelligenten, Hochgeschwindigkeits-Kurierdienst vor, der speziell für diese KI-Notizen entwickelt wurde.
So funktioniert es, unter Verwendung einer einfachen Analogie:
1. Die Struktur der „Notiz“
Die Notizen, die die KI generiert, bestehen aus Zahlen. In dem Format, das sie verwenden (genannt BF16), hat jede Zahl drei Teile:
- Das Vorzeichen (Sign): Ist sie positiv oder negativ? (Wie ein Plus- oder Minuszeichen).
- Die Mantisse (Mantissa): Die spezifischen Details der Zahl.
- Der Exponent (Exponent): Die „Potenz“ oder Skalierung der Zahl (wie ob sie 10, 100 oder 1.000 ist).
2. Die geheime Entdeckung
Den Forschern fiel etwas Merkwürdiges auf: Während die „Details“ (Mantisse) überall verstreut sind, ist die „Potenz“ (Exponent) sehr repetitiv. Es ist so, als würden Sie ein Buch schreiben und in 99 % der Fälle nur die Wörter „sehr“, „ziemlich“ und „extrem“ verwenden. Sie benutzen „etwas“ oder „kaum“ nur selten.
3. Die SplitZip-Strategie
Anstatt jedes einzelne Wort auszuschreiben, macht SplitZip Folgendes:
- Die Abkürzung: Es erstellt eine „Top 16“-Liste der am häufigsten vorkommenden „Potenzen“ (Exponenten). Es weist jeder dieser 16 häufigen Potenzen einen winzigen, 4-Bit-Code zu (wie ein geheimes Handzeichen).
- Das Packen: Es packt zwei dieser winzigen Codes in den Platz eines einzigen Bytes. Das ist so, als würde man zwei geheime Handzeichen in den Platz eines einzigen Buchstabens quetschen.
- Die „seltene“ Liste: Für die 1 % der Fälle, in denen eine „seltene“ Potenz erscheint, versucht das System nicht, sie in die Abkürzung zu pressen. Stattdessen schreibt es eine kleine „Escape-Notiz“, die besagt: „An Position #50 war die Potenz tatsächlich 'Selten-Wert-99'.“
4. Warum es schnell ist
- Für Team A (Encoding): Da das System feste, kurze Codes (4 Bit) anstelle von komplexen, variablen Codes verwendet, kann es die Notizen unglaublich schnell packen. Es ist wie ein Roboterarm, der genau weiß, wohin er jedes Teil legen muss, anstatt wie ein Mensch, der jedes Mal überlegen muss, wie man ein Hemd am besten faltet.
- Für Team B (Decoding): Wenn die Notizen ankommen, kann Team B sie sofort entpacken. Sie schauen sich den 4-Bit-Code an, erhalten die Potenz und kombinieren sie mit den Details. Wenn es eine „Escape-Notiz“ gibt, überschreiben sie einfach diesen einen Punkt. Es ist ein geradliniger Arbeitsprozess ohne verwirrende Umwege.
Die Ergebnisse
Das Paper behauptet, dass SplitZip ein Gamechanger ist:
- Geschwindigkeit: Es komprimiert und dekomprimiert Daten mit Geschwindigkeiten von 613 GB/s und 2181 GB/s. Um das einzuordnen: Das ist hunderte Male schneller als bisherige Methoden, die versuchten, dies auf der CPU zu tun.
- Perfekte Genauigkeit: Es ist „verlustfrei“. Die Notizen, die Team B erhält, sind bitgenau identisch mit dem, was Team A geschrieben hat. Es gehen keine Informationen verloren.
- Reale Auswirkungen: Als sie dies in einem echten KI-System (unter Verwendung des SGLang-Frameworks) testeten, beobachteten sie:
- 1,32-mal schnellerer Transfer der Notizen zwischen den Servern.
- 1,30-mal schnellerer Zeitaufwand bis zum ersten Wort der Antwort (TTFT).
- 1,23-mal mehr Anfragen pro Stunde insgesamt.
Zusammenfassung
SplitZip ist wie ein spezialisierter Hochgeschwindigkeits-Kurier, der weiß, dass die KI-Notizen größtenteils repetitiv sind. Anstatt das ganze schwere Paket zu verschicken, sendet er eine winzige, kodierte Liste der häufigsten Artikel und eine kleine Notiz für die seltenen. Er tut dies so schnell, dass der KI-Server niemals warten muss, wodurch er lange, komplexe Fragen viel schneller beantworten kann, ohne jemals ein einziges Detail zu verlieren.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.