← Nieuwste papers
🤖 AI

SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

SplitZip is een GPU-vriendelijke, verliesvrije compressor die de KV-cacheoverdracht in gedisaggregeerde LLM-serving versnelt door de redundantie van drijvende-kommagetallen te exploiteren via een codeboek met een vaste lengte en een ijle escape-stream, waarbij aanzienlijk hogere doorvoer en lagere latentie worden bereikt in vergelijking met bestaande methoden.

Oorspronkelijke auteurs: Yipin Guo, Siddharth Joshi

Gepubliceerd 2026-06-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yipin Guo, Siddharth Joshi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, razendsnelle bibliotheek runt waar twee verschillende teams samenwerken om complexe vragen te beantwoorden.

  • Team A (Het "Prefill"-team): Zij zijn de onderzoekers. Ze lezen een enorm, lang document (de prompt van de gebruiker) en maken gedetailleerde aantekeningen. Dit deel gaat erg snel en vereist veel hersenkracht (rekenkracht).
  • Team B (Het "Decode"-team): Zij zijn de schrijvers. Ze gebruiken die aantekeningen om het antwoord te schrijven, woord voor woord. Dit deel gaat langzamer en vereist veel geheugen om de aantekeningen vast te houden.

In moderne AI-systemen werken deze twee teams vaak in verschillende gebouwen (verschillende servers) om geld te besparen en de werklast te balanceren. Het probleem? Team A moet hun aantekeningen naar Team B mailen voordat Team B kan beginnen met schrijven. Als de aantekeningen enorm zijn (zoals wanneer de gebruiker over een heel boek vraagt), duurt het mailen te lang. De schrijver (Team B) zit dan stil te wachten tot de post arriveert. Deze "mailvertraging" is de bottleneck die het hele systeem vertraagt.

Het probleem met huidige "mailmethoden"

Voorheen probeerden mensen de aantekeningen te verkleinen (te comprimeren) om ze sneller te kunnen mailen.

  • De "Lossy" methode: Sommigen probeerden delen van de aantekeningen weg te gooien om ruimte te besparen. Maar dit is als het samenvatten van een roman door willekeurige zinnen te verwijderen. Het bespaart misschien ruimte, maar het verhaal (het antwoord van de AI) kan daardendeel fout of onzinnig worden.
  • De "Oude" Lossless methode: Anderen probeerden de aantekeningen perfect te zippen zonder ook maar één letter te verliezen. Maar de software die zij gebruikten, was als een trage, ouderwetse typist. Het was te traag om bij te houden hoe snel Team A de aantekeningen genereerde. Tegen de tijd dat de aantekeningen gezipt waren, had Team A alweer een nieuwe batch gegenereerd.

De oplossing: SplitZip

De auteurs hebben een nieuw systeem ontwikkeld genaamd SplitZip. Zie dit als een super-slimme, razendsnelle koeriersdienst die specif으로 is ontworpen voor deze AI-aantekeningen.

Zo werkt het, met behulp van een eenvoudige analogie:

1. De structuur van de "Aantekening"
De aantekeningen die de AI genereert, bestaan uit getallen. In het formaat dat zij gebruiken (genoemd BF16), heeft elk getal drie onderdelen:

  • Het Teken (Sign): Is het positief of negatief? (Zoals een plus of min teken).
  • De Mantissa: De specifieke details van het getal.
  • De Exponent: De "macht" of schaal van het getal (zoals of het 10, 100 of 1.000 is).

2. De geheime ontdekking
De onderzoekers merkten iets grappigs op: terwijl de "details" (Mantissa) overal verspreid zijn, is de "macht" (Exponent) zeer repetitief. Het is alsof je een boek schrijft en 99% van de tijd alleen de woorden "zeer", "vrij" en "extreem" gebruikt. Je gebruikt zelig weinig vaak "enigszins" of "nauwelijks".

3. De SplitZip-strategie
In plaats van elke letter individueel op te schrijven, doet SplitZip het volgende:

  • De Afkorting: Het maakt een "Top 16"-lijst van de meest voorkomende "machten" (exponenten). Het wijst aan elk van deze 16 veelvoorkomende machten een piepkleine, 4-letterige code toe (zoals een geheime handdruk).
  • Het Verpakken: Het verpakt twee van deze piepkleine codes in een enkele byte aan ruimte. Dit is alsoals het inpassen van twee geheime handdrukken in de ruimte van één letter.
  • De "Zeldzame" Lijst: Voor de 1% van de gevallen waarin een "zeldzame" macht verschijnt, probeert het niet deze in de afkorting te dwingen. In plaats daarvan schrijft het een kleine "escape-notitie" die zegt: "Op positie #50 was de macht eigenlijk 'Zeldzame-Waarde-99'."

4. Waarom het snel is

  • Voor Team A (Encoderen): Omdat het systeem gebruikmaakt van vaste, korte codes (4 bits) in plaats van complexe, variabele codes, kan het de aantekeningen ongelooflijk snel verpakken. Het is als een robotarm die precies weet waar hij elk item moet plaatsen, in plaats van een mens die telkens moet uitzoeken hoe hij een shirt het beste kan vouwen.
  • Voor Team B (Decoderen): Wanneer de aantekeningen aankomen, kan Team B ze direct uitpakken. Ze zoeken de 4-letterige code op, halen de macht op en combineren deze met de details. Als er een "escape-notitie" is, overschrijven ze simpelweg die ene plek. Het is een recht pad van werk zonder verwarrende omwegen.

De resultaten

De paper beweert dat SplitZip een gamechanger is:

  • Snelheid: Het comprimeert en decomprimeert data met snelheden van 613 GB/s en 2181 GB/s. Om dit in perspectief te plaatsen: dit is honderden keren sneller dan eerdere methoden die dit op de CPU probeerden te doen.
  • Perfecte Nauwkeurigheid: Het is "lossless". De aantekeningen die Team B ontvangt, zijn bit-voor-bit identiek aan wat Team A heeft geschreven. Er gaat geen informatie verloren.
  • Impact in de echte wereld: Toen ze dit testten in een echt AI-systeem (met het SGLang framework), zagen ze:
    • 1.32x snellere overdracht van aantekeningen tussen servers.
    • 1.30x snellere tijd tot het eerste antwoordwoord (TTFT).
    • 1.23x meer totale verzoeken per uur.

Samenvatting

SplitZip is als een gespecialiseerde, razendsnelle koerier die weet dat de AI-aantekeningen grotendeels repetitief zijn. In plaats van de hele zware doos te versturen, stuurt het een kleine, gecodeerde lijst van de veelvoorkomende items en een klein briefje voor de zeldzame gevallen. Het doet dit zo snel dat de AI-server nooit hoeft te wachten, waardoor de AI langere, complexe vragen veel sneller kan beantwoorden zonder ooit een enkel detail te verliezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →