← Neueste Arbeiten
🤖 machine learning

Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

Das Papier stellt Hurwitz-Quaternionen-multiplicative Quantisierung (HQMQ) vor, eine kalibrierungsfreie Methode, die KV-Caches komprimiert, indem 4-Elemente-Blöcke als Quaternionen dargestellt werden, die über ein Produkt aus einer festen Hurwitz-Gruppe und zufälligen sekundären Codebüchern quantisiert werden, wodurch bei diversen modernen LLMs eine Genauigkeit nahe fp16 mit bis zu 5,05-facher Kompression erreicht und gleichzeitig die Notwendigkeit einer Kalibrierung eliminiert wird.

Ursprüngliche Autoren: Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, David Cox, Antonio Torralba

Veröffentlicht 2026-05-28
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, David Cox, Antonio Torralba

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Der „Speicher-Hoarding"

Stellen Sie sich ein Large Language Model (LLM) wie eine brillante, aber vergessliche Bibliothekarin vor. Wenn Sie ihr eine lange Frage stellen, muss sie sich jedes bisher gesagte Wort merken, um korrekt zu antworten. In computertechnischen Begriffen wird dieser Speicher als KV-Cache bezeichnet.

Bei sehr langen Gesprächen wird dieser Speichercache riesig. Wenn die Bibliothekarin versucht, jedes Detail in hoher Auflösung (wie einen 4K-Film) zu speichern, füllt dies den Arbeitsspeicher (RAM) des Computers sofort auf. Dies zwingt den Computer, langsamere Speichermedien zu nutzen oder führt zum Absturz, wodurch das Gespräch abbricht.

Um dies zu beheben, versuchen Ingenieure, den Speicher zu „komprimieren", ähnlich wie man einen 4K-Film in eine kleinere MP4-Datei umwandelt. Frühere Komprimierungsmethoden waren jedoch wie ein stumpfes Messer: Wenn man die Dateigröße zu stark reduzierte (unter 4 Bit), wurde der Film unbrauchbar (die AI begann Unsinn zu produzieren). Wenn das KI-Modell „Ausreißer" hatte (seltsame, extreme Zahlen in seinen Daten), brach die Standardkomprimierung völlig zusammen, was dazu führte, dass die AI wild halluzinierte.

Die Lösung: HQMQ (Das „intelligente Kompass"-System)

Die Autoren schlagen eine neue Methode namens HQMQ vor. Anstatt nur die Zahlen zu verkleinern, behandeln sie Gruppen von Daten als Quaternionen (eine Art 4D-mathematischer Kompass).

So funktioniert es, aufgeteilt in drei einfache Schritte:

1. Der „24-Punkte-Stern" (Das primäre Codebuch)

Stellen Sie sich vor, die Richtung, in die ein Datenpunkt zeigt, ist wie eine Kompassnadel. Anstatt den exakten Winkel zu speichern (was zu viel Platz benötigt), verwenden die Autoren einen speziellen, vorgefertigten „Stern" mit 24 Punkten (die Hurwitz-Gruppe).

  • Die Analogie: Denken Sie daran wie an einen Standardsatz von 24 festen Richtungen (Nord, Nordost usw., aber in 4D). Egal, wohin die Daten zeigen, Sie schnappen sie einfach an die nächste dieser 24 „perfekten" Richtungen.
  • Die Magie: Da diese 24 Punkte mathematisch perfekt und gleichmäßig verteilt sind, muss die KI nicht lernen, sie zu erkennen. Sie sind einfach „hart codierte" Regeln, wie die Buchstaben auf einer Tastatur.

2. Die „zufällige Drehung" (Das sekundäre Codebuch)

Die 24 Punkte reichen nicht aus, um jede mögliche Nuance abzudecken. Daher fügen die Autoren eine zweite Schicht hinzu: eine kleine, zufällige „Drehung" für jeden spezifischen Teil der KI.

  • Die Analogie: Stellen Sie sich einen Globus vor, auf dem die 24 Punkte gemalt sind. Jetzt stellen Sie sich vor, Sie können den Globus für jeden einzelnen Satz, den die KI verarbeitet, zufällig drehen.
  • Das Ergebnis: Wenn Sie die festen 24 Punkte mit einer zufälligen Drehung kombinieren, erhalten Sie Tausende von einzigartigen Richtungen (24×zufa¨llige Drehungen24 \times \text{zufällige Drehungen}).
  • Warum das cool ist: Das Papier behauptet, Sie müssen diese zufällige Drehung nicht trainieren. Aufgrund der dahinterstehenden Mathematik funktioniert jede zufällige Drehung fast genauso gut wie eine trainierte. Es ist, als würde man sagen: „Sie müssen nicht üben, Pfeile zu werfen; werfen Sie sie einfach zufällig, und die Mathematik garantiert, dass Sie das Brett treffen." Dies spart Zeit und Daten.

3. Das „Ausreißer-Sicherheitsnetz" (Med3×)

Einige KI-Modelle (wie Qwen) haben „Ausreißer" – Datenpunkte, die 100- oder 200-mal größer sind als normal. Die Standardkomprimierung versucht, diese riesigen Zahlen zusammenzudrücken, um sie unterzubringen, was die Daten zerstört.

  • Die Analogie: Stellen Sie sich vor, Sie packen einen Koffer. Die meisten Kleidungsstücke sind normal groß, aber Sie haben einen riesigen, unhandlich geformten Teddybären. Wenn Sie versuchen, den Bären in eine kleine Box zu zwängen, reißt die Box.
  • Die Lösung: HQMQ hat eine Regel: „Wenn eine Zahl zu groß ist (mehr als das 3-fache des Durchschnitts), drücken Sie sie nicht zusammen. Bewahren Sie sie einfach in ihrer ursprünglichen, hochwertigen Form (fp16) auf und markieren Sie sie mit einer winzigen Flagge."
  • Das Ergebnis: Nur etwa 1–3 % der Daten erhalten diese spezielle Behandlung, sodass die Speichereinsparungen immer noch enorm sind, aber die „riesigen Teddybären" das System nicht zerstören.

Was haben sie bewiesen?

Die Autoren testeten dies an fünf verschiedenen modernen KI-Modellen (Mistral, Llama, Qwen usw.). Hier sind ihre wichtigsten Erkenntnisse:

  • Es funktioniert ohne Training: Im Gegensatz zu anderen Methoden, die eine „Kalibrierungsphase" benötigen (in der die KI Daten studiert, um zu lernen, wie sie komprimiert werden soll), funktioniert HQMQ sofort mit zufälligen Einstellungen.
  • Es spart massiven Speicherplatz: Es gelang ihnen, den Speichercache um das 5-fache zu verkleinern. Zum Beispiel wurde ein 128k-Kontext-Cache für ein 70-Milliarden-Parameter-Modell (das normalerweise 43 GB benötigt) auf 8,5 GB verkleinert. Das bedeutet, Sie könnten eine massive KI auf einer einzelnen Consumer-Grafikkarte statt auf einem Supercomputer ausführen.
  • Es bewältigt „schlechte" Daten: Bei Modellen mit extremen Ausreißern (wie Qwen) versagte die Standardkomprimierung vollständig (die Fehlerrate der KI explodierte). HQMQ plus das „Sicherheitsnetz" behob dies und brachte die Leistung der KI wieder auf nahezu perfekte Niveaus.
  • Geschwindigkeit: Sie bauten eine spezielle „fusionierte" Engine, die die komprimierten Daten liest und entschlüsselt, während die KI denkt. Das bedeutet, die KI wird nicht langsamer; sie verbraucht einfach weniger Speicher.

Das Fazit

HQMQ ist wie ein universelles, vorgefertigtes Komprimierungs-Kit für KI-Speicher. Es verwendet einen cleveren mathematischen Trick (Multiplikation eines festen 24-Punkte-Sterns mit einer zufälligen Drehung), um Richtungen effizient zu speichern, ohne dass zuvor etwas gelernt werden muss. Es verfügt auch über einen Sicherheits-Schalter für seltsame Daten-Spitzen.

Das Ergebnis? Sie können viel längere, intelligentere Gespräche auf viel kleineren Computern führen, ohne dass die KI den Verstand verliert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →