← Neueste Arbeiten
🤖 machine learning

Quantize What Counts: More for Keys, Less for Values

Dieser Beitrag legt eine theoretische Grundlage für die Quantisierung des gemischten Präzisions-KV-Caches in Large Language Models, indem er nachweist, dass die Priorisierung einer höheren Präzision für Schlüssel gegenüber Werten den Quantisierungsfehler strikt reduziert und die Genauigkeit erhält, wodurch die Bitzuweisung von einer heuristischen Abstimmung in ein geometriegetriebenes Gestaltungsprinzip überführt wird.

Ursprüngliche Autoren: Mohsen Hariri, Alan Luo, Weicong Chen, Shaochen Zhong, Tianyi Zhang, Qifan Wang, Xia Hu, Xiaotian Han, Vipin Chaudhary

Veröffentlicht 2026-05-12
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mohsen Hariri, Alan Luo, Weicong Chen, Shaochen Zhong, Tianyi Zhang, Qifan Wang, Xia Hu, Xiaotian Han, Vipin Chaudhary

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Der „Speicher-Kühlschrank" ist zu voll

Stellen Sie sich ein Large Language Model (LLM) wie einen brillanten Koch vor, der ein sehr langes Mahl zubereitet (ein Gespräch oder eine Geschichte). Um das Mahl fortzusetzen, muss der Koch sich an jede Zutat erinnern, die er bisher hinzugefügt hat. In Computerterminologie wird dieser Speicher als KV-Cache (Key-Value-Cache) bezeichnet.

Je länger das Mahl wird (mehr Tokens), desto größer und größer muss der Kühlschrank des Kochs sein, um diese Zutaten zu lagern. Schließlich wird der Kühlschrank so voll, dass die Küche den Platz verliert, was alles verlangsamt oder das Kochen ganz stoppt. Dies ist der „Speicher-Engpass", den das Papier adressiert.

Die aktuelle Lösung: Zutaten verkleinern

Um den vollen Kühlschrank zu beheben, verwenden Ingenieure Quantisierung. Stellen Sie sich dies als Komprimieren der Zutaten vor. Anstatt eine ganze, schwere Wassermelone (hohe Präzision) zu lagern, lagern Sie einen kleineren, leichteren Schnitt (geringere Präzision). Dies spart Platz.

Es gibt jedoch einen Haken: Wenn Sie die Zutaten zu stark verkleinern, könnte der Koch das Rezept vergessen oder einen Fehler machen. Die große Frage war immer: „Wie stark können wir die Key-Zutaten im Vergleich zu den Value-Zutaten verkleinern, ohne das Mahl zu ruinieren?"

Bisher haben Leute geraten (Heuristiken) oder zufällige Kombinationen ausprobiert, um zu sehen, was funktioniert. Dieses Papier sagt: „Hören Sie auf zu raten. Schauen wir uns die Mathematik an."

Die Entdeckung: Keys sind die „Schwerstarbeiter"

Die Autoren entdeckten einen grundlegenden Unterschied zwischen den beiden Arten von Zutaten: Keys und Values.

  • Die Analogie: Stellen Sie sich den „Key" als das Etikett auf einer Box vor und den „Value" als den Inhalt in der Box.
  • Die Erkenntnis: Das Papier beweist, dass die „Etiketten" (Keys) mathematisch „schwerer" und komplexer sind als der „Inhalt" (Values). In technischen Begriffen haben die Key-Matrizen größere „Normen" (ein Maß für Größe und Energie) als die Value-Matrizen.

Da die Keys schwerer sind, tragen sie eine höhere „Informationsdichte". Wenn Sie einen schweren Gegenstand zu stark quetschen, bricht er. Wenn Sie einen leichten Gegenstand quetschen, ändert er sich kaum.

Die Lösung: „Mehr für Keys, weniger für Values"

Basierend auf dieser Entdeckung schlagen die Autoren eine neue Regel zum Verkleinern der Zutaten vor:

  1. Geben Sie den Keys mehr Bits (halten Sie sie größer): Da die Keys die schweren, komplexen Etiketten sind, müssen sie relativ präzise bleiben.
  2. Geben Sie den Values weniger Bits (quetschen Sie sie stärker): Da die Values leichter und weniger empfindlich sind, können Sie sie erheblich komprimieren, ohne viel Genauigkeit zu verlieren.

Die kreative Metapher:
Stellen Sie sich vor, Sie packen einen Koffer für eine Reise.

  • Die Keys sind Ihr Reisepass und Ihre Tickets. Wenn Sie darauf kritzeln oder sie zu klein falten, können Sie sie nicht verwenden, und Sie stecken fest. Sie müssen scharf und klar bleiben (Hohe Präzision).
  • Die Values sind Ihre Socken und T-Shirts. Sie können sie fest falten, zusammenrollen oder sogar in die Ecken stopfen. Sie nehmen Platz ein, aber wenn sie ein wenig zerknittert sind, können Sie sie trotzdem tragen (Niedrige Präzision).

Die Strategie des Papiers lautet: Packen Sie den Pass sorgfältig ein (4 Bits), aber stopfen Sie die Socken fest hinein (2 Bits).

Die Ergebnisse: Platz sparen ohne Qualitätsverlust

Die Forscher testeten diese „Pass vs. Socken"-Strategie an vielen verschiedenen Modellen (wie Llama, Mistral und Qwen) und Aufgaben (Mathematik, Gespräch, Schreiben).

  • Der alte Weg: Behandeln Sie alles gleich (z. B. 4 Bits für Pässe, 4 Bits für Socken). Dies verschwendet Platz bei den Socken.
  • Der neue Weg: 4 Bits für Pässe, 2 Bits für Socken.

Das Ergebnis:

  • Gesparter Platz: Sie sparten etwa 25 % des für den Kühlschrank benötigten Speichers.
  • Beibehaltene Genauigkeit: Das Modell arbeitete immer noch mit 98,3 % seiner ursprünglichen Genauigkeit.
  • Der „K4V2"-Sweet Spot: Speziell die Zuweisung von 4 Bits für Keys und 2 Bits für Values funktionierte fast genauso gut wie das Beibehalten von allem bei 4 Bits, verwendete aber die Hälfte des Speichers für die Values.

Warum das wichtig ist

Dieses Papier verändert das Spiel von „Versuch und Irrtum" zu „wissenschaftlichem Design".

  • Früher: Ingenieure passten Einstellungen zufällig an, bis das Modell nicht mehr abstürzte.
  • Jetzt: Wir haben eine Regel, die auf der Geometrie des Modells selbst basiert: Priorisieren Sie die Keys.

Sie zeigten auch, dass diese Regel perfekt mit anderen Tricks funktioniert (wie „Rotation", was wie das Umordnen des Koffers ist, um Dinge besser unterzubringen). Wenn Sie „Mehr für Keys" mit diesen anderen Tricks kombinieren, werden die Ergebnisse noch besser.

Zusammenfassung

Das Papier argumentiert, dass im Speicher von KI-Modellen Keys die kritischen, schwerarbeitenden Teile sind, während Values die flexiblen, komprimierbaren Teile sind. Indem wir den Keys mehr Aufmerksamkeit (Bits) und den Values weniger geben, können wir den Speicherbedarf des Modells erheblich verkleinern, ohne dass die KI vergisst, wie man denkt. Es ist eine einfache, mathematisch fundierte Regel: Mehr für Keys, weniger für Values.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →