← Neueste Arbeiten
💬 NLP

LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation

LogQuant führt eine neuartige log-verteilte 2-Bit-Quantisierungstechnik für KV-Caches ein, die den Inferenzdurchsatz, die Batch-Größe und die Aufgabenpräzision für große Sprachmodelle erheblich verbessert, während ein minimaler Speicherbedarf gewahrt bleibt.

Ursprüngliche Autoren: Han Chen, Zicong Jiang, Zining Zhang, Bingsheng He, Pingyi Luo, Mian Lu, Yuqiang Chen

Veröffentlicht 2026-05-19
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Han Chen, Zicong Jiang, Zining Zhang, Bingsheng He, Pingyi Luo, Mian Lu, Yuqiang Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, sich an eine sehr lange Geschichte zu erinnern, um am Ende einen Witz zu erzählen. Um dies zu tun, führt Ihr Gehirn (das KI-Modell) ein „Notizbuch" (den KV-Cache), in das es jedes Wort und jeden Satz schreibt, die es bisher gehört hat.

Das Problem ist, dass dieses Notizbuch mit länger werdender Geschichte riesig wird. Es nimmt so viel Platz ein, dass Sie nicht viele Witze gleichzeitig erzählen können, oder die Geschichte dauert ewig, um verarbeitet zu werden.

Der alte Weg: Dinge wegwerfen oder raten
Frühere Methoden versuchten dies auf zwei Arten zu lösen:

  1. Der „Mülleimer"-Ansatz: Sie schauten sich die Geschichte an und rieten, welche Teile unwichtig waren, und warfen sie dann komplett weg. Das Problem? Oft warfen sie die falschen Dinge weg oder übersehen ein entscheidendes Detail, das tief in der Vergangenheit verborgen war.
  2. Der „verwaschene Foto"-Ansatz: Sie versuchten, alles zu behalten, aber es auf verschwommene, weniger präzise Weise aufzuschreiben (Quantisierung). Doch wenn sie alles zu verschwommen machten, ergab die Geschichte keinen Sinn mehr.

Der neue Weg: LogQuant (Die „logarithmische Bibliothek")
Die Autoren dieses Papiers, LogQuant, erkannten etwas Cleveres darüber, wie unsere Gehirne (und KI-Modelle) tatsächlich Aufmerksamkeit schenken.

Die Erkenntnis: Das „logarithmische" Muster
Sie entdeckten, dass die KI, wenn sie auf die Geschichte zurückblickt, nicht jedes Wort gleich stark betrachtet.

  • Sie schaut sehr genau auf die neuesten Wörter (die letzten Sätze).
  • Sie schaut weniger genau auf Wörter von vor einer Weile.
  • Sie schaut sehr spärlich auf Wörter vom Anfang.

Entscheidend ist, dass dieses Muster nicht zufällig ist; es folgt einer spezifischen mathematischen Kurve, die als Logarithmus bezeichnet wird. Stellen Sie sich eine Bibliothek vor, in der die Bücher auf den vorderen Regalen (neueste Ereignisse) eng gepackt sind, aber je tiefer Sie in die Bibliothek gehen, desto breiter werden die Regale und desto weiter auseinander liegen die Bücher.

Wie LogQuant funktioniert
Anstatt zu raten, was zu behalten ist, oder Dinge wegzuwerfen, nutzt LogQuant dieses „ausgedehnte" Muster, um den Speicher zu komprimieren:

  1. Die „neueste" Zone: Sie hält den allerletzten Teil der Geschichte in hoher Auflösung (voller Präzision), denn dort findet die Handlung statt.
  2. Die „mittlere" Zone: Je weiter sie zurückgeht, beginnt sie, Wörter zu überspringen. Sie behält ein Wort, überspringt eines, behält eines, überspringt eines.
  3. Die „tiefe" Zone: Noch weiter zurück überspringt sie mehr. Sie behält ein Wort, überspringt drei, behält eines, überspringt drei.

Dadurch kann sie den Speicher auf nur 2 Bit verkleinern (eine winzige Menge Platz, wie wenn man einen Film in hoher Auflösung in eine winzige Textdatei verwandelt), ohne die wichtigen Handlungspunkte zu verlieren. Da sie dem natürlichen „logarithmischen" Weg folgt, auf dem die KI Aufmerksamkeit schenkt, muss sie nicht raten, welche Teile wichtig sind; die Mathematik sagt ihr genau, wo sie hinschauen muss.

Die Ergebnisse: Mehr Witze, besserer Speicher
Das Papier behauptet, dass durch die Verwendung dieser Methode:

  • Geschwindigkeit: Die KI Informationen 25 % schneller verarbeiten kann.
  • Kapazität: Man kann 60 % mehr Gespräche gleichzeitig auf demselben Computer durchführen, da der Speicherbedarf so viel kleiner ist.
  • Genauigkeit: Bei schwierigen Aufgaben wie dem Lösen von Matheproblemen oder dem Schreiben von Code ist LogQuant 40 % bis 200 % genauer als andere Komprimierungsmethoden. Es ist so, als würde man die Geschichte klar genug halten, um ein Rätsel zu lösen, selbst wenn der Speicher winzig ist.

Warum es besser ist als „Dinge wegwerfen"
Die Autoren bewiesen auch, dass das „Wegwerfen" (Eviction) von Dingen schlecht für die Aufmerksamkeit der KI ist. Wenn Sie ein Wort löschen, muss die KI neu berechnen, wie die verbleibenden Wörter zueinander stehen, was die Geschichte verzerrt. LogQuant behält alle Wörter bei, schreibt sie jedoch in einem kleineren, komprimierten Format auf. Es ist so, als würde man jede Seite eines Buches behalten, aber sie in einer kleineren Schriftart drucken, anstatt die Hälfte der Seiten herauszureißen.

Zusammenfassung
LogQuant ist eine intelligente Methode, um den Speicher einer KI zu verkleinern, indem erkannt wird, dass die KI natürliche Ereignisse intensiv und ältere Ereignisse locker beachtet. Indem der Speicher komprimiert wird, um diesem natürlichen Muster zu entsprechen, spart es enorme Mengen an Platz und Zeit, ohne dass die KI die wichtigen Teile der Geschichte „vergisst".

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →