← Neueste Arbeiten
💻 computer science

VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

VeriCache ist ein Inferenzframework, das einen verlustfreien LLM-Ausgang erzielt, der identisch mit der Decodierung über den vollständigen KV-Cache ist, während es den Durchsatz erheblich steigert, indem es komprimierte KV-Caches zum Entwerfen von Tokens verwendet und diese gegen den vollständigen Cache verifiziert, der außerhalb des GPU-Speichers gehalten und nur bei Bedarf eingebracht wird.

Ursprüngliche Autoren: Jiayi Yao, Samuel Shen, Kuntai Du, Shaoting Feng, Dongjoo Seo, Rui Zhang, Yuyang Huang, Yuhan Liu, Shan Lu, Junchen Jiang

Veröffentlicht 2026-05-19
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jiayi Yao, Samuel Shen, Kuntai Du, Shaoting Feng, Dongjoo Seo, Rui Zhang, Yuyang Huang, Yuhan Liu, Shan Lu, Junchen Jiang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Die „Speicherüberlastung"

Stellen Sie sich einen superschlauen KI-Assistenten (ein Large Language Model) vor, der eine enorme Menge an Informationen speichern muss, um Ihre Fragen zu beantworten. Diese Informationen werden in einem speziellen „Notizblock" namens KV Cache gespeichert.

Wenn Gespräche länger werden (wie beim Schreiben eines ganzen Buches oder der Analyse einer riesigen Codebasis), wird dieser Notizblock so groß, dass er nicht mehr in den schnellen, teuren Speicher (GPU) des KI-Systems passt.

  • Die alte Lösung: Um ihn unterzubringen, begannen Ingenieure, den Notizblock zu „komprimieren". Sie warfen einige Details weg oder vereinfachten die Zahlen (wie beim Zusammenfassen eines 100-seitigen Berichts auf 10 Seiten).
  • Der Haken: Diese Komprimierung ist verlustbehaftet. Es ist, als würde man versuchen, ein Auto mit einer unscharfen Karte zu fahren. Für kurze Strecken ist das in Ordnung. Aber bei langen Fahrten (wie beim Schreiben von Code oder beim Aufrufen von Tools) beginnt die KI, kleine Fehler zu machen. Diese Fehler häufen sich, und schließlich schreibt die KI möglicherweise Code, der abstürzt, oder liefert die falsche Antwort, selbst wenn die Wörter richtig aussehen.

Die neue Lösung: VeriCache

Die Forscher haben VeriCache entwickelt, ein System, das es Ihnen erlaubt, die „unscharfe Karte" (komprimierter Cache) für Geschwindigkeit zu nutzen, aber die „echte Karte" (voller Cache) überprüft, um sicherzustellen, dass Sie sich nicht verirren.

Denken Sie daran wie an einen schnellen Zeichner und einen strengen Lektor.

Wie es funktioniert (Die Analogie)

  1. Der Zeichner (Komprimierter Cache):
    Die KI nutzt den kleinen, schnellen, komprimierten Speicher, um schnell eine Reihe von Sätzen (Tokens) auf einmal zu schreiben. Das ist superschnell, weil der Speicher klein ist und leicht auf den Computer passt.

    • Analogie: Ein Schüler, der im Zeitraffer schreibt und die nächsten paar Wörter basierend auf einer schnellen Zusammenfassung errät.
  2. Der strenge Lektor (Voller Cache):
    Bevor die Arbeit des Schülers an Sie gesendet wird, prüft ein „strenger Lektor" sie. Der Lektor hat Zugriff auf den gesamten ursprünglichen, perfekten Speicher (der zu groß ist, um ständig auf dem Schreibtisch zu liegen, also wird er in einem Aktenschrank im anderen Raum aufbewahrt).

    • Der Trick: Der Lektor holt den schweren Aktenschrank nur dann auf den Schreibtisch, wenn er eine Gruppe von Wörtern überprüfen muss.
  3. Der „gestaffelte" Tanz (Das Geheimnis):
    Hier wird VeriCache clever. Normalerweise, wenn Sie anhalten und eine schwere Datei holen müssen, kommt alles zum Stillstand.

    • Der Zug von VeriCache: Während der Lektor zum Aktenschrank läuft, um die schwere Datei zu holen, schreibt der Schüler weiter!
    • Da das Holen der Datei (Übertragen von Daten vom Speicher in den Arbeitsspeicher) und das Schreiben des nächsten Satzes (Nutzung der GPU) unterschiedliche „Straßen" im Computer verwenden, können sie gleichzeitig passieren, ohne sich zu behindern.
    • Bis der Lektor mit der Datei zurückkehrt, hat der Schüler bereits einen ganzen neuen Absatz geschrieben. Der Lektor prüft den vorherigen Absatz, korrigiert etwaige Fehler und genehmigt den Rest.

Warum das eine große Sache ist

  • Verlustfreie Geschwindigkeit: Frühere Methoden zwangen Sie zur Wahl: Schnell aber falsch (komprimiert) ODER Langsam aber perfekt (voll). VeriCache bietet Ihnen Schnell UND perfekt. Die endgültige Ausgabe ist identisch mit dem, was Sie erhalten hätten, wenn Sie die ganze Zeit den langsamen, vollen Speicher verwendet hätten.
  • Keine „stillen Ausfälle" mehr: Bei Aufgaben wie dem Codieren oder dem Geben spezifischer Befehle ist ein winziger Fehler eine Katastrophe. VeriCache fängt diese Fehler ab, bevor sie Sie erreichen.
  • Funktioniert mit allem: Es ist egal, wie der Speicher komprimiert wurde. Ob sie Wörter weggeworfen oder Zahlen vereinfacht haben – VeriCache kann diese komprimierte Version als „Zeichner" nutzen und sie gegen die „volle" Version verifizieren.

Die Ergebnisse

In ihren Tests konnte VeriCache Text bis zu 4-mal schneller generieren als die Verwendung des vollen, langsamen Speichers, während es exakt die gleichen korrekten Ergebnisse lieferte.

Kurz gesagt: VeriCache lässt die KI auf einer schnellen, leichten Strecke laufen, setzt aber Sicherheitsgeländer auf, die im Hintergrund die schwere, perfekte Strecke überprüfen, um sicherzustellen, dass die KI niemals vom Rand fällt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →