← Neueste Arbeiten
🤖 AI

SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation

SelKV ist ein trainingsfreies Framework, das KV-Caches durch das selektive Zusammenführen oder Verwerfen von Token basierend auf der Ähnlichkeit der Value-Vektoren und dem Ausgleich von Attention-Imbalancen mittels Logit-Bias komprimiert, wodurch eine nahezu verlustfreie Generierungsqualität und signifikante Geschwindigkeitssteigerungen bei der Beibehaltung von nur 25 % des ursprünglichen Caches erreicht werden.

Ursprüngliche Autoren: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

Veröffentlicht 2026-07-21
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine gewaltige, 100.000 Seiten starke Geschichte im Kopf zu behalten, während Sie ein neues Kapitel schreiben. Jedes Mal, wenn Ihnen ein Handlungspunkt einfällt, müssen Sie Ihr gesamtes Notizbuch durchblättern, um die richtigen Details zu finden. Je mehr Seiten Sie schreiben, desto schwerer wird Ihr Notizbuch, bis Ihre Arme zu müde sind, um es zu halten. Genau das passiert im „Gehirn“ eines Large Language Models (LLM), wenn es versucht, lange Texte zu verarbeiten. Diese Modelle sind unglaublich intelligent, aber sie haben ein Gedächtnisproblem: Während sie lesen, speichern sie einen „Key-Value-Cache“ – ein digitales Ablagesystem von allem, was sie bisher gesehen haben –, um zu verstehen, was als Nächstes kommt. Je länger der Text, desto größer wird dieser Aktenschrank, bis er schließlich den gesamten Computerspeicher ausfüllt und alles extrem verlangsamt.

Um dies zu beheben, haben Wissenschaftler zwei Haupttricks ausprobiert. Der erste ist „Eviction“ (Verdrängung), was so ist, als würde man alte Seiten wegwerfen, von denen man glaubt, dass sie nicht wichtig sind. Der zweite ist „Merging“ (Zusammenführen), was so ist, als würde man ähnliche Seiten zusammenkleben, um Platz zu sparen. Aber beide Methoden haben einen Makel. Das Wegwerfen von Seiten kann entscheidende Hinweise verlieren, und das Zusammenkleben von Seiten führt oft zu einer „verschwommenen“ Version, bei der das Modell vergisst, wie viel Aufmerksamkeit es der zusammengeklebten Gruppe schenken soll. Es ist, als würden Sie zehn Fotos einer Katze zusammenkleben; das Modell würde der einzelnen zusammengeklebten Masse vielleicht immer noch dieselbe Aufmerksamkeit schenken, die es auch einem einzigen Foto geschenkt hätte, obwohl diese Masse nun zehn Fotos repräsentiert. Dies führt dazu, dass das Modell verwirrt wird und Fehler macht.

Hier kommt SelKV ins Spiel, eine neue, clevere Methode, die wie ein intelligenter Bibliothekar für diese digitalen Aktenschränke fungiert. Anstatt Seiten blind zusammenzukleben oder sie in den Müll zu werfen, nutzt SelKV ein „Soft Cosine Gate“ – denken Sie an einen Türsteher in einem Club, der prüft, wie ähnlich sich zwei Seiten sehen, bevor er entscheidet, was zu tun ist. Wenn zwei Seiten sehr ähnlich sind, werden sie fest zusammengeklebt. Wenn sie völlig unterschiedlich sind, schickt der Türsteher eine davon weg, um das Gedächtnis sauber zu halten. Aber die wahre Magie ist die „Attention Compensation“ (Aufmerksamkeitskompensation). Da das Zusammenkleben von Seiten das Modell normalerweise dazu bringt, sie zu ignorieren, fügt SelKV eine kleine „Lautstärkesteigerung“ für die zusammengeklebten Seiten hinzu, um sicherzustellen, dass das Modell die richtige Menge an Aufmerksamkeit auf sie verwendet.

Die Forscher testeten dieses System an drei verschiedenen KI-Modellen bei 16 verschiedenen Aufgaben, vom Beantworten von Fragen zu mehreren Dokumenten bis hin zum Schreiben von Code. Sie fanden heraus, dass SelKV, indem es nur 25 % des ursprünglichen Speicherplatzes beibehält, fast so gut abschnitt wie mit dem vollen Speicher, und in einigen schwierigen Multi-Dokument-Quiz sogar besser abschnitt als die Vollversion. Es scheint, dass die KI durch das selektive Vorgehen tatsächlich auf die wichtigsten Teile der Geschichte fokussiert war. Darüber hinaus machte diese Methode die KI deutlich schneller beim Dekodieren von Text, wenn dieser riesig wurde (100.000 Token); sie dekodierte den Text 3,3-mal schneller. Das Paper legt nahe, dass dieser Ansatz besonders gut für moderne KI-Modelle ist, die eine spezifische Art von Attention verwenden (genannt GQA), und bietet einen Weg, diese leistungsstarken Gehirne schnell laufen zu lassen, ohne ihr Gedächtnis zu verlieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →