← Neueste Arbeiten
💬 NLP

Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference

Die Arbeit stellt ASL vor, eine trainingsfreie Methode, die die Schicht für die Token-Pruning in LLM-Inferenz basierend auf der Varianz der Aufmerksamkeitswerte dynamisch anpasst, um die Genauigkeit bei schwierigen Aufgaben zu verbessern und gleichzeitig die KV-Cache-Budgetanforderungen einzuhalten.

Ursprüngliche Autoren: Rei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao

Veröffentlicht 2026-04-17
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Rei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stell dir vor, ein großes Sprachmodell (LLM) ist wie ein genialer Bibliothekar, der gerade einen riesigen Roman liest, um dir eine Frage zu beantworten. Je länger der Roman ist, desto mehr Notizen muss der Bibliothekar machen, um sich an alles zu erinnern. Diese Notizen nennt man im Fachjargon „KV-Cache".

Das Problem: Wenn der Roman 100.000 Seiten hat, werden die Notizen so riesig, dass der Bibliothekar (der Computer) vor lauter Papierstapeln erstickt. Er braucht zu viel Speicherplatz und wird langsam.

Bisherige Lösungen waren wie ein starrer Schalter: „Ab Seite 500 werfen wir alle Notizen weg, außer den wichtigsten." Das Problem dabei ist: Manchmal ist Seite 500 noch viel zu früh. Vielleicht versteckt sich die entscheidende Information erst auf Seite 800. Wenn man zu früh schneidet, vergisst der Bibliothekar die Antwort. Wenn man zu spät schneidet, ist der Speicher immer noch voll.

ASL (Adaptive Selection Layer) ist die neue, clevere Lösung. Hier ist die Erklärung in einfachen Bildern:

1. Das Problem: Der starre Schalter

Stell dir vor, du hast einen Fotografen, der eine lange Reise dokumentiert.

  • Die alte Methode (z. B. FastKV): Der Fotograf hat einen festen Plan: „Ab Bild Nr. 150 mache ich nur noch Fotos von den wichtigsten Personen und ignoriere den Rest."
  • Das Problem: Bei einer entspannten Wanderung (einfache Aufgabe) ist das super. Aber bei einer komplexen Jagd nach einem versteckten Schatz (schwere Aufgabe wie „KV Retrieval") ist das Bild Nr. 150 noch voller verwirrender Details. Wenn der Fotograf jetzt aufhört, alle Details zu speichern, verpasst er den Schatz, weil er ihn erst auf Bild 200 sieht.

2. Die Lösung: Der adaptive Beobachter (ASL)

ASL ist wie ein intelligenter Assistent, der dem Fotografen nicht sagt, wann er aufhören soll, sondern ihm sagt: „Schau mal, wann sich die Dinge beruhigen."

Der Assistent beobachtet die Aufmerksamkeit des Bibliothekars (die „Aufmerksamkeits-Scores"):

  • Am Anfang (die ersten Seiten): Der Bibliothekar schaut sich alles an. Die Aufmerksamkeit ist wie ein wilder Wirbelwind – sie springt von Wort zu Wort, von Person zu Person. Niemand steht im Fokus. Das ist wie ein Sturm, bei dem man noch nicht weiß, wohin der Wind weht.
  • Im Verlauf: Langsam beruhigt sich der Sturm. Der Bibliothekar beginnt, sich auf bestimmte Schlüsselwörter zu konzentrieren. Die „Wahrscheinlichkeiten" stabilisieren sich.
  • Der Moment der Entscheidung: ASL misst die Unruhe (Varianz) in den Notizen. Solange die Unruhe hoch ist, macht der Assistent weiter: „Noch nicht schneiden! Wir brauchen noch mehr Kontext." Sobald die Unruhe unter einen bestimmten Wert fällt (der Wind sich beruhigt hat und nur noch auf ein paar Bäume bläst), sagt er: „Jetzt! Hier ist der Punkt, an dem wir wissen, was wichtig ist."

Erst an diesem Punkt werden die unwichtigen Notizen weggeworfen.

3. Warum ist das besser?

  • Bei einfachen Aufgaben: Der Sturm legt sich schnell. ASL schneidet früh ab (vielleicht bei Seite 150). Das spart viel Zeit und Speicher.
  • Bei schwierigen Aufgaben: Der Sturm dauert länger. ASL wartet geduldig bis Seite 250, bevor er schneidet. Der Bibliothekar hat genug Zeit, den Schatz zu finden, bevor er anfängt, Notizen zu vernichten.

Das Ergebnis: Der Bibliothekar ist nicht mehr starr an einen festen Punkt gebunden. Er passt sich der Aufgabe an.

  • Einfache Aufgaben? Schnell und effizient.
  • Schwere Aufgaben? Genau und zuverlässig, ohne den Speicher zu sprengen.

Zusammenfassung in einem Satz

ASL ist wie ein dynamischer Schiedsrichter, der nicht nach einer festen Uhrzeit pfeift, sondern wartet, bis das Spiel klar genug ist, um die wichtigsten Spieler auf dem Feld zu behalten und den Rest nach Hause zu schicken – egal, ob das Spiel schnell oder langsam verläuft.

Dadurch wird die KI schneller, braucht weniger Speicher, macht aber trotzdem weniger Fehler, besonders bei den kniffligen Aufgaben, bei denen andere Methoden scheitern.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →