← Neueste Arbeiten
💻 computer science

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

Dieses Paper schlägt CLSE vor, ein trainingsfreies Token-Pruning-Framework, das die kreuzschichtspezifische spektrale Evolution im Frequenzbereich quantifiziert, um semantisch aktive visuelle Token zu identifizieren und zu bewahren, wodurch multimodale große Sprachmodelle beschleunigt werden, während die Leistungsfähigkeit des Schließens aufrechterhalten oder verbessert wird.

Ursprüngliche Autoren: Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

Veröffentlicht 2026-06-24
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, ein komplexes Puzzle zu lösen, aber der Karton enthält 1.000 Teile, von denen 800 nur Bilder vom blauen Himmel oder dem leeren Tisch sind. Ein Standardcomputer (ein Multimodales Großes Sprachmodell oder MLLM) versucht, jedes einzelne dieser 1.000 Teile anzusehen, um das Bild zu erkennen. Das dauert lange und verbraucht viel Energie, obwohl die meisten dieser Teile gar nicht dabei helfen, das Puzzle zu lösen.

Dieses Paper stellt eine neue, „trainingsfreie“ Methode vor, um die nutzlosen Teile (redundante Token) schnell auszusortieren, damit der Computer sich nur auf die wichtigen konzentrieren kann, ohne neu darauf trainiert werden zu müssen.

So funktioniert die neue Methode der Autoren, genannt CLSE (Cross-Layer Spectral Evolution), unter Verwendung einiger einfacher Analogien:

1. Das Problem: Der „Spotlight“ ist voreingenommen

Aktuelle Methoden versuchen zu entscheiden, welche Puzzleteile wichtig sind, indem sie einen „Spotlight“ (genannt Attention-Scores) im Gehirn des Computers betrachten.

  • Der Fehler: Das Paper argumentiert, dass dieser Spotlight etwas fehlerhaft ist. Er neigt dazu, heller auf Teile zu leuchten, die später in der Liste erscheinen, einfach weil sie dort sitzen, nicht weil sie tatsächlich wichtig sind. Es ist wie ein Lehrer, der eine Prüfung bewertet und versehentlich den Antworten am Ende der Seite höhere Punktzahlen gibt, unabhängig davon, ob sie korrekt sind oder nicht.
  • Das Ergebnis: Der Computer könnte nutzlose Hintergrundteile behalten und die entscheidenden Teile wegwerfen.

2. Die Lösung: Den „Tanz“ der Teile beobachten

Anstatt eine einzelne Momentaufnahme der Wichtigkeit zu machen, schlagen die Autoren vor, zu beobachten, wie sich die Teile verändern, während sie durch die Schichten des Computers wandern (wie das Weiterreichen eines Balls bei einem Staffellauf).

  • Die Analogie: Stellen Sie sich vor, die visuellen Token (Puzzleteile) sind Tänzer.
    • Hintergrundteile (wie der Himmel) sind langweilige Tänzer. Sie stehen still und machen von Anfang bis Ende des Liedes exakt dieselbe Bewegung. Sie verändern sich nicht.
    • Wichtige Teile (wie ein Motorrad, das einen Trick macht) sind dynamische Tänzer. Sie beginnen mit einer einfachen Pose (niedrige Details) und verwandeln sich im Verlauf des Liedes in eine komplexe, bedeutungsvolle Routine (hohe Bedeutung).
  • Die Methode: Die Autoren verwenden ein mathematisches Werkzeug namens Spectral Evolution (denken Sie an einen „Veränderungsdetektor“), um zu messen, wie sehr sich die Routine eines Tänzers von einer Schicht zur nächsten verändert.
    • Wenn ein Token sich viel verändert (evolviert), wird er behalten, weil er etwas Wichtiges tut.
    • Wenn ein Token gleich bleibt (statisch ist), wird er weggeworfen, weil er nur Hintergrundrauschen ist.

3. Warum „Frequenz“ wichtig ist

Das Paper nutzt das Konzept der „Frequenz“ (aus der Musik oder von Radio-Wellen), um dies zu erklären.

  • Niedrige Frequenz: Denken Sie an ein sanftes, langsames Summen. Dies repräsentiert den langweiligen, unveränderlichen Hintergrund.
  • Hohe Frequenz: Denken Sie an einen scharfen, schnellen Trommelwirbel. Dies repräsentiert die feinen Details und plötzlichen Veränderungen, die die interessanten Teile des Bildes ausmachen.
  • Der Trick: Die neue Methode filtert das „sanfte Summen“ (den langweiligen Hintergrund) heraus und konzentriert sich nur auf die „Trommelwirbel“ (die sich entwickelnden, wichtigen Details), während sie durch die Schichten evolvieren.

4. Die Ergebnisse: Schneller und Schlauer

Die Autoren haben dies an vielen verschiedenen Modellen und Aufgaben getestet (wie dem Beantworten von Fragen zu Bildern und Videos).

  • Das Ergebnis: Indem sie die „langweiligen Tänzer“ aussortierten und die „dynamischen“ behielten, wurde der Computer viel schneller (verbrauchte weniger Energie und Speicher), ohne seine Fähigkeit zu verlieren, das Bild zu verstehen. Tatsächlich war er in vielen Fällen sogar besser als andere Methoden, die versuchten, die Wichtigkeit mittels des fehlerhaften „Spotlights“ (Attention) zu erraten.
  • Video: Dies funktionierte besonders gut bei Videos, bei denen es noch mehr „langweilige“ Wiederholungen zwischen den Frames gibt. Die Methode konnte die Anzahl der Teile, die der Computer verarbeiten musste, um über 90 % reduzieren, während sie die Handlung immer noch perfekt verstand.

Zusammenfassung

Kurz gesagt: Dieses Paper sagt: Schau nicht nur einmal auf ein Teil, um zu entscheiden, ob es wichtig ist. Beobachte, wie es sich verändert, während es durch das System wandert. Wenn es gleich bleibt, ist es wahrscheinlich nur Hintergrundrauschen. Wenn es sich entwickelt und verwandelt, ist es der Schlüssel zum Verständnis des Bildes. Dies ermöglicht es der KI, viel schneller zu werden, ohne verwirrt zu werden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →