← Neueste Arbeiten
🤖 machine learning

AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference

AsymVLM ist ein effizientes Inferenzframework für Vision-Language-Modelle, das die unterschiedlichen Eigenschaften visueller und textueller Modalitäten nutzt, indem es aggressives, adaptives Pruning auf räumlich redundante Vision-Token und eine zeitbasierte Schwellenwert-Verdrängung auf Text-Token anwendet, wodurch bis zu 54 % FLOPs eingespart werden, während es gleichzeitig die State-of-the-Art-Methoden bei Aufgaben zum Verständnis von Dokumenten und Diagrammen übertrifft.

Ursprüngliche Autoren: Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan Kandemir

Veröffentlicht 2026-05-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan Kandemir

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich ein Vision-Language-Modell (VLM) als hochintelligenten, aber leicht überforderten Assistenten vor. Sie zeigen ihm ein Bild (wie ein komplexes Dokument oder eine Grafik) und stellen eine Frage. Um das Bild zu verstehen, zerlegt der Assistent es in Tausende winziger Puzzlestücke, sogenannte „Vision-Tokens". Um Ihre Frage zu verstehen und eine Antwort zu formulieren, verwendet er eine kleinere Menge an „Text-Tokens".

Das Problem ist, dass der „Arbeitsspeicher" des Assistenten (sein GPU-Speicher) überfüllt wird. Er versucht, jedes einzelne Puzzlestück und jedes generierte Wort festzuhalten, was ihn langsam und teuer im Betrieb macht.

Bestehende Methoden versuchen dies zu beheben, indem sie die Bildstücke und die Wörter exakt gleich behandeln: Sie werfen einfach einen festen Prozentsatz von allem weg (z. B. „lösche 50 % der Puzzlestücke und 50 % der Wörter"). Die Autoren dieses Papiers, AsymVLM, argumentieren, dass dies so ist, als würde man versuchen, eine Bibliothek zu organisieren, indem man die Hälfte der Bücher und die Hälfte der Lesezeichen wegwirft, ohne darüber nachzudenken, was sie eigentlich bewirken.

So funktioniert AsymVLM, unter Verwendung einfacher Analogien:

1. Die zwei unterschiedlichen Probleme

Das Papier weist darauf hin, dass Bildstücke und Wörter grundlegend unterschiedlich sind:

  • Vision-Tokens (Die Puzzlestücke): Diese sind alle unabhängig voneinander. Wenn Sie ein Stück des Himmels aus einem Foto entfernen, ist das benachbarte Stück des Baumes davon unberührt. Sie sind „räumlich redundant", was bedeutet, dass viele Stücke nur Hintergrundrauschen sind.
  • Text-Tokens (Die Geschichte): Diese bilden eine Kettenreaktion. Wort 2 hängt von Wort 1 ab, und Wort 3 hängt von Wort 2 ab. Wenn Sie ein Wort in der Mitte eines Satzes löschen, kann der Rest der Geschichte sinnlos werden.

2. Die Lösung: Eine zweigleisige Strategie

Anstatt eine einzige Regel für alles zu verwenden, setzt AsymVLM zwei verschiedene Strategien ein, die auf jeden Token-Typ zugeschnitten sind.

Strategie A: Der „intelligente Redakteur" für Bilder (Vision-Token-Pruning)

Bevor der Assistent überhaupt beginnt zu denken, agiert AsymVLM wie ein intelligenter Redakteur, der das Foto betrachtet.

  • Der alte Weg: „Lösche 50 % der Pixel zufällig" oder „Lösche diejenigen, die für die Frage am wenigsten wichtig erscheinen."
  • Der AsymVLM-Weg: Er verwendet einen gelernten Scorer. Stellen Sie sich einen Trainer vor, der Tausende von Spielen gesehen hat und genau weiß, welche Spieler (Tokens) tatsächlich zum Sieg beitragen. Dieser Scorer betrachtet nicht nur das Bild; er betrachtet, wie das Bild mit der spezifischen Frage verbunden ist, die Sie gestellt haben.
  • Das „adaptive Budget": Dies ist der cleverste Teil. Das Papier stellt fest, dass einige Fragen einen vollständigen Scan des Bildes erfordern (z. B. „Wie viele Äpfel sind in diesem Obstgarten?"), während andere nur einen winzigen Bereich benötigen (z. B. „Was ist der Preis des roten Apfels?").
    • Wenn die Frage auf einen kleinen Bereich beschränkt ist, ist die „Lücke" zwischen wichtigen und unwichtigen Stücken riesig. Das System sagt: „Großartig, wir können aggressiv vorgehen und 75 % des Bildes wegwerfen!"
    • Wenn die Frage das gesamte Bild benötigt, ist die „Lücke" klein. Das System sagt: „Okay, behalten wir 90 % des Bildes, nur um auf der sicheren Seite zu sein."
    • Analogie: Es ist wie das Packen eines Koffers. Wenn Sie für einen Tag an den Strand fahren, packen Sie leicht. Wenn Sie eine monatelange Reise antreten, packen Sie mehr. AsymVLM passt das „Packen" an die spezifische Reise an, anstatt für alle die gleiche Koffergröße zu verwenden.

Strategie B: Der „Speicher-Hausmeister" für Text (Text-Token-Eviction)

Sobald der Assistent beginnt, eine Antwort zu generieren, schreibt er Wort für Wort. Wenn das Gespräch lang wird, füllt sich der Speicher.

  • Der alte Weg: Standardmethoden für rein textbasierte KI (wie H2O oder StreamingLLM) versuchen, die ältesten oder am wenigsten „wichtigen" Wörter zu löschen, um Platz für neue zu schaffen.
  • Der AsymVLM-Weg: Die Autoren stellten fest, dass in diesen visuellen Assistenten das Gespräch meist kurz ist und das Bild der wichtigste Kontext ist.
    • Sie setzen ein festes Budget. Der Assistent schreibt weiter, bis er ein Limit erreicht (z. B. 500 Wörter).
    • Sobald er das Limit erreicht, beginnt er, die ältesten generierten Wörter zu löschen (diejenigen, die für den unmittelbar nächsten Satz nicht mehr benötigt werden), aber er löscht niemals das ursprüngliche Bild oder die ursprüngliche Frage.
    • Analogie: Stellen Sie sich vor, Sie erzählen einem Freund eine Geschichte. Sie müssen sich nicht an den ersten Satz erinnern, den Sie vor 10 Minuten sagten, um den aktuellen Satz zu beenden. AsymVLM agiert wie ein Hausmeister, der die alten, irrelevanten Entwürfe von der Whiteboard-Tafel wischt, um Platz für den neuen Satz zu schaffen, aber er lässt den ursprünglichen Prompt und das Foto für immer an die Wand geheftet.

3. Die Ergebnisse: Schneller und intelligenter

Das Papier behauptet, dass AsymVLM durch die unterschiedliche Behandlung dieser beiden Datentypen Folgendes erreicht:

  • Massive Geschwindigkeitssteigerungen: Es spart bis zu 54 % der Rechenleistung (FLOPs) ein, die zum Ausführen des Modells benötigt werden. Dies liegt daran, dass es die unnötigen Bildstücke physisch vor Beginn der schweren Mathematik entfernt, anstatt sie nur während der Mathematik zu ignorieren.
  • Bessere Genauigkeit: Bei Aufgaben wie dem Lesen von Dokumenten oder dem Verstehen von Grafiken erzielt es tatsächlich 2–3 % bessere Ergebnisse als frühere Methoden. Dies liegt daran, dass es die spezifischen Bildstücke behält, die die Frage beantworten, und den Rest verwirft, während andere Methoden versehentlich das entscheidende Stück löschen könnten.
  • Speichereffizienz: Es reduziert den Speicherbedarf zum Ausführen des Modells, sodass es auf kleinere, günstigere Computerchips passt, die das vollständige, nicht beschnittene Modell nicht bewältigen könnten.

Zusammenfassung

AsymVLM ist ein System, das erkennt, dass „ein Maß für alle" nicht passt. Es verwendet einen intelligenten, adaptiven Filter, um Bilder basierend auf der spezifischen Frage zu beschneiden, und einen sorgfältigen Hausmeister, um den Textspeicher zu verwalten, ohne den ursprünglichen Kontext zu verlieren. Das Ergebnis ist ein Vision-Language-Modell, das schneller ist, weniger Speicher verbraucht und beim Lesen von Dokumenten und Grafiken überraschend genauer ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →