← Neueste Arbeiten
🤖 machine learning

How Much Information Can a Vision Token Hold? A Scaling Law for Recognition Limits in VLMs

Diese Arbeit untersucht die Informationskapazitätsgrenzen von Vision-Tokens in Vision-Language-Modellen, indem sie einen dreiphasigen Übergang von Stabilität zu Kollaps unter zunehmender visueller Dichte identifiziert und ein universelles Skalierungsgesetz formuliert, um die Optimierung der Effizienz und Genauigkeit der Kontextkompression zu leiten.

Ursprüngliche Autoren: Shuxin Zhuang, Zi Liang, Runsheng Yu, Hongzong Li, Rong Feng, Shiqin Tang, Youzhi Zhang

Veröffentlicht 2026-02-04
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Shuxin Zhuang, Zi Liang, Runsheng Yu, Hongzong Li, Rong Feng, Shiqin Tang, Youzhi Zhang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die große Frage: Wie viel kann ein einzelner „Vision-Token“ tragen?

Stellen Sie sich vor, Sie möchten einem Freund einen sehr langen Brief schicken, dürfen aber nur eine winzige Anzahl an Postkarten verwenden, um dies zu tun. Sie müssen den gesamten Brief auf diese wenigen Postkarten quetschen.

In der Welt der KI funktionieren Vision-Language-Modelle (VLMs) ähnlich. Sie betrachten ein Bild (wie eine gescannte Textseite) und wandeln es in eine Sequenz digitaler „Tokens“ (kleine Datenpakete) um, die das KI-Gehirn lesen kann.

Diese Arbeit stellt eine grundlegende Frage: Gibt es eine Grenze dafür, wie viel Information wir in einen einzelnen Vision-Token quetschen können? Wenn wir versuchen, zu viel Text in ein Bild zu packen und die KI zwingen, diesen in zu wenige Tokens zu komprimieren, was passiert dann?

Das Experiment: Der „Stresstest“

Die Forscher haben nicht nur geraten; sie haben einen Stresstest durchgeführt. Sie erstellten Bilder, die voller reiner Texte waren (wie Romane, Gesetze oder Briefe), und erhöhten langsam die Menge des Textes in jedem Bild. Sie hielten die Anzahl der „Postkarten“ (Vision-Tokens), die die KI verwenden durfte, konstant und beobachteten dann, was passierte, während der Text länger und dichter wurde.

Die drei Phasen des Scheiterns

Anstatt dass die Leistung der KI mit zunehmender Textlänge langsam nachließ, fanden die Forscher heraus, dass die Leistung nicht allmählich abnahm. Stattdessen durchlief sie drei deutliche „Phasen“, wie eine Glühbirne, die flackert, bevor sie durchbrennt:

  1. Die stabile Phase (Der „Leicht-Modus“):

    • Was passiert: Die KI liest den Text perfekt.
    • Analogie: Stellen Sie sich ein klares Fenster vor. Sie können alles perfekt sehen, weil sich nicht zu viel Zeug davor befindet. Die KI hat genug „Platz“ in ihren Tokens, um den Text zu beschreiben.
  2. Die Instabilitätsphase (Der „Flacker-Modus“):

    • Was passiert: Die KI beginnt Fehler zu machen, aber es ist chaotisch. Manchmal liest sie den Text richtig; ein anderes Mal versagt sie völlig, selbst wenn die Textmenge fast dieselbe ist.
    • Die Ursache: Das liegt nicht daran, dass die KI „dumm“ ist. Es liegt am Grid-Alignment (Rasterausrichtung).
    • Analogie: Stellen Sie sich vor, die KI betrachtet das Bild durch ein Gitter aus quadratischen Fenstern (wie einen Maschendrahtzaun). Wenn ein Buchstabe zufällig genau auf der Linie zwischen zwei Fenstern liegt, wird die KI verwirrt. Sie sieht vielleicht die eine Hälfte eines Buchstabens in einem Fenster und die andere Hälfte im nächsten, und kann sie nicht zusammenfügen.
    • Die Lösung: Die Forscher bewiesen dies, indem sie das Bild leicht verschoben haben (wie das Verschieben eines Bildes an einer Wand). Als sie es verschoben, wurden die „schlechten“ Buchstaben plötzlich wieder zu „guten“. Das bedeutet, die Information war noch da; sie war nur hinter dem falschen Teil des Gitters verborgen.
  3. Die Kollapsphase (Die „harte Wand“):

    • Was passiert: Die KI gibt plötzlich auf. Die Fehlerrate schießt in die Höhe, und sie kann den Text überhaupt nicht mehr lesen.
    • Die Ursache: Dies ist ein echtes Kapazitätslimit.
    • Analogie: Stellen Sie sich vor, Sie haben einen Rucksack, der nur 5 Pfund tragen kann. Wenn Sie versuchen, 50 Pfund Bücher hineinzustopfen, wird der Rucksack nicht einfach nur „ein bisschen unordentlich“ – er reißt auf und alles fällt heraus. Egal, wie Sie den Rucksack verschieben oder die Bücher neu anordnen, er kann einfach nicht dieses Gewicht halten. Die KI hat ihren „mentalen Raum“ aufgebraucht, um die Information zu kodieren.

Die „magische Formel“ (Skalierungsgesetz)

Die Forscher hörten nicht nur bei der Feststellung des Problems auf; sie entwickelten eine mathematische Regel (ein Skalierungsgesetz), um genau vorherzusagen, wann die KI scheitern wird.

Sie fanden heraus, dass zwei Dinge am wichtigsten sind:

  1. Wie viel Text vorhanden ist? (Die Gesamtlast).
  2. Wie dicht gedrängt ist der Text? (Die Dichte).

Sie kombinierten diese zu einem einzigen „Schwierigkeitswert“.

  • Die Entdeckung: Die Textmenge ist viel wichtiger als die Dichte der Buchstaben.
  • Die „Instabilitätszone“ ist konsistent: Sie fanden heraus, dass die „Flackerphase“ (in der die KI verwirrt ist) immer etwa das 2,2-fache der Textlänge dauert, unabhängig davon, wie groß das Bild ist. Es ist eine vorhersagbare Pufferzone vor dem totalen Kollaps.

Warum das wichtig ist (laut der Arbeit)

Die Arbeit kommt zu dem Schluss, dass die Umwandlung von Bildern in Text-Tokens zwar eine großartige Methode ist, um Rechenleistung zu sparen, es aber eine harte physikalische Grenze gibt, wie viel Information auf diesem Weg komprimiert werden kann.

  • Für Entwickler: Wenn Sie eine KI bauen wollen, die lange Dokumente liest, können Sie nicht einfach raten, wie viele Tokens Sie verwenden sollen. Sie müssen zuerst den „Schwierigkeitswert“ berechnen. Wenn der Text zu dicht ist, müssen Sie der KI mehr Tokens (mehr „Postkarten“) geben, sonst stößt das System gegen die „harte Wand“ und scheitert.
  • Das Fazit: Vision-Tokens sind leistungsstark, aber sie sind keine Magie. Sie haben eine endliche Kapazität, und sobald man diese Linie überschreitet, ist die Information verloren – nicht nur verwirrt, sondern unwiederbringlich verloren.

Zusammenfassung in einem Satz

Die Arbeit beweist, dass Vision-Systeme einen „Bruchpunkt“ haben, an dem sie nicht mehr lesen können, verursacht durch eine erste Fehlstellung des Bildes im internen Gitter der KI und schließlich durch den schlichten Mangel an digitalem Platz, um die Information zu halten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →