← Neueste Arbeiten
💻 computer science

Unified Pix Token And Word Token Generative Language Model

Dieser Artikel stellt ein neuartiges generatives Sprachmodell vor, das Pixel- und Wort-Token durch spezifische architektonische Innovationen wie Farbfaltung und globale bedingte Aufmerksamkeit vereint, um die Grenzen aktueller ViT-basierter Vision-Encoder bei der Erkennung feiner visueller Details zu überwinden, und zeigt selbst bei kleinen Modellen und begrenzten Daten eine starke Leistung.

Ursprüngliche Autoren: Haun Leung, ZiNan Wang

Veröffentlicht 2026-05-15
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Haun Leung, ZiNan Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Computer beizubringen, gleichzeitig zu „sehen" und zu „sprechen". Derzeit verwenden die besten Computer eine Methode namens ViT (Vision Transformer), um Bilder zu betrachten. Die Autoren dieses Papers argumentieren, dass diese aktuelle Methode wie der Versuch ist, ein komplexes Gemälde zu beschreiben, indem man nur einen unscharfen, zusammengefassten Entwurf betrachtet. Dabei gehen winzige Details verloren, wie etwa die Kfz-Kennzeichennummer auf einem Auto oder kleiner Text auf einem Schild.

Hier ist eine einfache Aufschlüsselung ihrer neuen Idee, des Unified Pix Token and Word Token Model, unter Verwendung alltäglicher Analogien.

1. Das Problem: Der „unscharfe Entwurf" versus die „pixelgenaue" Realität

Aktuelle Methode (ViT/CLIP):
Stellen Sie sich vor, Sie haben ein riesiges Mosaik aus einer Million winziger Fliesen. Die aktuelle KI betrachtet nicht jede einzelne Fliese. Stattdessen gruppiert sie sie in große Blöcke (Patches) und fragt: „Wie sieht dieser gesamte Block aus?" Sie verwandelt diesen Block in ein einziges „Wort" oder eine Zusammenfassung.

  • Der Fehler: Wenn Sie nur eine winzige Fliese ändern (zum Beispiel eine Kfz-Kennzeichennummer von 1 auf 6), ändert sich die Zusammenfassung des gesamten Blocks komplett. Es ist so, als ob Sie einen Buchstaben in einem Satz ändern würden und die KI denken würde, der gesamte Absatz habe eine völlig andere Bedeutung. Dies macht sie schlecht darin, kleine Details zu erkennen.

Die neue Methode (Pix Token):
Die Autoren sagen: „Lassen Sie uns aufhören zu zusammenfassen. Geben wir jedem einzelnen Pixel (dem winzigsten Farbpunkt in einem Bild) sein eigenes einzigartiges Namensschild und seinen eigenen Eintrag im Wörterbuch."

  • Die Analogie: Anstatt Fliesen in Blöcke zu gruppieren, geben wir jeder einzelnen Fliese im Mosaik ihre eigene einzigartige Ausweisnummer. Wenn Sie eine Fliese ändern, ändert sich nur diese eine Ausweisnummer. Der Rest des Bildes bleibt genau gleich. Dies macht die KI viel empfindlicher für winzige Details.

2. Die Herausforderung: Zu viele Namen zum Merken

Das Problem:
Wenn Sie jedem Pixel einen eigenen Namen geben und ein Pixel eine von 16,7 Millionen Farben sein kann, landen Sie bei einem Wörterbuch, das unmöglich riesig ist. Es würde zu viel Rechenleistung benötigen, um jede einzelne Farbe nachzuschlagen.

Die Lösung: „Farbfaltung" (Color Folding)
Die Autoren schlagen einen cleveren Trick namens Color Folding vor.

  • Die Analogie: Stellen Sie sich eine Kiste mit 16,7 Millionen verschiedenen Blautönen vor. Für das menschliche Auge ist der Unterschied zwischen „Himmelblau" und „Himmelblau + ein winziger weißer Fleck" unsichtbar.
  • Die Korrektur: Das Modell gruppiert diese winzigen, nicht unterscheidbaren Töne zusammen. Es sagt: „Wir brauchen keine 16 Millionen Namen; lassen Sie uns einfach 4.000 Namen verwenden, die alle Farben abdecken, die Menschen tatsächlich sehen können."
  • Ergebnis: Dies verkleinert die Wörterbuchgröße massiv (wie das Falten einer riesigen Landkarte auf Taschengröße), ohne dass das Bild für das menschliche Auge unscharf aussieht. Es spart enorme Mengen an Rechenleistung.

3. Der Zaubertrick: „Global zu Lokal"-Aufmerksamkeit

Das Problem:
Selbst mit einem kleineren Wörterbuch ist es immer noch viel Arbeit, ein ganzes Bild pixelweise zu betrachten. Wenn Sie versuchen, jeden Pixel gleichzeitig mit jedem anderen Pixel zu vergleichen (Globale Aufmerksamkeit), wird der Computer überfordert, wie wenn man versuchen würde, 10.000 Personen gleichzeitig sprechen zu hören.

Die Lösung: „Fenster-Aufmerksamkeit" (Windowed Attention)
Das Modell teilt das Bild in kleine Fenster auf (wie durch einen kleinen quadratischen Rahmen zu schauen).

  1. Schritt 1: Es betrachtet ein kleines Fenster von Pixeln und ermittelt, wie sie zueinander in Beziehung stehen.
  2. Schritt 2: Es nimmt die „Zusammenfassung" dieses Fensters und geht zum nächsten über.
  3. Schritt 3: Es kombiniert diese Fensterzusammenfassungen, um das gesamte Bild zu verstehen.
  • Die Analogie: Anstatt zu versuchen, die ganze Menge auf einem Konzert auf einmal zu verstehen, hören Sie kleinen Gruppen von Freunden zu, die sich unterhalten, dann der nächsten Gruppe, und setzen schließlich zusammen, was die ganze Menge sagt. Die Autoren behaupten, dies sei eine „kluge Annäherung", die fast genauso gut funktioniert wie das Zuhören bei allen auf einmal, aber viel schneller ist.

4. Das große Ziel: Vereinigung von Wörtern und Bildern

Derzeit behandeln KI-Modelle Text und Bilder als zwei verschiedene Dinge. Sie lesen Text mit einem Gehirn und betrachten Bilder mit einem separaten „Übersetzer" (dem ViT-Encoder).

Das neue Modell:
Dieses Modell behandelt Pixel exakt so, wie es Wörter behandelt.

  • Die Analogie: Stellen Sie sich eine Sprache vor, in der „Apfel" ein Wort ist und eine bestimmte Rottönung ebenfalls ein Wort ist. Die KI kann einen Satz wie „Das [Rote Pixel] ist auf dem [Grünen Pixel]" genauso leicht lesen wie „Der Apfel ist auf dem Tisch."
  • Der Vorteil: Da es Pixel wie Wörter behandelt, kann es aus unüberwachten Daten lernen. Das bedeutet, es kann lernen, indem es einfach Millionen rohe Bilder im Internet betrachtet, ohne dass Menschen Etiketten wie „Das ist eine Katze" schreiben müssen. Es ist wie ein Kind, das zu sehen lernt, indem es einfach die Welt betrachtet, anstatt mit Lernkarten unterrichtet zu werden.

5. Was haben sie tatsächlich getan?

Die Autoren bauten eine kleine Version dieses Modells (120 Millionen Parameter) und trainierten es nur mit Bildern (noch ohne Text).

  • Das Ergebnis: Das Modell lernte erfolgreich. Der „Verlust" (ein Maß dafür, wie verwirrt die KI war) ging zurück, was bedeutet, dass es begann, die Muster der Pixel zu verstehen.
  • Die Behauptung: Sie glauben, dass dieses Modell, wenn man ihm mehr Rechenleistung und mehr Daten gibt, noch besser wird und demselben „Skalierungsgesetz" folgt, das textbasierte KI (wie GPT-3) so erfolgreich gemacht hat.

Zusammenfassung

Das Paper schlägt eine neue Art vor, wie Computer sehen können:

  1. Aufhören mit der Zusammenfassung von Bildern; geben Sie jedem Pixel seine eigene einzigartige Identität.
  2. Vereinfachen Sie die Farben (Farbfaltung), damit der Computer nicht überfordert wird.
  3. Schauen Sie in Fenstern statt auf einmal, um Energie zu sparen.
  4. Behandeln Sie Pixel wie Wörter, was es der KI ermöglicht, aus rohen Bildern zu lernen, ohne menschliche Lehrer zu benötigen.

Die Autoren glauben, dass dies eine bessere Grundlage für die Zukunft der KI-Vision ist als die aktuellen Methoden, obwohl sie zugeben, dass sie mehr Rechenleistung benötigen, um dies im großen Maßstab zu beweisen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →