← Neueste Arbeiten
💻 computer science

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

Die Studie stellt mit REST und REST+ neue Benchmarks vor, um die inkonsistente reasoning-Fähigkeit multimodaler großer Sprachmodelle (MLLMs) über verschiedene Modalitäten hinweg zu untersuchen und zeigt, dass selbst korrekte Texterkennung nicht ausreicht, um diese Diskrepanz zu beheben.

Ursprüngliche Autoren: Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

Veröffentlicht 2026-04-23
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Titel: Wenn das Gleiche unterschiedlich klingt: Warum KI-Modelle verwirrt sind, wenn man ihnen Bilder statt Text zeigt

Stell dir vor, du hast einen sehr klugen Assistenten, der sowohl lesen als auch Bilder sehen kann. Du fragst ihn: „Wie viel ist 3 plus 3?"

  • Wenn du ihm den Text „3 + 3 = ?" schreibst, antwortet er sofort: „6".
  • Wenn du ihm aber ein Foto von der gleichen Frage zeigst, antwortet er plötzlich: „7".

Das klingt verrückt, oder? Genau das passiert bei den aktuellsten „Multimodalen Large Language Models" (MLLMs) – also den KI-Modellen, die sowohl Bilder als auch Text verstehen sollen. Eine neue Studie namens REST (Render-Equivalence Stress Tests) hat genau dieses Phänomen untersucht und einige überraschende Dinge herausgefunden.

Hier ist die Erklärung der Studie in einfachen Worten, mit ein paar kreativen Vergleichen:

1. Das Problem: Der „Zwillingseffekt"

Die Forscher haben sich vorgestellt, dass diese KI-Modelle wie ein Gehirn funktionieren, das alle Informationen in einem gemeinsamen Raum speichert. Man könnte denken: „Ein Bild von einer Zahl ist dasselbe wie der Text der Zahl."

Aber die Studie zeigt: Das ist nicht so.
Stell dir vor, die KI hat zwei verschiedene Bücher im Kopf:

  • Buch A (Text): Hier sind die Regeln perfekt verstanden.
  • Buch B (Bilder): Hier ist das Verständnis etwas wackelig, als würde man durch einen dichten Nebel schauen.

Wenn die KI eine Frage als Text bekommt, greift sie auf das klare Buch A zu. Wenn sie dieselbe Frage als Bild bekommt, greift sie auf das wackelige Buch B zu. Obwohl der Inhalt (die Frage) identisch ist, ist der Weg, wie die KI dorthin gelangt, völlig anders. Das führt zu inkonsistenten Antworten.

2. Der Test: Der „Spiegel-Test" für KI

Um das zu beweisen, haben die Forscher einen cleveren Test entwickelt, den sie REST nennen.

  • Sie nehmen eine Frage (z. B. eine Matheaufgabe).
  • Sie stellen sie in drei Formen:
    1. Als reinen Text.
    2. Als Foto (die Zahlen sind auf einem Bild).
    3. Als Mischung (Frage als Text, Hintergrund als Bild).

Dann schauen sie sich an: Gibt die KI bei allen drei Formen die gleiche Antwort?
Das Ergebnis: Fast keine der 15 getesteten Top-KIs schafft das perfekt. Selbst die besten Modelle (wie GPT-5-mini oder Claude Haiku) liefern in etwa 10 % der Fälle unterschiedliche Antworten, je nachdem, ob sie die Frage lesen oder sehen müssen.

3. Die Entschuldigung der KI: „Ich habe das Bild nicht richtig gelesen!"

Man könnte denken: „Na ja, vielleicht kann die KI die Zahlen auf dem Bild einfach nicht gut lesen (OCR-Fehler)."
Die Forscher waren schlau: Sie haben nur die Fragen ausgewertet, bei denen die KI den Text auf dem Bild perfekt erkannt hat.
Das Ergebnis: Selbst wenn die KI die Zahlen perfekt liest, antwortet sie trotzdem falsch!
Die Analogie: Stell dir vor, du siehst ein Schild mit der Aufschrift „STOP". Du liest das Wort perfekt. Aber anstatt zu stoppen, fährst du weiter, weil du das Bild des Schildes anders interpretierst als das geschriebene Wort. Das Problem liegt also nicht im „Sehen", sondern im „Denken".

4. Was macht den Unterschied? (Auflösung und Farben)

Die Studie hat auch untersucht, ob die Art des Bildes eine Rolle spielt.

  • Schriftart: Ob die Schrift kursive oder blockartig ist, macht kaum einen Unterschied.
  • Farbe: Hier wird es lustig! Die KI antwortet oft besser, wenn der Text auf dem Bild farbig ist (z. B. rot oder gelb) statt schwarz.
    • Vergleich: Es ist, als würde ein Schüler auf einem schwarzen Blatt Papier schlecht rechnen, aber auf einem bunten Zettel plötzlich genial werden. Die Farben scheinen der KI somehow „helfen", den Fokus zu behalten.
  • Auflösung: Je schärfer das Bild (mehr Pixel), desto besser funktioniert die KI. Bei unscharfen Bildern (wie bei einem alten Handyfoto) wird die KI verwirrter.

5. Das Geheimnis im Inneren: Warum passiert das?

Die Forscher haben in das „Gehirn" der KI geschaut (in die mathematischen Repräsentationen).
Sie haben festgestellt: Wenn die KI ein Wort liest und ein Bild sieht, landen diese Informationen an verschiedenen Orten in ihrem Gedächtnisraum.

  • Die Analogie: Stell dir vor, das Wort „Hund" liegt im Gedächtnis auf dem Boden. Das Bild eines Hundes liegt aber auf dem Dach. Obwohl es dasselbe Tier ist, sind die beiden Informationen so weit voneinander entfernt, dass die KI nicht merkt, dass sie zusammengehören. Je weiter die beiden Punkte voneinander entfernt sind, desto inkonsistenter ist die Antwort.

Fazit: Was lernen wir daraus?

Diese Studie zeigt uns, dass unsere fortschrittlichsten KI-Modelle noch nicht so „menschlich" denken, wie wir hoffen.

  • Sie sind Text-Experten, aber Bild-Liebhaber, die noch lernen müssen, Bilder genauso gut zu verstehen wie Texte.
  • Es reicht nicht, einfach nur Bilder in Text umzuwandeln (OCR), um das Problem zu lösen. Die KI muss lernen, dass ein Bild und ein Text dasselbe „Gedankenobjekt" sind.

Kurz gesagt: Wenn du eine KI testen willst, gib ihr nicht nur Text. Zeig ihr auch Bilder. Denn wenn sie bei beiden die gleiche Antwort gibt, dann ist sie wirklich schlau. Wenn nicht, dann ist sie nur ein bisschen verwirrt – genau wie wir manchmal, wenn wir zwischen verschiedenen Sprachen hin- und herwechseln.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →