← Neueste Arbeiten
💬 NLP

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

Dieser Artikel zeigt, dass Vision-Language-Modelle (VLMs), die OCR auf altgriechischen Texten anwenden, häufig auf Sprachpriors zurückgreifen, um flüssige, aber visuell nicht fundierte Fehler zu erzeugen, ein Versagensmodus, der selbst bei Eingriffen während des Dekodierens bestehen bleibt und sich erheblich von den Rauschmustern traditioneller OCR-Systeme unterscheidet.

Ursprüngliche Autoren: Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

Veröffentlicht 2026-05-28
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einen sehr alten, handschriftlichen Brief in Altgriechisch zu lesen. Die Tinte ist verblasst, die Buchstaben sind seltsam, und die Seite ist mit unordentlichen Notizen in den Rändern bedeckt. Sie haben zwei Helfer, die Ihnen beim Lesen helfen:

  1. Der „Old-School-Scanner" (traditionelle OCR): Dies ist wie ein strenger, wörtlicher Roboter. Er betrachtet die Tinte auf der Seite und sagt: „Ich sehe einen Kritzler, der wie ein 'A' aussieht, also werde ich ein 'A' schreiben." Wenn die Tinte zu verschwommen ist, schreibt er möglicherweise ein zufälliges Symbol oder einen Tippfehler. Er rät nicht; er meldet einfach, was er sieht, selbst wenn das Ergebnis unordentlich aussieht.
  2. Der „Smart AI Assistant" (Vision-Language-Modell): Dies ist wie ein brillanter Schüler, der Altgriechisch perfekt beherrscht, aber etwas faul darin ist, das Papier genau zu betrachten. Wenn er einen verschwommenen Fleck sieht, denkt er: „Hmm, basierend auf dem bisherigen Satz sollte das nächste Wort 'König' sein." Also schreibt er „König", selbst wenn die Tinte auf der Seite tatsächlich eher wie „Hund" aussah.

Diese Arbeit mit dem Titel „Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions" untersucht, was passiert, wenn diese beiden Helfer versuchen, schwierige, ressourcenarme altgriechische Texte zu lesen.

Hier ist, was die Forscher mit einfachen Analogien herausfanden:

1. Die „flüssige Lüge" vs. die „unordentliche Wahrheit"

Wenn der Old-School-Scanner einen Fehler macht, sieht dies normalerweise wie ein Tippfehler oder ein Durcheinander von Buchstaben aus (z. B. „kng"). Es ist offensichtlich, dass etwas schiefgelaufen ist.

Wenn jedoch der Smart AI Assistant einen Fehler macht, schreibt er oft ein perfekt reales, flüssiges altgriechisches Wort, das einfach nicht dem entspricht, was auf der Seite geschrieben stand.

  • Die Analogie: Stellen Sie sich vor, der KI liest ein Rezept. Wenn die Zutatenliste verschmiert ist und „Mehl" sagt, aber die KI weiß, dass dieses Rezept normalerweise „Zucker" erfordert, schreibt sie möglicherweise selbstbewusst „Zucker". Bei einem flüchtigen Blick sieht der Satz perfekt aus. Aber es ist tatsächlich eine Lüge. Die KI verlässt sich auf ihre Erinnerung daran, wie Rezepte normalerweise ablaufen (ihre „Sprachpriorität"), anstatt auf das spezifische Papier vor ihr zu schauen.

2. Der „Magische Tinte"-Test

Um dies zu beweisen, spielten die Forscher einen Trick. Sie nahmen den Text, durcheinanderbrachten die Buchstaben innerhalb der Wörter (und verwandelten echte Wörter in unsinnigen Kauderwelsch), und zeigten dann diesen Kauderwelsch den Helfern.

  • Der Old-School-Scanner: Er sah den Unsinn an und schrieb den Unsinn nieder. Er blieb der visuellen Evidenz treu, auch wenn das Ergebnis Müll war.
  • Der Smart AI Assistant: Er sah den Unsinn an, wurde verwirrt und „korrigierte" ihn dann. Er schrieb den Kauderwelsch zurück in echte, flüssige griechische Wörter um. Er ignorierte die visuelle Evidenz (die durcheinandergebrachten Buchstaben) und verließ sich vollständig auf sein internes Wissen über die Sprache.

3. Nicht alle „intelligenten" KIs sind gleich

Die Forscher entdeckten eine überraschende Wendung. Nicht alle KI-Assistenten verhalten sich gleich.

  • Die Generalist-KI: Dies sind die großen, berühmten Modelle, die für viele Aufgaben verwendet werden. Selbst wenn sie falsch lagen, schauten sie immer noch auf das Bild. Sie versuchten, die Tinte zu lesen, aber ihr Gehirn war einfach zu eifrig, das richtige Wort zu erraten.
  • Die Spezialist-KI: Es gab ein Modell, das speziell zum Lesen von Dokumenten entwickelt wurde (OlmOCR genannt). Dies war der schlimmste Übeltäter. Wenn es einen Fehler machte, war es fast so, als hätte es überhaupt nicht auf das Bild geschaut. Es rät rein basierend darauf, was es dachte, der Text sagen sollte. Es war wie ein Schüler, der die Augen schließt und das Lehrbuch auswendig aufsagt und dabei das eigentliche Prüfungspapier ignoriert.

4. Können wir die KI reparieren?

Die Forscher versuchten mehrere „Patches", um die KI zu zwingen, auf das Bild zu schauen, anstatt zu raten:

  • Der „Wortschatz-Zaun": Sie versuchten, der KI zu sagen: „Sie können nur griechische Buchstaben schreiben." Ergebnis: Dies machte die Dinge viel schlimmer. Die KI wurde verwirrt und fing an, Kauderwelsch zu schreiben, weil sie ihre üblichen Tricks nicht anwenden konnte.
  • Der „Kontrast-Test": Sie versuchten, der KI das Bild und eine verschwommene Version des Bildes gleichzeitig zu zeigen, um sie zu zwingen, sich auf die Details zu konzentrieren. Ergebnis: Dies half ein wenig bei einigen Modellen, aber nicht bei dem Spezialisten.
  • Die „Nachspiel-Redaktion": Sie ließen die KI zuerst ihre Antwort schreiben und ließen dann eine zweite KI (ein reiner Text-Editor) die Fehler beheben. Ergebnis: Dies funktionierte gut, um den Text zu bereinigen, aber es löste das Grundproblem nicht. Die erste KI ignorierte immer noch das Bild; die zweite KI reparierte einfach die Lüge, nachdem sie erzählt worden war.

Die große Erkenntnis

Die wichtigste Lehre ist, dass nur weil die Antwort einer KI perfekt und flüssig klingt, dies nicht bedeutet, dass sie das Dokument tatsächlich gelesen hat.

In der Welt der alten Geschichte und seltener Dokumente ist dies gefährlich. Wenn eine digitale Bibliothek diese KI-Modelle verwendet, um alte griechische Bücher zu scannen, könnte die KI stillschweigend ein seltenes, obskures Wort durch ein häufiges, „plausibles" ersetzen. Ein Historiker, der die digitale Version liest, würde niemals wissen, dass die Änderung stattgefunden hat, weil der Satz immer noch grammatikalisch perfekt aussieht.

Die Arbeit schließt damit, dass wir neue Wege benötigen, um KI zu testen, nicht nur indem wir prüfen, ob die Endnote hoch ist, sondern indem wir prüfen, ob die KI tatsächlich in der visuellen Evidenz „verankert" ist oder ob sie einfach nur basierend darauf rät, was dort sein sollte.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →