← Neueste Arbeiten
💻 computer science

TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents

TongGuOCR ist ein neuartiges, layoutbewusstes und Token-augmentiertes OCR-Framework, das zur präzisen Transkription historischer chinesischer Dokumente entwickelt wurde, indem es ein Vorverarbeitungsmodul für kohärente Erkennungsblöcke sowie ein Token-augmentiertes Erkennungsmodul einsetzt, welches den Wortschatz für seltene Zeichen erweitert und räumliche Übergänge modelliert, wodurch es bestehende traditionelle und multimodale Modelle auf anspruchsvollen Benchmarks signifikant übertrifft.

Ursprüngliche Autoren: Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

Veröffentlicht 2026-08-07
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Detektiv, der versucht, ein tausend Jahre altes Tagebuch zu lesen, aber die Seiten sind mit Staub bedeckt, die Tinte ist verblasst und die Handschrift ist so seltsam, dass selbst Ihr klügster Freund nicht entziffern kann, was die Buchstaben bedeuten. Dies ist der tägliche Kampf von Historikern, die versuchen, die Geheimnisse chinesischer historischer Dokumente zu entschlüsseln. Seit Jahrhunderten sind diese kostbaren Texte in gescannten Bildern gefangen – Bildern von Papier, die Computer zwar sehen, aber nicht wie ein Mensch „lesen“ können. Um diese Bilder wieder in durchsuchbaren Text zu verwandeln, nutzen Wissenschaftler eine Technologie namens Optische Zeichenerkennung (OCR). Betrachten Sie OCR als einen superschnellen Roboter-Bibliothekar, der ein Bild einer Seite betrachtet und die Wörter abtippt, die er sieht. Wenn der Roboter jedoch auf alte Bücher mit unordentlichen Layouts, seltsamen Symbolen und Sätzen stößt, die in verwirrenden Mustern über die Seite springen, verliert sich der Roboter oft, überspringt Zeilen oder tippt Kauderwelsch.

Hier setzt ein neues Team von Forschern mit einer cleveren Lösung namens TongGuOCR an. Sie erkannten, dass die alte Art, Roboter das Lesen dieser Bücher beizubringen, so war, als würde man versuchen, eine ganze Pizza in einem einzigen Bissen zu essen; es war zu chaotisch und der Roboter konnte die Details nicht bewältigen. Stattdessen bauten sie ein System, das die Pizza zuerst in perfekte, handliche Scheiben schneidet (layoutbewusste Vorverarbeitung) und dem Roboter dann eine spezielle neue Sprache beibringt, um die seltsamen, seltenen Zutaten auf diesen Scheiben zu verstehen (token-augmentierte Erkennung). Durch die Kombination dieser beiden Tricks erschufen sie einen Roboter, der die Wörter nicht nur errät, sondern tatsächlich den Fluss des antiken Textes versteht, selbst wenn der Text in vertikalen Spalten geschrieben ist oder über die Seite verstreut liegt.

Das Problem: Warum antike Bücher Roboter scheitern lassen

Chinesische historische Dokumente sind wie eine Schatzkiste der Kultur, aber sie sind schwierig zu lesen. Sie weisen oft komplexe Layouts auf, bei denen der Text vertikal verläuft, Annotationen (kleine Notizen) zwischen die Zeilen gequetscht sind und die Lesereihenfolge nicht immer von links nach rechts oder von oben nach unten verläuft. Darüber hinaus sind diese Bücher voll von „seltenen Schriftzeichen“ – antiken Symbolen, die in modernen Wörterbüchern nicht existieren.

Wenn Standard-KI-Modelle versuchen, diese Seiten zu lesen, bekommen sie drei große Kopfschmerzen:

  1. Das Layout-Chaos: Wenn der Roboter die ganze Seite auf einmal betrachtet, wird das Bild unscharf und er verliert den Kontext der benachbarten Wörter. Wenn er nur eine Zeile nach der anderen betrachtet, verliert er das große Ganze und wird verwirrt darüber, wohin er als Nächstes gehen soll.
  2. Das Problem der seltenen Schriftzeichen: Moderne KI wird auf die heutige Sprache trainiert. Wenn sie ein antikes, seltenes Schriftzeichen sieht, zerlegt sie es oft in winzige, bedeutungslose Fragmente (als würde man versuchen, ein Wort zu buchstabieren, indem man einzelne Buchstaben rät, anstatt das ganze Wort zu erkennen). Dies macht es schwierig, das Schriftzeichen korrekt zu erfassen.
  3. Die „Was kommt als Nächstes?“-Verwirrung: Nachdem er eine Zeile gelesen hat, weiß der Roboter oft nicht, ob er zur Zeile darunter, zur Zeile rechts oder zu einer Notiz am Rand springen soll. Ohne eine klare Karte überspringt er Zeilen oder liest sie in der falschen Reihenfolge.

Die Lösung: Der zweistufigen Magie von TongGuOCR

Das Forschungsteam der South China University of Technology und Huawei schlug TongGuOCR vor, ein Framework, das speziell entwickelt wurde, um diese antiken Rätsel zu lösen. Sie haben nicht einfach nur mehr Rechenleistung auf das Problem geworfen; sie haben geändert, wie der Roboter den Text sieht und darüber denkt.

Schritt 1: Der intelligente Schneider (Layout-bewusste Vorverarbeitung)

Stellen Sie sich vor, Sie versuchen, eine dichte, vollgepackte Zeitung zu lesen. Wenn Sie versuchen, die ganze Seite zu lesen, werden Ihre Augen müde. Wenn Sie eine Zeile nach der anderen lesen, verlieren Sie die Bedeutung. TongGu-OCR nutzt einen „Smart Slicer“, um die Seite in Erkennungsblöcke zu schneiden.

Anstatt nur gerade Linien zu schneiden, betrachtet das System die Seite und gruppiert aufeinanderfolgende Textzeilen in ordentliche, kohärente Blöcke. Es ist wie ein Koch, der einen Kuchen sorgfältig in perfekte, mundgerechte Stücke schneidet, die den Frosting und den Kuchen zusammenhalten, anstatt ihn nur wahllos zu zerhacken.

  • Wie es funktioniert: Das System nimmt die Textzeilen und gruppiert sie in Blöcke, die visuell sinnvoll sind. Es beschneidet diese Blöcke dann so, dass störende Teile der Seite, die nicht zu diesem spezifischen Abschnitt gehören, entfernt werden.
  • Das Ergebnis: Der Roboter erhält ein klares, fokussiertes Bild eines kleinen Textabschnitts. Dies bewahrt den lokalen Kontext (sodass er weiß, welche Wörter in der Nähe zueinander stehen) ohne das Rauschen des restlichen der Seite.

Schritt 2: Der spezielle Übersetzer (Token-augmentierte Erkennung)

Sobald der Text in perfekte Blöcke geschnitten ist, muss der Roboter ihn lesen. Hier nutzt TongGuOCR einen „Speziellen Übersetzer“, der zwei neue Sprachen spricht, um dem Roboter zu helfen, antiken Text besser zu verstehen.

  • Sprache 1: Das Wörterbuch für seltene Schriftzeichen.
    Moderne KI-Tokenizer (Werkzeuge, die Text in Teile zerlegen, damit der Computer ihn lesen kann) zerlegen seltene antike Schriftzeichen oft in winzige, verwirrende Fragmente. TongGuOCR behebt dies, indem es jedem seltenen Schriftzeichen eine eigene Single-Token-Identität gibt.

    • Die Analogie: Stellen Sie sich vor, Sie lernen eine neue Sprache. Anstatt ein schwieriges Wort jedes Mal Buchstabe für Buchstabe buchstabieren zu müssen, erhalten Sie einen speziellen Aufkleber mit dem ganzen Wort darauf. Sie kleben den Aufkleber einfach auf, und fertig. Dies ermöglicht es dem Roboter, seltene Schriftzeichen viel schneller und genauer zu erkennen.
  • Sprache 2: Die „Was kommt als Nächstes?“-Karte.
    Um die Verwirrung über die Lesereihenfolge zu lösen, fügt das System spezielle Übergangstoken zwischen den Zeilen ein. Dies sind wie kleine Pfeile oder Wegweiser, die dem Roboter genau sagen, wohin er als Nächstes schauen soll.

    • Die Analogie: Wenn Sie ein Comic lesen, bei dem die Panels hin und her springen, benötigen Sie einen Führer, der sagt: „Nach diesem Panel springe nach oben rechts.“ TongGuOCR fügt diese digitalen Wegweiser (wie <rechts|unten> oder <links|oben>) in den Textstrom ein. Dies leitet das Auge des Roboters entlang des korrekten Pfades und verhindert, dass er Zeilen überspringt oder sie rückwärts liest.

Die Ergebnisse: Ein neuer Rekord für antiken Text

Das Team testete TongGuOCR auf zwei wichtigen Benchmarks für chinesische historische Dokumente: MTHv2 und M5HisDoc. Diese Datensätze sind wie die „Olympics“ der antiken Texterkennung, gefüllt mit schwierigen Layouts und seltenen Schriftzeichen.

Die Ergebnisse waren beeindruckend. TongGuOCR war nicht nur gut; es schlug die besten existierenden Methoden, einschließlich massiver, allgemeiner KI-Modelle und anderer spezialisierter OCR-Tools.

  • Auf dem anspruchsvollen M5HisDoc-Benchmark erreichte TongGuOCR eine Genauigkeitsrate (AR) von 93,76 %.
  • Es reduzierte die Normalisierte Edit-Distanz (NED) – ein Maß dafür, wie viele Fehler der Roboter machte – von 10,43 auf 6,15.
  • Am wichtigsten für den Lesefluss: Es senkte die Lesereihenfolge-Edit-Distanz (RO-ED) von 7,53 auf 3,49. Das bedeutet, der Roboter war viel besser darin, dem korrekten Pfad durch den Text zu folgen, und übersprang selten eine Zeile oder verirrte sich.

In einem visuellen Vergleich (gezeigt in Abbildung 4 der Arbeit) haben andere Modelle zwar Zeilen übersehen, Text in der falschen Reihenfolge gelesen oder seltene Schriftzeichen verstümmelt, aber TongGuOCR konnte jede Zielzeile erfolgreich wiederherstellen und der natürlichen Lesereihenfolge der historischen Seite folgen.

Was dies bedeutet

Die Arbeit legt nahe, dass wir, um antike Texte effektiv zu lesen, uns nicht nur auf größere, leistungsfähigere KI-Modelle verlassen können. Wir müssen klüger darin werden, wie wir dem Modell die Daten zuführen. Indem wir die Seite in logische Abschnitte unterteilen (Layout-bewusste Vorverarbeitung) und dem Modell ein besseres Vokabular sowie eine klare Karte für die Lesereihenfolge geben (Token-augmentierte Erkennung), können wir die Geheimnisse der Geschichte entschlüsseln, die zuvor hinter unleserlichen Bildern verborgen waren.

Die Forscher merken an, dass ihr System zwar ein großer Schritt nach vorne ist, aber noch nicht perfekt ist. Es stützt sich auf die in seinen Trainingsdaten gefundenen Schriftzeichen, daher könnte es bei völlig unbekannten oder unentzifferten Symbolen immer noch Schwierigkeiten haben. Doch für die überwiegende Mehrheit der chinesischen historischen Dokumente bietet TongGuOCR einen kraftvollen neuen Schlüssel zur Vergangenheit, der statische Bilder in lebendigen, durchsuchbaren Text verwandelt, den Historiker und neugierige Geister erkunden können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →