← Nieuwste papers
💻 computer science

TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents

TongGuOCR is een nieuw layout-bewust en token-geaugmenteerd OCR-framework dat is ontworpen om Chinese historische documenten nauwkeurig te transcriberen door een voorverwerkingsmodule voor coherente herkenningsblokken en een token-geaugmenteerde herkenningsmodule te gebruiken die de vocabulaire uitbreidt voor zeldzame karakters en ruimtelijke transities modelleert, waardoor het bestaande traditionele en multimodale modellen op uitdagende benchmarks aanzienlijk overtreft.

Oorspronkelijke auteurs: Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

Gepubliceerd 2026-08-07
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die probeert een duizend jaar oud dagboek te lezen, maar de pagina's zijn bedekt met stof, de inkt is vervaagd en het handschrift is zo vreemd dat zelfs je slimste vriend niet kan ontcijferen wat de letters zeggen. Dit is de dagelijkse strijd van historici om de geheimen van Chinese historische documenten te ontsluiten. Eeuwenlang zijn deze kostbare teksten gevangen in gescande afbeeldingen—foto's van papier die computers wel kunnen "zien", maar niet kunnen "lezen" zoals een mens dat kan. Om deze plaatjes terug te veranderen in doorzoekbare tekst, gebruiken wetenschappers een technologie genaamd Optical Character Recognition (OCR). Denk aan OCR als een supersnelle robot-bibliothecaris die naar een foto van een pagina kijkt en de woorden typt die hij ziet. Echter, wanneer de robot wordt geconfronteerd met oude boeken met rommelige lay-outs, vreemde symbolen en zinnen die in verwarrende patronen over de pagina springen, raakt de robot vaak de weg kwijt, slaat hij regels over of typt hij onzin.

Hier komt een nieuw team onderzoekers met een slimme oplossing genaamd TongGuOCR. Ze realiseerden zich dat de oude manier om robots te leren deze boeken te lezen, leek op het proberen te eten van een hele pizza in één hap; het was te rommelig en de robot kon de details niet aan. In plaats daarvan bouwden ze een systeem dat de pizza eerst in perfecte, hanteerbare stukjes snijdt (layout-bewuste voorverwerking) en de robot vervolgens een speciale nieuwe taal leert om de vreemde, zeldzame ingrediënten op die stukjes te begrijpen (token-verrijkte herkenning). Door deze twee trucs te combineren, creëerden ze een robot die niet alleen woorden raadt, maar ook de stroom van de oude tekst begrijpt, zelfs wanneer de tekst in verticale kolommen is geschreven of verspreid over de pagina.

Het Probleem: Waarom Oude Boeken Robots Breken

Chinese historische documenten zijn als een schatkist van cultuur, maar ze zijn lastig te lezen. Ze hebben vaak complexe lay-outs waarbij tekst verticaal loopt, annotaties (kleine aantekeningen) tussen de regels zijn geplet, en de leesvolgorde is niet altijd van links naar rechts of van boven naar beneden. Bovendien zitten deze boeken vol met "zeldzame karakters"—oude symbolen die niet in moderne woordenboeken voorkomen.

Wanneer standaard AI-modellen proberen deze pagina's te lezen, krijgen ze drie grote hoofdpijnproblemen:

  1. De Lay-out Rommel: Als de robot naar de hele pagina tegelijk kijkt, wordt de afbeelding wazig en verliest hij de context van nabijgelegen woorden. Als hij naar één regel tegelijk kijkt, verliest hij het grotere plaatje en raakt hij in de war over waar hij als volgende heen moet gaan.
  2. Het Zeldzame Karakter Probleem: Moderne AI is getraind op de taal van vandaag. Wanneer het een oud, zeldzaam karakter ziet, breekt het dit vaak af in kleine, betekenisloze fragmenten (zoals proberen een woord te spellen door individuele letters te raden in plaats van het hele woord te herkennen). Dit maakt het moeilijk om het karakter juist te krijgen.
  3. De "Waarna?" Verwarring: Na het lezen van één regel weet de robot vaak niet of hij naar de regel eronder moet springen, naar de regel rechts, of naar een aantekening in de marge. Zonder een duidelijke kaart slaat hij regels over of leest hij ze in de verkeerde volgorde.

De Oplossing: TongGuOCR's Twee-Stappen Magie

Het team onderzoekers van de South China University of Technology en Huawei stelde TongGuOCR voor, een framework dat specif으로 is ontworpen om deze oude puzzels aan te pakken. Ze gooiden niet alleen meer rekenkracht op het probleem; ze veranderden hoe de robot de tekst ziet en erover denkt.

Stap 1: De Slimme Snijder (Layout-Bewuste Voorverwerking)

Stel je voor dat je een dichte, drukke krant probeert te lezen. Als je de hele pagina probeert te lezen, worden je ogen moe. Als je één woord tegelijk leest, verlies je de betekenis. TongGuOCR gebruikt een "Slimme Snijder" om de pagina in herkenningsblokken te snijden.

In plaats van alleen rechte lijnen te snijden, kijkt het systeem naar de pagina en groepeert opeenvolgende regels tekst in nette, samenhangende brokken. Het is als een chef die een taart voorzichtig snijdt in perfecte, hapklare stukjes die de glazuur en de taart bij elkaar houden, in plaats van gewoon willekeurig te hakken.

  • Hoe het werkt: Het systeem neemt de tekstregels en groepeert ze in blokken die visueel logisch zijn. Vervolgens snijdt het deze blokken bij, waardoor alle afleidende delen van de pagina die niet bij dat specifieke deel horen, worden verwijderd.
  • Het Resultaat: De robot krijgt een schoon, gefocust beeld van een klein deel van de tekst. Dit behoudt de lokale context (zodat hij weet welke woorden bij elkaar staan) zonder de ruis van de rest van de pagina.

Stap 2: De Speciale Vertaler (Token-Verrijkte Herkenning)

Zodra de tekst in perfecte blokken is gesneden, moet de robot deze lezen. Hier gebruikt TongGuOCR een "Speciale Vertaler" die twee nieuwe talen spreekt om de robot te helpen de oude tekst beter te begrijpen.

  • Taal 1: Het Woordenboek van Zeldzame Karakters.
    Moderne AI-tokenizers (tools die tekst in stukjes breken voor de computer om te lezen) hakken zeldzame oude karakters vaak in kleine, verwarrende fragmenten. TongGuOCR lost dit op door elk zeldzaam karakter zijn eigen single-token identiteit te geven.

    • De Analogie: Stel je voor dat je een nieuwe taal leert. In plaats van dat je een moeilijk woord telkens letter voor letter moet spellen, krijg je een speciale sticker met het hele woord erop. Je plakt de sticker er gewoon op, en dat is het. Dit zorgt ervoor dat de robot zeldzame karakters veel sneller en nauwkeuriger herkent.
  • Taal 2: De "Waarna?" Kaart.
    Om de verwarring over de leesvolgorde op te lossen, voegt het systeem speciale transitie-tokens in tussen de regels. Dit zijn als kleine pijlen of wegwijzers die de robot precies vertellen waar hij nu moet kijken.

    • De Analogie: Als je een stripboek leest waarbij de panelen rondspringen, heb je een gids nodig die zegt: "Na dit paneel, spring naar rechtsboven." TongGuOCR voegt deze digitale wegwijzers (zoals <right|down> of <left|up>) toe aan de tekststroom. Dit geleidt het oog van de robot langs het juiste pad, waardoor hij geen regels overslaat of ze achterstevoren leest.

De Resultaten: Een Nieuw Record voor Oude Teksten

Het team testte TongGuOCR op twee belangrijke benchmarks voor Chinese historische documenten: MTHv2 en M5HisDoc. Deze datasets zijn als de "Olympische Spelen" van de oude tekstherkenning, vol moeilijke lay-outs en zeldzame karakters.

De resultaten waren indrukwekkend. TongGuOCR deed het niet alleen goed; het versloeg de beste bestaande methoden, inclusief enorme algemene AI-modellen en andere gespecialiseerde OCR-tools.

  • Op de uitdagende M5HisDoc benchmark behaalde TongGuOCR een Nauwkeurigheidspercentage (AR) van 93,76%.
  • Het verminderde de Genormaliseerde Edit Distance (NED) — een maatstaf voor hoeveel fouten de robot maakte — van 10,43 naar 6,15.
  • Het belangrijkste voor de leesflow: het verlaagde de Reading Order Edit Distance (RO-ED) van 7,53 naar 3,49. Dit betekent dat de robot veel beter in staat was om het juiste pad door de tekst te volgen, waarbij hij zelden een regel oversloeg of de weg kwijtraakte.

In een visuele vergelijking (getoond in Figuur 4 van het paper), terwijl andere modellen regels misten, tekst in de verkeerde volgorde lazen of zeldzame karakters onleesbaar maakten, slaagde TongGuOCR erin elke doelregel te herstellen en de natuurlijke leesvolgorde van de historische pagina te volgen.

Wat Dit Betekent

Het paper suggereert dat om oude teksten effectief te kunnen lezen, we niet alleen kunnen vertrouwen op grotere, krachtigere AI-modellen. We moeten slimmer zijn over hoe we de data aan het model voeren. Door de pagina op te splitsen in logische brokken (Layout-Bewuste Voorverwerking) en het model een beter vocabulaire en een duidelijke kaart voor de leesvolgorde te geven (Token-Verrijkte Herkenning), kunnen we de geheimen van de geschiedenis ontsluiten die voorheen achter onleesbare afbeeldingen verborgen bleven.

De onderzoekers merken op dat hoewel hun systeem een enorme stap voorwaarts is, het nog niet perfect is. Het vertrouwt op de karakters die in de trainingsdata zijn gevonden, dus het kan nog steeds moeite hebben met volledig onbekende of niet ontcijferde symbolen. Echter, voor het overgrote deel van de Chinese historische documenten biedt TongGuOCR een krachtige nieuwe sleutel tot het verleden, die statische afbeeldingen verandert in levende, doorzoekbare tekst die historici en nieuwsgierige geesten kunnen verkennen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →