FP-THD: Full page transcription of historical documents
Dit artikel presenteert FP-THD, een pipeline die lay-outanalyse combineert met een uitgebreid tekstregelherkenningsmodel om 15e- en 16e-eeuwse Latijnse historische documenten efficiënt te transcriberen, waarbij de oorspronkelijke karakters, symbolen en lay-out behouden blijven over handgeschreven, gedrukte en meertalige formaten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een tijdmachine hebt waarmee je kunt inzoomen op een stoffig, 500 jaar oud boek geschreven in middeleeuws Latijn. De pagina's zijn gekruld, de inkt is vervaagd en het handschrift is een wilde mix van lussen, krabbels en vreemde symbolen die totaal niet lijken op de letters die wij vandaag de dag gebruiken. Als je probeert dit met een moderne computer te lezen, is het alsof je een robot vraagt om een geheime code te begrijpen die hij nooit heeft geleerd. Het zou een lange "s" (die op een "f" lijkt) in een "f" kunnen veranderen, of twee letters samenvoegen tot een moderne "ae", wat de historische sfeer volledig zou verpesten.
Maak kennis met FP-THD, een nieuwe digitale pijplijn ontworpen door een team van onderzoekers om de ultieme "tijdreizende bibliothecaris" te zijn. Hun doel was niet alleen om de woorden te lezen, maar om de exacte look en feel van de originele pagina te bewaren, inclusief die lastige afkortingen en speciale symbolen waar historici op vertrouwen.
De Tweestapsdans: De Lijnen Vinden, En Dan Lezen
De auteurs realiseerden zich dat proberen een hele rommelige pagina in één keer te lezen, net zoiú de hele pizza in één hap proberen te eten. In plaats daarvan bouwden ze een pijplijn die in twee duidelijke stappen werkt, als een team van specialisten.
Stap 1: De Layout Detective (ParseNet)
Eerst gebruikt het systeem een hulpmiddel genaamd ParseNet om als een layout detective te fungeren. Het scant de volledige pagina-afbeelding en tekent onzichtbare boxen rond elke regel tekst, waarbij het bepaalt waar de paragrafen beginnen en eindigen, zelfs als de regels gebogen of gekanteld zijn. Het is als een robot-bibliothecaris die zorgvuldig de contouren van elke zin op een chaotische pagina traceert en ze uitknipt in nette, rechte stroken. Deze stap produceert een kaart (in een formaat genaamd PAGE XML) die de computer precies vertelt waar hij moet kijken.
Stap 2: De Super-Lezer (Masked Autoencoder)
Zodra de regels zijn uitgeknipt en rechtgetrokken, worden ze overhandigd aan de tweede specialist: een Masked Autoencoder aangedreven door een Vision Transformer. Denk aan dit model als een superintelligente student die heeft leren lezen door een spelletje "invulteksten" te spelen.
Hier werkt het spel: de computer neemt een regel tekst, dekt willekeurige stukken ervan af (zoals een plakbriefje over een paar woorden leggen) en probeert vervolgens te raden wat eronder zit op basis van de omliggende aanwijzingen. Door dit spel miljoenen keren te oefenen op verschillende soorten handschriften, leert het model niet alleen moderne letters te herkennen, maar ook die vreemde middeleeuwse symbolen, ligaturen (zoals "æ") en tildes (~) die een ontbrekende letter aangeven.
De Grote Test: Handgeschreven versus Gedrukt
Het team heeft dit niet alleen gebouwd; ze hebben het door drie verschillende "trainingskampen" (datasets) gehaald:
- Rodrigo (Handgeschreven): Een collectie van 853 pagina's oud Spaans handschrift uit 1545.
- Bentham (Handgeschreven): Beroemde brieven van de filosoof Jeremy Bentham, bekend om al zijn verschillende rommelige handschrifstijlen.
- Molino (Gedrukt): Een gloednieuwe dataset die het team zelf heeft gemaakt, bestaande uit 143 pagina's gedrukte juridische teksten uit de 1500 en 1600, vol met Latijnse afkortingen.
De Resultaten: Hoe Goed Ging Het?
Het artikel laat zien dat deze aanpak verrassend effectief is, vooral wanneer het wordt vergeleken met andere tools.
- Voor het handgeschreven Rodrigo: Het model behaalde een Character Error Rate (CER) van 1,30% en een Word Error Rate (WER) van 6,97% bij het testen met een batchgrootte van 128. Dat betekent dat het bijna elke letter goed had! Dit is beter dan sommige andere hoogtechnologische modellen die extra, ingewikkelde stappen gebruiken om fouten te herstellen.
- Voor het handgeschreven Bentham: Het behaalde een CER van 4,46% en een WER van 7,68%. Hoewel dit een iets hogere score is dan de resultaten van Rodrigo, merken de auteurs op dat dit werd gedaan zonder gebruik te maken van fancy post-processing trucjes of externe taalgidsen, wat een grote prestatie is qua efficiëntie.
- Voor de gedrukte tekst van Molino: Dit was de echte showstopper. Het team testte hun systeem op 10 pagina's van de Molino-dataset en vergeleek het met twee andere methoden: een populaire open-source tool genaamd Pero-OCR en een transcriptie van de Biblioteca Virtual del Patrimonio Bibliográfico (BVPB) (die commerciële software gebruikte).
- De BVPB-transcriptie had een CER van 0,3379 en een WER van 0,6835.
- Pero-OCR had een CER van 0,0242 en een WER van 0,2106.
- FP-THD kwam aan met de laagste fouten: een CER van 0,0178 en een WER van 0,0450.
In gewone mensentaal: het nieuwe systeem maakte minder fouten dan de commerciële software en de andere open-source tool, waardoor de fouten op woordniveau met bijna 80% werden verminderd ten opzichte van Pero-OCR en met meer dan 90% ten opzichte van de BVPB-transcriptie. Het deed ook een betere job met het intact houden van die cruciale middeleeuwse tildes en afkortingen.
Wat Het (Nog) Niet Kan
De auteurs zijn eerlijk over de beperkingen van hun magie. Het systeem is geweldig in het lezen van de hoofdtekst in het midden van de pagina, maar heeft soms moeite met:
- Marginale aantekeningen: Die kleine krabbels in de marges van de pagina kunnen over het hoofd worden gezien of onjuist worden getranscribeerd.
- Enkele woorden: Als een regel tekst slechts één woord bevat, raakt het model soms in de war omdat het voornamelijk getraind is op lange regels tekst.
De Kernboodschap
Dit artikel beweert niet dat het het probleem van het lezen van de geschiedenis voor altijd heeft opgelost. In plaats daarvan suggereert het dat door een layout detective te combineren met een "invul-tekst" lezer, we een tool kunnen creëren die zeer nauwkeurig, gratis te gebruiken en respectvol is naar de originele stijl. Het bewijst dat je het oude Latijn niet in modern Nederlands hoeft te veranderen om het te begrijpen; je kunt de oude stijl behouden, en de computer kan het nog steeds lezen.
Het team is van plan dit te blijven verbeteren door meer geïsoleerde woorden aan hun trainingsdata toe te voegen en uiteindelijk dit systeem te gebruiken om afkortingen automatisch uit te breiden en Latijn naar het Spaans te vertalen. Maar voor nu hebben ze laten zien dat met de juiste pijplijn, zelfs de meest rommelige middeleeuwse pagina's kunnen worden omgezet in heldere, digitale tekst zonder hun ziel te verliezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.