← Nieuwste papers
💻 computer science

Optical Character Recognition of Historical Moroccan Arabic Calligraphy Using Transformer-Based TrOCR

Dit artikel stelt een op Transformer gebaseerd TrOCR-framework voor dat moeilijke karaktersegmentatie omzeilt door vooraf bewerkte tekstregels uit historische Marokkaans-Arabische manuscripten direct te herkennen, waardoor een effectieve transcriptie van complexe, gedegradeerde kalligrafie wordt bereikt voor digitale erfgoedbehoud.

Oorspronkelijke auteurs: Adnane Mehdaoui, Khadija El Maaroufi

Gepubliceerd 2026-09-15
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Adnane Mehdaoui, Khadija El Maaroufi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Eeuwenlang was het geschreven woord de primaire drager van het menselijk geheugen, die de wetten, verhalen en wetenschappelijke ontdekkingen van beschavingen door de tijd heen droeg. Toch worden deze documenten naarmate papier veroudert en inkt vervaagt, vaak onleesbaar voor het moderne oog, gevangen achter lagen van fysiek verval en onbekende handschriften. In de wereld van de informatica heeft een veld genaamd optische tekenherkenning (optical character recognition) lang machines geleerd om gedrukte tekst met bijna perfecte nauwkeurigheid te lezen. Echter, wanneer die machines de rommelige, vloeiende en vaak beschadigde pagina's van historische manuscripten tegenkomen, struikelen ze vaak. De uitdaging is bijzonder groot bij de Arabische kalligrafie, waarbij letters binnen een enkel woord vaak verbonden zijn in complexe, cursieve ketens die sterk variëren van de ene schrijver naar de andere. Voor de specifieke en cultureel rijke traditie van Marokkaanse Arabische manuscripten, geschreven in een kenmerkende stijl bekend als het Maghribi-schrift, is de taak extra moeilijk omdat de letters elkaar raken, overlappen en verschuiven op manieren die standaard leessoftware in verwarring brengen.

Twee onafhankelijke onderzoekers, Adnane Mehdaoui en Khadija El Maaroufi, hebben dit probleem aangepakt door een nieuwe benadering te ontwikkelen die de traditionele noodzaak om individuele letters te scheiden omzeilt. In plaats van te proberen een woord op te delen in de afzonderlijke onderdelen — een taak die vaak faalt wanneer de inkt uitloopt of de letters samensmelten — hebben zij een modern kunstmatig intelligentiesysteem getraind om naar een hele regel tekst te kijken als één enkel, verbonden verhaal. Door gebruik te maken van een type geavanceerd computermodel genaamd een Transformer, dat ontworpen is om de context van een hele zin tegelijkertijd te begrijpen, creëerden zij een systeem dat in staat is om deze moeilijke historische pagina's te ontcijferen. Hun werk toont aan dat door zorgvuldige beeldreiniging te combineren met een model dat leert van de stroom van het schrift in plaats van geïsoleerde vormen, het mogelijk is om de geheimen van het Marokkaanse erfgoed te ontsluiten die voorheen voor het blote oog verborgen bleven.

De onderzoekers begonnen met een collectie van tweehonderd pagina's uit open-source archieven, die het unieke Maghribi-schrift vertegenwoordigen dat in Marokko wordt gevonden. Deze pagina's waren verre van onberispelijk; ze leden aan de typische kwalen van oude documenten, zoals ongelijkmatige belichting, vervaagde inkt en papier dat door de tijd heen kromgetrokken was. Om deze afbeeldingen leesbaar te maken voor een computer, bouwde het team eerst een gespecialiseerde pijplijn om de gegevens te reinigen en te organiseren. Ze pasten het contrast aan om de donkere inkt te laten opvallen tegen het verouderde papier en gebruikten vervolgens een slim detectiesysteem om te vinden waar elke regel tekst begon en eindigde. Deze stap was cruciaal omdat historisch handschrift vaak schuin staat of verschuift, wat het moeilijk maakt voor standaardtools om te bepalen waar de ene zin stopt en de volgende begint. Het systeem analyseerde automatisch de tussenruimte en de dichtheid van de inkt om de pagina's in individuele regels te snijden, waardoor een schone set afbeeldingen klaar was voor de volgende fase van het leren.

Zodra de regels waren geïsoleerd, richtten de onderzoekers zich op een krachtig hulpmiddel bekend als TrOCR, wat staat voor Transformer-gebaseerde Optical Character Recognition. In tegenstelling tot oudere systemen die probeerden één letter tegelijk te identificeren, werkt dit model door naar de gehele regel tekst te kijken tegelijkertijd. Het gebruikt een mechanisme genaamd zelf-aandacht (self-attention), waardoor de computer het belang van verschillende delen van de afbeelding kan wegen terwijl hij leest. Als een letter bijvoorbeeld licht vervormd is of een stip mist, kan het model naar de omliggende letters en de algehele vorm van het woord kijken om te raden wat het ontbrekende deel waarschijnlijk is. Dit vermogen om context te begrijpen is essentieel voor het Arabisch, waarbij de vorm van een letter verandert afhankelijk van of deze aan het begin, in het midden of aan het einde van een woord staat, en waar kleine puntjes boven of onder een letter de betekenis volledig kunnen veranderen.

Om dit model te leren het Marokkaans Arabisch te lezen, zijn de onderzoekers niet vanaf nul begonnen. Ze gebruikten een techniek genaamd transfer learning, waarbij ze een model dat al getraind was op duizenden Engelse handgeschreven documenten namen en dit aanpasten aan het Arabische schrift. Dit is vergelijkbaar met hoe iemand die al piano speelt, een nieuw instrument sneller kan oppakken dan een absolute beginner, omdat diegene de fundamenten van ritme en melodie al begrijpt. Het model werd vervolgens verfijnd (fine-tuned) op de Marokkaanse dataset, waarbij het leerde de specifieke curven, verbindingen en stijlen van het Maghribi-schrift te herkennen. Het team trainde het systeem op ongeveer acht duizend paren afbeeldingen en hun correcte teksttranscripties, terwijl ze nog eens tweeduizend paren achterhielden om te testen hoe goed het model presteerde op materiaal dat het nog nooit eerder had gezien.

De resultaten van deze training werden gemeten met een standaardmetriek genaamd de Character Error Rate, die telt hoeveel letters de computer foutief heeft weergegeven in vergelijking met de correcte tekst. Op de testset bereikte het model een foutpercentage van net boven de vijf procent. Dit betekent dat voor elke honderd tekens in een regel tekst, het systeem meer dan vijfennegentig tekens correct heeft geïdentificeerd. De onderzoekers merkten op dat de prestaties consistent bleven over de trainings-, validatie- en testfasen, wat suggereert dat het model daadwerkelijk de patronen van het schrift heeft geleerd in plaats van simpelweg de specifieke pagina's te hebben die het te zien kreeg te memoriseren. Dit niveau van nauwkeurigheid is aanzienlijk voor historische documenten, waar de variabiliteit in handschrift en de aanwezigheid van schade een extreem hoge lat leggen voor perfecte herkenning.

Ondanks deze successen zijn de auteurs voorzichtig om aan te geven dat het werk geen volledige oplossing is voor alle problemen bij het lezen van oude manuscripten. Het systeem heeft nog steeds moeite met diakritische tekens, de kleine puntjes en streepjes die boven of onder letters staan om uitspraak of betekenis aan te geven, die vaak vaag zijn of ontbreken in oude documenten. Als deze tekens verkeerd worden gelezen, kan de betekenis van een woord volledig veranderen. Bovendien werd het model getraind op regels tekst die zorgvuldig waren geëxtraheerd; het kan nog geen volledige pagina's aan met complexe lay-outs, zoals aantekeningen in de marges of tekst die in meerdere kolommen loopt. De onderzoekers benadrukten ook dat de schaarste aan geannoteerde data een grote hindernis blijft, aangezien het creëren van de trainingssets vereist dat experts de tekst handmatig transcriberen, een traag en moeilijk proces.

De studie concludeert dat hoewel deep learning grote stappen heeft gezet, het nog steeds niet de menselijke expertise kan vervangen of elke fysieke beperking van verouderend papier kan overwinnen. Echter, de benadering die Mehdaoui en El Maaroufi hebben gekozen, biedt een robuust pad vooruit. Door intelligente beeldvoorverwerking te combineren met een model dat de context van de hele regel begrijpt, hebben zij een hulpmiddel gecreëerd dat de digitalisering van het Marokkaanse historische erfgoed aanzienlijk kan versnellen. Dit werk produceert niet alleen een lijst met cijfers; het biedt een praktisch kader waarmee onderzoekers toegang krijgen tot en eeuwen aan linguïstische en culturele kennis kunnen bewaren die voorheen te moeilijk te lezen was. Naarmate het veld vordert, zou de integratie van taalmodellen om fouten te corrigeren en de ontwikkeling van betere technieken voor data-augmentatie deze systemen verder kunnen verfijnen, waardoor de geschreven geschiedenis van de Maghreb dichter bij de moderne wereld wordt gebracht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →