← Nieuwste papers
🤖 machine learning

Digitizing Nepal's Written Heritage: A Comprehensive HTR Pipeline for Old Nepali Manuscripts

Dit artikel introduceert de eerste end-to-end pipeline voor Handgeschreven Tekstherkenning voor oude Nepalese manuscripten, met een foutpercentage van 4,9% op karakterniveau, bereikt door systematische verkenning van encoder-decoder-architecturen en datagerichte technieken, terwijl code en configuraties worden vrijgegeven ter ondersteuning van onderzoek naar historische scripts met beperkte middelen.

Oorspronkelijke auteurs: Anjali Sarawgi, Esteban Garces Arias, Christof Zotter

Gepubliceerd 2026-04-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anjali Sarawgi, Esteban Garces Arias, Christof Zotter

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een bibliotheek voor met oude, fragiele boeken geschreven in een taal die al eeuwenlang niet meer in zijn oorspronkelijke vorm wordt gesproken. De inkt is vervaagd, het papier is gekreukt en het handschrift is zo uniek als een vingerafdruk—geen twee kopiisten schreven op dezelfde manier. Een computer proberen deze boeken te laten lezen, is als het vragen aan een robot om een geheim code te ontcijferen die door duizend verschillende kunstenaars is geschreven, allemaal met een schrift dat lijkt op een verwarde rank van symbolen.

Dit artikel is het verhaal van hoe een team onderzoekers een "superlezer" bouwde om Oud-Nepalese manuscripten te digitaliseren. Hier is hoe ze dat deden, eenvoudig uitgelegd:

De Uitdaging: Een Naald in een Hooiberg

De onderzoekers wilden een computer leren Oud-Nepalees te lezen, een taal geschreven in het Devanagari-schrift (hetzelfde schrift dat wordt gebruikt voor modern Hindi en Nepali, maar dan met wat ouderwetse eigenaardigheden).

  • Het Probleem: Er zijn zeer weinig voorbeelden van deze oude handgeschreven notities beschikbaar om de computer te bestuderen. Het is als proberen iemand te leren een specifiek type vogel te herkennen terwijl je slechts drie wazige foto's ervan hebt.
  • De Rommel: De documenten zijn rommelig. De inkt is gesmeerd, het papier is vervormd en de schrijvers gebruikten geen spaties tussen woorden. Ze gebruikten ook vreemde symbolen die lijken op stippen of lijntjes, waarvan de betekenis verandert afhankelijk van waar ze staan.

De Oplossing: Een Drie-Staps Trainingskamp

Omdat ze niet genoeg "echte" oude boeken hadden om de computer direct te leren, creëerden ze een drie-fasen trainingsproces. Zie dit als een student die van kleuterschool naar middelbare school gaat voordat hij een proefschrift aanpakt.

  1. Fase 1: Het Synthetische Speeltuin (Kleuterschool)
    De computer kon nog niet leren van echte oude boeken omdat er niet genoeg waren. Dus bouwde het team een enorme "nep"-bibliotheek met computergegenereerde tekst. Ze namen moderne Nepalese schoolboeken, drukten ze in 11 verschillende lettertypes en "vernielden" ze vervolgens opzettelijk. Ze voegden digitale ruis toe, vervaagden de lijnen en verdraaiden de pagina's zodat ze leken alsof ze 200 jaar in een stoffen zolder hadden gelegen. Dit gaf de computer 100.000 oefenvoorbeelden om de basisvormen van de letters te leren.

  2. Fase 2: De Gedrukte Brug (Middelbare School)
    Vervolgens stapten ze over op echte, maar gedrukte, Devanagari-tekst. Dit is als overstappen van een videospel naar een echte klaslokaal. De tekst is nog steeds schoon en helder, maar het is echte data uit een universiteitsarchief. Deze stap hielp de computer de kloof te overbruggen tussen de "nep"-rommelige afbeeldingen en de echte wereld.

  3. Fase 3: Het Eindexamen (Universiteit)
    Tenslotte gaven ze de computer de echte schat: 3.100 regels echte, handgeschreven Oud-Nepalees uit 155 oude manuscripten. Omdat de computer al goed getraind was op de eerste twee fasen, kon hij zich nu richten op de specifieke eigenaardigheden van het oude handschrift, de vlekken en de unieke stijl van de kopiisten.

Het Geheime Ingrediënt: Schoonmaken en Rekken

De onderzoekers realiseerden zich dat de kwaliteit van de data belangrijker was dan de complexiteit van het computerbrein.

  • De Labels Schoonmaken: Ze ontdekten dat de digitale notities die beschrijven wat het handschrift zou moeten zeggen, kleine foutjes bevatten (zoals het gebruik van twee verschillende codes voor hetzelfde stip-symbool). Ze "schoonden" deze notities op zodat de computer niet in de war werd gebracht door zijn eigen leraar.
  • Data Augmentatie (De Gym): Om de computer sterker te maken, namen ze de bestaande afbeeldingen en rekten, vervormden en smeerden ze digitaal uit. Het is als een gewichtheffer die extra gewicht aan de stang toevoegt. Door de computer te laten oefenen op duizenden licht verschillende versies van dezelfde pagina, leerde hij de tekst te herkennen, zelfs als deze vervormd was.

De Resultaten: Een Bijna Perfecte Lezer

Het team testte hun systeem tegen andere tools (zoals Google's standaard OCR en een basisversie van hun eigen model).

  • De Score: Hun beste model maakte een fout op slechts 4,9% van de tekens. Dat betekent dat als je hem een pagina met 1.000 letters gaf, hij er ongeveer 951 goed zou krijgen.
  • De Vergelijking: Standaard tools faalden jammerlijk, vaak door de complexe verbonden letters (conjuncten) die in dit schrift gebruikelijk zijn, te missen. Hun aangepaste model was aanzienlijk beter.

Wat de Computer Fout Gaf

Zelfs met een succespercentage van 95% is de computer niet perfect. De onderzoekers analyseerden de fouten en ontdekten dat ze niet willekeurig waren.

  • Visuele Tweeling: De computer verwarde vaak letters die in handschrift erg op elkaar lijken (zoals de letter 'y' en 'p'). Het is als een mens die een handgeschreven 'b' en 'd' verwart.
  • Lange Strijd: De computer deed het goed op korte en middelgrote zinnen, maar begon te struikelen op zeer lange regels (meer dan 120 tekens). Het lijkt erop dat de computer "moe" wordt of zijn plaats verliest wanneer de tekst te lang wordt, waarschijnlijk omdat hij tijdens de training niet genoeg lange voorbeelden zag.

De Conclusie

De onderzoekers bouwden een web-app waar je een foto van een oud manuscript kunt uploaden, en deze zal automatisch de tekstregels vinden en voor je uitschrijven.

De Grote Les: In de wereld van het lezen van oude, rommelige handschriften is data de koning. Je hebt niet per se een groter, complexer computerbrein nodig; je hebt betere trainingsdata, schonere labels en veel oefening met "rommelige" voorbeelden nodig. Door hun trainingsproces zorgvuldig te cureren, maakten ze een taal met weinig middelen en moeilijkheden omzetbaar naar iets dat een computer met hoge nauwkeurigheid kan lezen, waardoor de geschreven geschiedenis van Nepal voor de toekomst wordt bewaard.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →