← Nieuwste papers
💻 computer science

ViHistScriptBench: Benchmarking Vietnamese Historical Script and Document–Type Classification in Low–Resource Settings

Dit artikel introduceert ViHistScriptBench, een lichtgewicht benchmark en evaluatiepijplijn die is ontworpen om de classificatie van Vietnamese historische schriften en documenttypen te bevorderen door een gecureerde corpus, gedefinieerde taken en basismodellen te bieden om de uitdagingen die worden veroorzaakt door beperkte data en complexe kalligrafie aan te pakken.

Oorspronkelijke auteurs: Nguyễn Tuệ An

Gepubliceerd 2026-07-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nguyễn Tuệ An

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een gigantische, stoffige bibliotheek voor vol oude Vietnamese boeken. Sommige zijn geschreven in oude Chinese karakters, sommige in een uniek Vietnamees schrift dat op Chinees lijkt maar Vietnamees klinkt, en sommige zijn vroege pogingen om het Vietnamees te schrijven met het Latijnse alfabet dat we vandaag de dag gebruiken.

Het probleem is dat deze boeken moeilijk te lezen zijn. De inkt is vervaagd, het papier is gescheurd en de schrijfstijlen verschillen enorm. Als je deze boeken wilt doorzoeken of omzetten in digitale tekst, heb je een computerprogramma nodig (OCR) om ze te lezen. Maar de meeste computerprogramma's van nu zijn als studenten die alleen modern Engels hebben gestudeerd; ze raken volledig in de war wanneer ze deze oude, rommelige schriften zien.

Dit artikel introduceert een nieuwe tool genaamd ViHistScriptBench. Zie dit als een oefenexamen dat specifiek is ontworpen om computers te trainen het lezen van deze oude Vietnamese boeken.

Hieronder legt het artikel dit uit, gebruikmakend van eenvoudige analogieën:

1. De "Sportschool" voor Computers (De Dataset)

Om een computer te trainen het te herkennen van deze schriften, heb je veel voorbeelden nodig. De auteurs hebben 500 pagina's verzameld uit openbare digitale archieven (zoals de Nationale Bibliotheek van Vietnam).

  • De Collectie: Ze kozen pagina's die verschillende "smaken" van het schrift laten zien: puur Chinese karakters (Hán), puur Vietnamees logogrammen (Nôm), een mix van beide, en vroeg Latijn-gebaseerd Vietnamees (Quốc Ngữ).
  • De Labels: Ze hebben de afbeeldingen niet zomaar op een hoop gegooid. Ze hebben experts ingehuurd om elke pagina te labelen, waarbij ze de computer vertellen: "Dit is een handgeschreven manuscript," "Dit is een houtblokdruk," of "Deze pagina mengt twee schriften." Het is alsof een leraar een stapel papieren nakijkt en aantekeningen op de achterkant schrijft.

2. De Drie Uitdagingen (De Taken)

Het artikel stelt drie specifieke spelletjes op voor de computer om te spelen:

  • Spel 1: Script Detective. De computer kijkt naar een hele pagina en moet raden: "Is dit Chinees, Vietnamees, een mix, of vroeg Latijn?" Het is alsof je naar een menu kijkt en raadt of het in het Frans, Italiaans of een mix van beide is.
  • Spel 2: Materiaal Inspecteur. De computer moet raden hoe de pagina is gemaakt. Is het met een penseel geschreven? Is het in hout gekerfd en afgestempeld? Of is het een modern gedrukt boek? Dit helpt de computer om te weten hoe hij met de "textuur" van de pagina moet omgaan.
  • Spel 3: De Mix-Up Spotter. Sommige pagina's hebben een hoofdverhaal in één schrift en kleine aantekeningen in de marge in een ander schrift. De computer moet ontdekken of een pagina "gemengd" of "puur" is.

3. De Deelnemers (De Modellen)

De auteurs hebben verschillende soorten "studenten" (AI-modellen) getest om te zien wie het beste leert:

  • De Klassiekers (CNN's): Dit zijn traditionele studenten die goed zijn in het herkennen van kleine details (zoals de vorm van een enkele letter), maar soms het grote plaatje missen.
  • De Moderne (Vision Transformers): Dit zijn studenten die de hele pagina in één keer bekijken en begrijpen hoe de kolommen tekst met elkaar samenhangen.
  • De "Zero-Shot" Leerders (CLIP): Dit zijn studenten die dit specifieke onderwerp niet hebben bestudeerd, maar erg goed zijn in het raden op basis van algemene kennis. Ze proberen het schrift te raden door simpelweg een beschrijving te lezen zoals "een pagina met Chinese karakters."

4. De Resultaten en de Strijdpunten

Het artikel meldt dat de moderne modellen (Vision Transformers) het beste presteerden, met een nauwkeurigheid van ongeveer 90%. Dat is een voldoende, maar niet perfect.

Waar liepen ze vast?
Het artikel belicht specifieke "vallen" die de computers in de war brachten:

  • De Tweelingval: Hán en Nôm lijken erg op elkaar. Het is als het proberen te onderscheiden van een tweelingbroer en -zus vanuit een wazige foto. De computers haalden ze vaak door elkaar.
  • De Ruisval: Oude boeken hebben vlekken, wormengaten en vervaagde inkt. De computers zagen soms een koffievlek aan voor een deel van een letter.
  • De Richtingval: Deze oude boeken worden verticaal geschreven (van boven naar beneden). Computers die gewend zijn aan horizontale Engelse tekst, raakten soms in de war door de lay-out.
  • De Accentval: Vietnamees gebruikt veel kleine tekentjes (diakritische tekens) om de klank van een letter te veranderen. Als de inkt vlekkerig was, kon de computer niet zien of een teken een toonaccent was of gewoon een vlekje vuil.

5. Waarom dit Belangrijk is

De auteurs beloven niet dat we vandaag de dag direct de hele geschiedenis van Vietnam kunnen vertalen. In plaats daarvan zeggen ze: "Hier is een eerlijke test en een startpunt."

Vóór dit moment probeerden onderzoekers races te rennen zonder baan of stopwatch. Nu, met ViHistScriptBench, hebben iedereen dezelfde 500 pagina's en dezelfde regels. Dit stelt wetenschappers in staat om hun tools eerlijk te vergelijken, precies te zien waar ze falen en betere "studenten" te bouwen om de geschreven geschiedenis van Vietnam te helpen bewaren en te ontsluiten.

Kortom: Ze hebben een oefentoets gebouwd om computers te helpen leren hoe ze rommelige, oude Vietnamese boeken kunnen lezen, waarbij ze ons precies laten zien waar de computers nog steeds in de war raken, zodat we ze beter kunnen onderwijzen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →