Automated sign detection across the Electronic Babylonian Library: A large-scale dataset and end-to-end cuneiform OCR pipeline
Dit artikel presenteert een schaalbare, end-to-end cuneiform OCR-pipeline gebaseerd op een Deformable Detection Transformer (DETR) die gebruikmaakt van de grootste tot nu toe geannoteerde tekenset, waarbij significante verbeteringen in metrieken worden bereikt en bijna 2,9 miljoen tekens over 87.668 fragmenten van de Electronic Babylonian Library succesvol worden gedetecteerd om grootschalige geautomatiseerde analyse van oude tabletten mogelijk te maken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een enorme bibliotheek voor waar de boeken niet van papier zijn gemaakt, maar van natte klei die 3.000 jaar geleden hard is gebakken. Dit zijn spijkerschrifttabletten, het oudst bekende schrift ter wereld. Ze bevatten de geschiedenis, wetten en verhalen van het oude Mesopotamië.
Het probleem? Er zijn ongeveer half miljoen van deze tabletten, maar de meeste zijn gebroken, gebarsten of bedekt met vuil. Slechts een klein handjevol deskundige geleerden (Assyriologen) kan ze lezen, en zij hebben simpelweg niet genoeg tijd om ze allemaal te lezen. Het is alsof je probeert een miljoen pagina's van een beschadigde encyclopedie te lezen met een vergrootglas, letter voor letter.
Dit artikel gaat over het bouwen van een robotische assistent om deze geleerden te helpen de tabletten sneller te lezen. Hier is hoe ze het deden, eenvoudig uitgelegd:
1. De "Leraar" en de "Student"
Om een computer te leren deze oude symbolen te lezen, heb je een enorme tekstboek vol voorbeelden nodig.
- De Dataset: De onderzoekers verzamelden de grootste collectie "gelabelde" spijkerschriftafbeeldingen ooit gemaakt. Stel je voor dat je 1.931 foto's van kleitabletten neemt en handmatig een kader rond elk symbool tekent, waarbij je de computer vertelt: "Dit kader bevat het symbool voor 'Koning', en dit een voor 'Gerst'". Ze breidden deze dataset uit van ongeveer 52.000 tekens naar 124.500 tekens.
- Het Model (De Student): Ze gebruikten een slimme AI genaamd DETR (Deformable Detection Transformer). Denk aan dit als een zeer scherpziende student die naar een foto kijkt en probeert elk symbool te vinden en te benoemen. Ze trainden deze student op twee verschillende "vocabulaire's": één met 173 soorten tekens (zeer gedetailleerd) en één met 106 soorten (vereenvoudigd).
2. Het Drie-Stappen Schoonmaakproces
Voordat de robot kan lezen, moeten de foto's worden opgeruimd, want oude tabletten zijn rommelig. De onderzoekers bouwden een driestaps pijplijn:
- Stap 1: De "Tablet Snijder" (Zij-extractie):
Soms laat een enkele foto een hele tray met vijf verschillende gebroken tabletstukken zien. De AI moet weten waar het ene tablet eindigt en het andere begint. De onderzoekers bouwden een tool die de foto automatisch snijdt, waarbij slechts één tabletoppervlak per keer wordt uitgeknipt, zoals een chef die een pizza in individuele stukken snijdt zodat de robot zich op één stuk tegelijk kan concentreren. - Stap 2: De "Lijn Organisator" (Lijn Groepering):
Zodra de robot de symbolen ziet, zijn het slechts een verspreide wolk van stippen. De robot moet weten welke stippen bij dezelfde regel tekst horen. De onderzoekers gebruikten een clusteringmethode (DBSCAN) die werkt als een magneet. Het trekt symbolen die verticaal dicht bij elkaar staan samen in een lijn, waarbij de rommelige gaten tussen de regels worden genegeerd. Dit verandert een chaotische wolk van symbolen in nette regels tekst. - Stap 3: De "Spellingcontrole" (N-gram Matching):
Hoe weten we of de robot gelijk heeft? Ze vergeleken de output van de robot met de bekende tekst (transliteraties) in de database. Ze controleerden niet alleen of de robot het hele woord goed had, maar controleerden of de robot de volgorde van de symbolen goed had (zoals controleren of "De kat zit" overeenkomt met "De kat zit" in plaats van "De hond zit").
3. De Resultaten: Een Enorme Sprong Voorwaarts
De robot werkte verrassend goed.
- Nauwkeurigheid: Vergeleken met de vorige beste methode verbeterde dit nieuwe systeem de nauwkeurigheid met 28% tot 37%. Het is een enorme sprong, zoals het gaan van een student die 60% scoort op een toets naar een student die 90% scoort.
- Schaal: Ze draalden dit systeem op 87.668 tabletfragmenten uit de Electronic Babylonian Library.
- Output: De robot vond en labelde succesvol bijna 2,9 miljoen individuele tekens.
4. De Beperkingen (Waar de Robot Nog Steeds Moeite Mee Heeft)
Het artikel is eerlijk over waar de robot nog niet perfect is:
- Gebroken Tabletten: Als een tablet verbrijzeld is of de klei is geërodeerd, zien de symbolen er vreemd uit. De robot raadt soms met veel zelfvertrouwen, maar zit er naast, of raakt in de war door de schade.
- Geen "Brein" voor Betekenis: De robot is een visuele detective, geen taalkundige. Hij ziet de vormen en groepeert ze in regels, maar hij begrijpt de grammatica of het verhaal niet. Hij weet niet dat "Koning" meestal vóór "van Babylon" komt. Hij ziet alleen de vormen.
- Drukke Tekst: Op zeer grote tabletten met duizenden kleine, dicht op elkaar staande symbolen, mist de robot soms tekens of raakt hij de regels kwijt.
De Kernboodschap
Dit artikel bouwde niet alleen een betere camera; het bouwde een schaalbare fabriek voor het lezen van de oude geschiedenis. Door een enorme nieuwe dataset te combineren met een slim "snijd-en-sorteer" proces, creëerden ze een tool die duizenden tabletten kan verwerken in de tijd die een mens nodig heeft om er één te lezen. Hoewel het nog steeds menselijke experts nodig heeft om de lastige delen te controleren, heeft het de fundering gelegd voor het eindelijk lezen van de "half miljoen" ongelezen tabletten die al eeuwenlang in musea liggen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.