← Nieuwste papers
💬 NLP

Curation of a Palaeohispanic Dataset for Machine Learning

Dit artikel beschrijft de creatie van een gestructureerd dataset voor machine learning om het onderzoek naar de onvolledig ontcijferde Palaeohispaanse talen te ondersteunen, aangezien de beschikbare bronnen tot nu toe beperkt en niet-computervriendelijk waren.

Oorspronkelijke auteurs: Gonzalo Martínez-Fernández, Jose F Quesada, Agustín Riscos-Núñez, Francisco José Salguero-Lamillar

Gepubliceerd 2026-04-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Gonzalo Martínez-Fernández, Jose F Quesada, Agustín Riscos-Núñez, Francisco José Salguero-Lamillar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, oude schatkist hebt gevonden, vol met raadsels uit het verleden. Deze schatkist bevat inscripties (tekst op stenen, potten en wapens) van oude talen die gesproken werden op het Iberisch Schiereiland (het huidige Spanje en Portugal) voordat de Romeinen arriveerden. Deze talen noemen we Paleo-Hispaanse talen.

Het probleem? De meeste mensen kunnen deze teksten niet lezen. Het zijn als een boek in een taal die niemand meer spreekt, geschreven met een alfabet dat half-alfabetisch en half-syllabisch is (een mix van letters en lettergrepen).

Dit artikel vertelt het verhaal van een groep onderzoekers die een digitale sleutel hebben gemaakt om deze schatkist toegankelijk te maken voor computers. Hier is hoe ze dat deden, vertaald naar alledaags taalgebruik:

1. Het Probleem: Een rommelige bibliotheek

Stel je voor dat je een bibliotheek binnenloopt waar alle boeken in losse bladen liggen, geschreven in verschillende handschriften, met aantekeningen in de marge, en soms zelfs met gaten in de tekst.

  • De bron: De onderzoekers haalden hun informatie uit de "Hesperia-databank", een enorme online verzameling van deze oude teksten.
  • De chaos: De data daar was niet geschikt voor computers. Het waren gewoon tekstregels (strings). Een computer kan niet goed "denken" als het ziet: "Gemaakt op steen, gevonden in Valencia, rond 200 v.Chr." als één lange zin. De computer heeft getallen en duidelijke categorieën nodig om patronen te leren.

2. De Oplossing: De "Digitale Vertaler"

De auteurs hebben een proces bedacht om deze rommelige tekstregels om te toveren in een strakke, computer-vriendelijke tabel (een CSV-bestand). Ze noemen dit curation (verzorging).

Ze hebben dit gedaan in drie creatieve stappen:

Stap A: De Locatie omzetten in coördinaten (De GPS-methode)

In de originele data stond gewoon de naam van een stad, bijvoorbeeld "Sagunto".

  • De analogie: Stel je voor dat je een computer vraagt om de afstand tussen "Sagunto" en "Valencia" te berekenen. De computer snapt dat niet.
  • De oplossing: Ze hebben de namen van de steden en provincies vervangen door GPS-coördinaten (breedte- en lengtegraad). Nu weet de computer precies waar iets ligt en kan hij berekenen hoe ver twee teksten van elkaar verwijderd zijn, alsof ze een digitale kaart hebben.

Stap B: De Tijd omzetten in een tijdlijn (De tijdbalk-methode)

De data bevatte tekstuele datums zoals "Begin van de 3e eeuw v.Chr." of "Rond 200-50 v.Chr.".

  • De analogie: Dit is als zeggen: "Ik was er ongeveer toen de zon opkwam." Een computer wil weten: "Ik was er op minuut 12 van uur 8."
  • De oplossing: Ze hebben een slimme rekenmethode bedacht. Ze vertalen woorden als "begin", "midden" of "eind" van een eeuw naar een specifiek getalbereik.
    • "Begin van de eeuw" wordt een klein getal aan het startpunt van de eeuw.
    • "Rond 200 v.Chr." wordt een bereik van -200 tot -50.
    • Uiteindelijk krijgen ze een middelpunt (het gemiddelde jaar) en een breedte (hoe onzeker we zijn). Zo wordt een vaag verhaal omgezet in een scherp getal.

Stap C: De Tekst "schoonmaken" (De poetsbeurt)

De originele teksten zaten vol met wetenschappelijke notities, zoals: "Misschien een 'a' hier, maar de geleerde X zegt dat het een 'b' is" of [c. 1-2 tekens ontbrekend].

  • De analogie: Stel je voor dat je een brief leest, maar er staan overal kanttekeningen van de vertaler in de tekst zelf. Dat maakt het moeilijk om de eigenlijke boodschap te zien.
  • De oplossing: Ze hebben een "veegmachine" (een script) gemaakt die alle wetenschappelijke ruis verwijdert.
    • Ze halen haakjes en commentaren weg.
    • Ze vervangen onleesbare tekens door een standaard symbool (een plusje +).
    • Ze zorgen dat woorden die over twee regels lopen, weer aan elkaar geplakt worden.
    • Het resultaat is een schone tekst die de computer kan analyseren zonder afgeleid te worden door de notities van de archeologen.

3. Het Resultaat: Een nieuwe start

Het eindresultaat is een dataset met 1751 inscripties en 36 verschillende eigenschappen (zoals materiaal, richting van de tekst, gebruikte alfabet, locatie en datum).

  • Waarom is dit cool? Vroeger moesten taalkundigen dit handmatig doen, wat eeuwen kon duren. Nu hebben ze een dataset die klaar is voor Machine Learning (kunstmatige intelligentie).
  • Wat kunnen we ermee doen?
    • Computers kunnen nu proberen patronen te vinden die mensen missen.
    • Misschien kunnen ze helpen om de grammatica van deze oude talen te ontrafelen.
    • Misschien kunnen ze helpen bepalen welke teksten echt oud zijn en welke nep (forgery).

Conclusie

Kortom: Deze onderzoekers hebben een rommelige, onleesbare stapel oude documenten omgetoverd in een strakke, digitale database. Ze hebben de "taal" van de archeologen vertaald naar de "taal" van de computer.

Het is alsof ze een oude, stoffige sleutelkast hebben schoongemaakt, alle sleutels op een rijtje hebben gezet met nummers, en nu de deur openen voor een nieuwe generatie onderzoekers (en computers) om de geheimen van de Paleo-Hispaanse talen eindelijk te ontcijferen. En het beste deel? Ze hebben de code openbaar gemaakt, zodat iedereen mee kan doen aan dit raadsel.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →