← Nieuwste papers
📄 social_science

PREMOVE: A multilayer manually annotated dataset of PREverbed MOtion VErbs in Ancient Greek and Latin

Dit artikel introduceert PREMOVE, een publiek beschikbare, meerlagig handmatig geannoteerde dataset van gepreverbale bewegingswerkwoorden in het Oudgrieks en Latijn, ontworpen om cross-linguïstisch, diachroon en computationeel onderzoek te ondersteunen door middel van de uitgebreide morfosyntactische en semantische annotaties van 2.835 verbale voorkomens in 35 teksten.

Oorspronkelijke auteurs: Andrea Farina

Gepubliceerd 2026-06-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Andrea Farina

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen over hoe mensen in de oudheid over beweging praatten: je wilt begrijpen hoe zij "voorvoegsels" (kleine woorddelen die voor een werkwoord worden toegevoegd, zoals onder- in ondergaan of re- in retour) gebruikten om de betekenis van woorden als "gaan", "rennen" of "varen" te veranderen.

Hier is een uitsplitsing van wat het artikel beweert, met behulp van eenvoudige analogieën:

1. Het Probleem: Een Verspreide Bibliotheek

Vóór dit project hadden onderzoekers veel boeken (corpora) van oude Griekse en Latijnse teksten. Deze boeken waren echter als bibliotheken waar de boeken waren gesorteerd op auteur of datum, maar niet op de specifieke "actie" van de woorden erin. Als je elke instantie van "weggaan" of "rondvaren" door duizenden jaren geschiedenis wilde vinden, zou je elke pagina handmatig moeten lezen. Er was geen enkele kaart beschikbaar om aan te tonen hoe deze "voorvoegsels" de betekenis van bewegingswerkwoorden door verschillende tijden en genres heen veranderden.

2. De Oplossing: De PREMOVE Archiefkast

De auteur, Andrea Farina, heeft PREMOVE gebouwd. Zie dit als een gigantische spreadsheet met 42 lagen die 2.835 specifieke voorbeelden van bewegingswerkwoorden bevat die zijn voorzien van een voorvoegsel.

  • De Ingrediënten: De data komt uit een zorgvuldig geselecteerde "Base Corpus" van 35 teksten (zoals de Iliade, Caesar's oorlogsdagboeken of de toespraken van Cicero). De auteur heeft deze teksten in evenwicht gebracht om ervoor te zorgen dat ze verschillende tijdperken (van de 8e eeuw v.Chr. tot de 2e eeuw n.Chr.) en verschillende stijlen (poëzie, geschiedschrijving, drama, filosofie) vertegenwoordigen.
  • De Ingrediëntenlijst: Ze kozen 8 veelvoorkomende bewegingswerkwoorden per taal (zoals "gaan", "vluchten", "rennen", "varen") en 16 veelvoorkomende voorvoegsels (zoals "uit", "in", "rond", "onder").
  • De Lagen: Elk voorbeeld in de spreadsheet is geannoteerd met 42 verschillende stukjes informatie. Stel je een foto van een auto-ongeluk voor. Een basisfoto laat de auto zien. PREMOVE is als een foto waarbij elk onderdeel is gelabeld: de snelheid, het weer, het type weg, de stemming van de bestuurder en de exacte locatie op een kaart.
    • Morfologie: In welke vorm staat het woord?
    • Semantiek: Betekent het "omhoog gaan" of "omlaag gaan"? Is het letterlijk of metaforisch?
    • Ruimtelijke Rollen: Beschrijft het woord een startpunt (Source), een bestemming (Goal) of een pad (Path)?
    • Context: Wie schreef het? Wanneer? Welk genre?

3. De Kwaliteitscontrole: De "Drie Rechters"-test

Omdat mensen deze data annoteren, is er altijd een risico op onenigheid. Om te bewijzen dat de data betrouwbaar is, heeft de auteur dit getest.

  • De Test: Drie verschillende experts (een computationeel taalkundige, een traditioneel historicus en de auteur) bekeken een kleine steekproef van zinnen en probeerden deze onafhankelijk van elkaar te labelen.
  • Het Resultaat: Voor de belangrijkste onderdelen — het identificeren van het voorvoegsel en de basisbetekenis — stemden zij bijna perfect overeen (alsof drie rechters allemaal een 10/10 geven aan een deelnemer). Voor complexere, subjectieve betekenissen (zoals de exacte emotionele nuance van een werkwoord) lag de overeenstemming lager, wat normaal is bij menselijke interpretatie. Dit bewijst dat het systeem goed werkt voor de kern van het doel.

4. De Tools: Een Kaart en een Telescoop

Het artikel beschrijft twee belangrijke manieren om deze data te gebruiken:

  • De Dataset (CSV): Dit is de ruwe data, beschikbaar voor download. Het is alsof je een onderzoeker een doos met rauwe ingrediënten geeft zodat hij zelf kan koken wat hij wil.
  • PrevNet (De Interface): Dit is een gebruiksvriendelijke website die bovenop de data is gebouwd. Het is als een "Google Maps" voor oude talen. Je kunt op een voorvoegsel klikken (zoals "rond") en direct een cirkeldiagram zien dat laat zien hoe vaak het werd gebruikt, welke auteurs het gebruikten en hoe de betekenis ervan door de eeuwen heen verschoof. Je kunt op een deel van de cirkel klikken en de eigenlijke oude zinnen zien.
  • De Verbinding (LiLa): De data is ook gekoppeld aan een enorm mondiaal netwerk van taaldata (LiLa), waardoor het "FAIR" is (Findable, Accessible, Interoperable, Reusable). Dit is als het geven van een universele streepjescode aan de data, zodat elk computersysteem het kan lezen.

5. Waar het voor wordt gebruikt (Volgens het artikel)

Het artikel stelt expliciet dat deze dataset een instrument is voor:

  • Talen Vergelijken: Zien hoe Grieks en Latijn de omgang met beweging verschillend aanpakten.
  • AI Trainen: Het gebruik van de data om Large Language Models (LLM's) te leren hoe ze oude talen beter kunnen begrijpen.
  • Historische Taalkunde: Het volgen van hoe de betekenis van woorden veranderde over 1.000 jaar (bijvoorbeeld hoe een woord voor "eruit gaan" uiteindelijk "gebeuren" kon betekenen).
  • Digital Humanities: Het helpen van studenten en wetenschappers om teksten te verkennen zonder dat zij expert in coderen hoeven te zijn.

Wat het NIET is (Op basis van het artikel)

  • Het is geen medisch of klinisch hulpmiddel.
  • Het claimt niet direct moderne taalverwervingsproblemen op te lossen (hoewel het helpt bij het trainen van de AI die dat wel kan).
  • Het is geen volledig woordenboek van elk Grieks of Latijns woord; het is een gerichte studie op bewegingswerkwoorden met voorvoegsels.

Kortom, PREMOVE is een hoogprecisie, door mensen geverifieerde kaart van hoe mensen in de oudheid zich door de wereld bewogen met woorden, ontworpen om computers en mensen samen te laten begrijpen hoe de geschiedenis van taal werkt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →