← Nieuwste papers
💻 computer science

GLeMM: A large-scale multilingual dataset for morphological research

Het artikel introduceert GLeMM, een grootschalige, volledig geautomatiseerde en meertalige dataset van afleidingsmorfologie die zeven Europese talen beslaat, ontworpen om datagestuurd onderzoek en computationele tests van vorm-betekenisrelaties in woordvorming mogelijk te maken.

Oorspronkelijke auteurs: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

Gepubliceerd 2026-09-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Taal is een levend systeem waarin woorden voortdurend evolueren, splitsen en samensmelten om nieuwe betekenissen te creëren. Wanneer we een woord als "happy" nemen en er "happiness" van maken, of "teach" naar "teacher", zijn we bezig met een proces dat afleiding wordt genoemd. Dit is hoe menselijke wezens hun vocabulaire uitbreiden en complexe ideeën creëren vanuit eenvoudige wortels. Decennialang hebben taalkundigen geprobeerd deze verbindingen in kaart te brengen, waarbij ze zich afvroegen waarom sommige woorden op voorspelbare manieren veranderen terwijl andere hun eigen unieke regels lijken te volgen. Ze vroegen zich af of de manier waarop een taal nieuwe woorden vormt hetzelfde is in verschillende culturen, of dat elke taal zijn eigen geheime logica heeft. Tot voor kort betekende het beantwoorden van deze vragen vertrouwen op de intuïtie van experts en kleine, handgekozen lijstjes met voorbeelden. Het was een beetje alsof men het weer probeert te begrijpen door naar een enkele wolk te kijken; je krijgt misschien een gevoel van het patroon, maar je mist de storm.

Een team van onderzoekers heeft nu een enorme digitale bibliotheek gebouwd om deze manier van taalstudie te veranderen. Ze creëerden een bron genaamd GLeMM, wat staat voor een grootschalige meertalige collectie van woordvormingsgegevens. In plaats van te vertrouwen op kleine lijstjes, verzamelden ze informatie over bijna 1,2 miljoen paren verwante woorden in zeven Europese talen: Engels, Frans, Duits, Italiaans, Pools, Russisch en Spaans. Het doel was om voorbij te gaan aan gissingen en de enorme hoeveelheid data het ware structurele proces van hoe talen groeien te laten onthullen. Door het proces van het vinden van deze verbindingen te automatiseren, konden de onderzoekers patronen zien die voorheen onzichtbaar waren, wat een duidelijker beeld gaf van hoe vorm en betekenis met elkaar interageren wanneer we nieuwe woorden creëren.

De onderzoekers zijn niet gaan zitten om handmatig elke woordverbinding op te schrijven. In plaats daarvan wenden zij zich tot Wiktionary, de gratis, online woordenboek die door iedereen bewerkt kan worden. Ze realiseerden zich dat de definities die mensen voor woorden schrijven vaak aanwijzingen bevatten over hoe die woorden met elkaar verband houden. Bijvoorbeeld, als de definitie van "spryness" zegt dat het "de eigenschap is van het spry zijn", dan staat het woord "spry" direct in de uitleg. Het team ontwikkelde een computermethode om miljoenen van deze definities te scannen, op zoek naar paren woorden waarbij het ene woord wordt gedefinieerd met behulp van het andere. Vervolgens controleerden ze of de twee woorden er vergelijkbaar genoeg uitzagen om verwant te zijn, zoals het delen van een gemeenschappelijke wortel. Door deze bevindingen te kruisverwijzen met andere lijsten van verwante woorden, filterden ze willekeurige overeenkomsten eruit en behielden ze alleen de paren die een consistent, herhalend patroon vertoonden. Dit stelde hen in staat om een enorm netwerk van woordfamilies voor elk van de zeven talen op te bouwen, waarbij alles werd gevangen van eenvoudige suffixen zoals "-ness" tot complexere veranderingen met betrekking tot prefixes en meerdere stappen.

Wat zij vonden, daagt enkele langgehouden ideeën over hoe taal werkt uit. Lange tijd geloofden veel taalkundigen dat woordfamilies als volledige webben waren, waarbij elk woord in een familie direct verbonden was met elk ander woord. Als je een woord had voor "reizen", een woord voor "reiziger" en een woord voor "reizend", suggereerde de theorie dat ze allemaal even sterk verbonden waren in een perfecte driehoek. De data van GLeMM suggereren echter dat dit zelden het geval is. In de enorme dataset zijn de meeste woordfamilies geen perfecte webben. In plaats daarvan lijken ze meer op een centraal knooppunt met spaken, waarbij nieuwe woorden uit een hoofdwortel aftakken maar niet noodzakelijkerwijs weer met elkaar verbonden zijn. De onderzoekers ontdekten dat slechts een fractie van de woordgroepen deze perfecte driehoeken vormt. Sterker nog, voor elke 100 paren woorden die theoretisch een driehoek zouden kunnen vormen, doen er slechts een handvol dat daadwerkelijk. Dit suggereert dat de manier waarop wij woorden bouwen meer directioneel en hiërarchisch is dan voorheen gedacht, met een duidelijke stroom van een basiswoord naar de afgeleiden, in plaats van een chaotisch web van wederzijdse verbindingen.

De studie wierp ook licht op hoe verschillende talen dezelfde concepten afhandelen. Hoewel alle zeven talen in de studie nieuwe woorden creëren, doen ze dat met verschillende instrumenten en frequenties. In het Frans vonden ze bijvoorbeeld een specif으로 patroon waarbij een prefix wordt toegevoegd aan een werkwoord om een handeling om te keren, wat een hele nieuwe woordfamilie creëert die de oorspronkelijke spiegelt. In het Engels bestaan soortgelijke patronen, maar zijn ze minder uniform. De dataset toonde aan dat hoewel de onderliggende logica van woordvorming gedeeld wordt, de specifieke regels aanzienlijk variëren. De ene taal geeft er misschien de voorkeur aan om twee bestaande woorden te combineren om een nieuw woord te maken, terwijl een andere de voorkeur geeft aan het toevoegen van een klein eindstukje aan een enkel woord. De onderzoekers ontdekten ook dat sommige woordvormingen "achterstevoren" zijn. Soms wordt een korter woord afgeleid van een langer woord, zelfs al lijkt het erop dat het kortere woord de wortel zou moeten zijn. De data hielpen deze omgekeerde patronen te identificeren door aan te tonen dat ze veel minder frequent voorkomen dan de standaardrichting, waardoor de onderzoekers ze als uitzonderingen op de regel konden herkennen.

Ondanks de enorme schaal van het project, zijn de onderzoekers voorzichtig om te vermelden dat hun bron niet perfect is. Omdat de data automatisch uit een publiek woordenboek zijn verzameld, bevat het fouten en inconsistenties. Sommige woordparen die verwant lijken, zijn dat misschien niet, en sommige definities kunnen er net naast zitten. Echter, de enorme omvang van de collectie betekent dat deze fouten zeldzaam genoeg zijn dat ze het grote plaatje niet verstoren. De onderzoekers schatten dat de nauwkeurigheid van de woordparen zeer hoog is, waarbij meer dan 90 procent van de verbindingen in de Engelse en Franse secties correct is. De bron is ontworpen als een startpunt voor verder onderzoek, een plek waar andere wetenschappers hun eigen theorieën kunnen testen tegen een enorme hoeveelheid real-world data. Het is niet het definitieve antwoord op het mysterie van taal, maar een krachtig nieuw instrument waarmee we het landschap van woordvorming kunnen zien met een helderheid die voorheen onmogelijk was.

De creatie van GLeMM vertegenwoordigt een verschuiving in hoe we taal bestuderen, van kleine, gecureerde voorbeelden naar grootschalige, datagestuurde exploratie. Door het woordenboek te behandelen als een levend corpus van miljoenen relaties, hebben de onderzoekers een venster geopend naar de verborgen architectuur van de menselijke spraak. Ze hebben aangetoond dat hoewel talen divers zijn, ze bepaalde structurele principes volgen die gemeten en geobserveerd kunnen worden. De bevindingen suggereren dat de manier waarop wij woorden bouwen niet een willekeurige verzameling gewoonten is, maar een gestructureerd systeem met duidelijke patronen, uitzonderingen en een duidelijke richting. Terwijl de onderzoekers van plan zijn dit werk uit te breiden door meer talen op te nemen en hun methoden te verfijnen, belooft deze bron ons begrip van het menselijk vermogen om betekenis te creëren uit klank te verdiepen. Het herinnert ons eraan dat elk nieuw woord dat we spreken deel uitmaakt van een enorme, onderling verbonden geschiedenis, en nu hebben we voor het eerst een kaart die groot genoeg is om het hele gebied te zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →