← Nieuwste papers
💬 NLP

Expanding the Lexicon of Ge'ez Based African Languages: A Comparative Study of Amharic and Tigrinya

Dit artikel introduceert VEXMLM, een met vocabulaire uitgebreide variant van XLM-R die is afgestemd op talen met het Ge'ez-schrift zoals Amhaars en Tigrinya, die de prestaties op downstream-taken zoals vraagbeantwoording, sentimentanalyse en entiteitsherkenning aanzienlijk verbetert door het aantal woorden buiten de vocabulaire en excessieve subwoordfragmentatie te verminderen via een gespecialiseerde twee-fasen trainingsstrategie die ook 17 andere Afrikaanse talen ten goede komt.

Oorspronkelijke auteurs: Hailay Kidu Teklehaymanot, Debela Desalegn Yadeta, Wolfgang Nejdl

Gepubliceerd 2026-07-17
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hailay Kidu Teklehaymanot, Debela Desalegn Yadeta, Wolfgang Nejdl

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een enorme, bruisende bibliotheek waar boeken in duizenden verschillende talen zijn geschreven. Een lange tijd wisten de bibliothecarissen (de slimme computerprogramma's die we Kunstmatige Intelligentie noemen) alleen hoe ze boeken moesten lezen die geschreven waren in het Latijnse alfabet—het soort dat gebruikt wordt voor Engels, Spaans en Frans. Ze hadden een enorme woordenlijst voor deze talen, maar wanneer ze probeerden boeken te lezen die geschreven waren in andere schriften, zoals het Ge'ez-schrift dat gebruikt wordt in Ethiopië en Eritrea, raakten ze in de war. Ze hakten woorden in kleine, betekenisloze stukjes of gooiden hun handen in de lucht en zeiden: "Ik ken dit woord niet!" Dit is een probleem omdat het miljoenen mensen buiten het digitale gesprek laat, waardoor ze niet in staat zijn om de beste hulpmiddelen te gebruiken voor het begrijpen van tekst, het vinden van antwoorden of het herkennen van belangrijke namen.

Om dit op te lossen, hebben onderzoekers geprobeerd deze AI-modellen nieuwe woorden te leren. Maar het is lastig. Als je simpelweg nieuwe woorden in een oude woordenlijst dwingt zonder de AI te leren hoe ze bij elkaar passen, raakt de AI de weg kwijt. Dit artikel duikt in die specifieke uitdaging: hoe je een superintelligent AI-model kunt upgraden zodat het eindelijk Amhaars en Tigrinya kan lezen en begrijpen, twee belangrijke talen geschreven in het prachtige Ge'ez-schrift, zonder de rest van zijn brein te beschadigen.

Het Probleem: De "Lijm" Die Niet Plakt

Denk aan een modern AI-taalmodel als een meesterkok die geweldige maaltijden kan koken in 100 verschillende talen. Maar deze kok heeft een zeer specifieke regel: hij gebruikt alleen een vooraf verpakte set ingrediënten (genaamd tokens) die voornamelijk ontworpen zijn voor talen met een Latijns schrift. Wanneer de kok een gerecht probeert te koken in het Amhaars of Tigrinya, passen de ingrediënten niet. Het schrift is anders; het is een "syllabische abugida", wat betekent dat elk symbool een medeklinker en een klinker samen vertegenwoordigt, in plaats van slechts een enkele letter.

Omdat de ingrediëntenlijst van de kok fout is voor deze talen, eindigt hij met het hakken van de woorden in kleine, nutteloze kruimels. Een enkel woord kan in vijf of zes stukjes worden gehakt, en veel woorden komen in de voorraadkast van de kok helemaal niet voor. Wanneer de AI een woord tegenkomt dat het niet kent, labelt het dit simpelweg als "UNK" (onbekend), waardoor alle betekenis verloren gaat. Dit maakt de AI slecht in taken zoals het vinden van een persoonnaam in een nieuwsartikel of het bepalen of een tweet blij of verdrietig is.

De Oplossing: VEXMLM, de Kleermaker op Maat

De onderzoekers introduceerden een nieuwe aanpak genaamd VEXMLM. Stel je VEXMLM voor als een meesterkleermaker die het bestaande, hoogwaardige pak (het AI-model) van de chef neemt en het op maat maakt voor een nieuw lichaamstype. Ze hebben niet alleen nieuwe ingrediënten in de voorraadkast gegooid; ze deden dat met een specifiek, zorgvuldig recept.

Eerst bouwden ze een gloednieuwe, op maat gemaakte woordenlijst specifiek voor het Amhaars en Tigrinya. Ze namen 30.000 nieuwe subwoordstukken (fragmenten van woorden) die perfect passen bij het Ge'ez-schrift en voegden deze toe aan de vocabulaire van de AI. Dit is alsof je de chef een nieuwe set gespecialiseerde messen en kruiden geeft die daadwerkelijk passen bij de ingrediënten die hij probeert te bereiden.

Maar hier komt het slimme deel: je kunt niet zomaar nieuwe ingrediënten in een recept plakken en verwachten dat ze meteen goed smaken. De nieuwe woorden moeten weten hoe ze zich moeten gedragen. De onderzoekers gebruikten een "mean initialization" truc. In plaats van willekeurig te raden wat de nieuwe woorden zouden moeten betekenen, berekenden ze de gemiddelde "smaak" van alle bestaande woorden in het brein van de AI en gaven ze de nieuwe woorden die gemiddelde smaak om mee te beginnen. Dit zorgt ervoor dat de nieuwe woorden soepel passen zonder het systeem te laten schokken.

Ten slotte stopten ze niet bij het toevoegen van de woorden. Ze lieten de AI een tijdje "studeren" met grote collecties Amhaarse en Tigrinya teksten. Dit is de "continued pretraining" fase. Het is alsohad je de chef laat oefenen met koken met de nieuwe ingrediënten totdat hij de smaak beheerst. Na deze studiedsessie testten ze de AI op specifieke taken zoals het beantwoorden van vragen, het herkennen van namen en het detecteren van sentiment.

De Resultaten: Een Grote Sprong Voorwaarts

De resultaten waren indrukwekkend. Wanneer getest op het Amhaars en Tigrinya, was het nieuwe VEXMLM-model een duidelijke winnaar.

  • Beantwoorden van vragen: Wanneer gevraagd werd om antwoorden in een tekst te vinden, kreeg het oude model (XLM-R) de exacte match in 66% van de gevallen goed. VEXMLM sprong dat omhoog naar 87%. Dat is een enorme verbetering, wat betekent dat de AI veel beter in staat is om de volledige context van een zin te begrijpen.
  • Sentimentanalyse: Voor het bepalen of een bericht positief of negatief is, bereikte VEXMLM een nauwkeurigheid van 80%, waarmee het de oude 77% versloeg en een enorme concurrent (Glot500) die slechts 46% haalde, volledig wegvaagde.
  • Herkennen van Namen (NER): Dit is waar het "onbekende woord"-probleem de AI meestal hard raakt. Het oude model worstelde met woorden die het niet kende en kreeg ze slechts in 81,4% van de gevallen goed. VEXMLM verhoogde dat naar 94,3%.

Interessant genoeg ontdekten de onderzoekers dat hoewel de nieuwe vocabulaire specifiek voor het Amhaars en Tigrinya was gebouwd, de voordelen ook doorwerkten naar andere Afrikaanse talen. Zelfs talen die het Ge'ez-schrift niet gebruiken, zagen verbeteringen in het herkennen van woorden die niet in de oorspronkelijke woordenlijst voorkwamen. De auteurs suggereren dat dit gebeurde omdat de "studiedsessie" (continued pretraining) de AI hielp om in het algemeen beter te worden in het afhandelen van complexe woordstructuren, niet alleen van de specifieke nieuwe woorden die ze hebben toegevoegd.

Wat Dit Betekent

Het artikel laat zien dat je geen gigantische, dure AI vanaf nul hoeft te bouwen om te helpen bij talen met weinig bronnen. In plaats daarvan kun je een krachtig bestaand model nemen, het een aangepaste vocabulaire geven die is afgestemd op het specifieke schrift, en het laten oefenen met echte tekst. De studie bewijst dat deze gerichte aanpak beter werkt dan het model simpelweg groter maken of hopen dat het uit zichzelf leert.

De onderzoekers merken echter voorzichtig op dat dit geen toverstaf is voor elk probleem. De verbeteringen waren het meest spectaculair voor de talen waarop ze specifiek getraind hebben (Amhaars en Tigrinya). Voor andere talen waren de winsten een nuttig bijeffect van het trainingsproces, en niet een direct resultaat van de nieuwe vocabulaire. Ze wijzen er ook op dat hun model nog steeds beperkingen heeft, zoals een maximale zinslengte die het in één keer kan lezen, wat het moeilijk kan maken bij zeer lange documenten.

Uiteindelijk is VEXMLM een bewijs van concept: met de juiste instrumenten en een beetje gerichte oefening kunnen we AI veel inclusiever maken, zodat sprekers van Ge'ez-schrift talen niet achterblijven in het digitale tijdperk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →