← Nieuwste papers
💬 NLP

Evaluating Large Language Models for Hausa and Fongbe Machine Translation: Benchmarks, Failures, and Metric Reliability

Deze studie evalueert de vertaalvaardigheden van vier grote taalmodellen voor Engels-naar-Hausa en Engels-naar-Fongbe, waarbij significante prestatieverschillen tussen de twee talen, de onbetrouwbaarheid van standaard automatische metrieken in correlatie met menselijk oordeel, en de noodzaak van grootschalige evaluatie en multi-metrische benaderingen voor minderheidstalen in Afrika worden onthuld.

Oorspronkelijke auteurs: Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een verhaal probeert te vertalen van het Engels naar twee zeer verschillende Afrikaanse talen: Hausa (gesproken door miljoenen in Nigeria en Niger) en Fongbe (gesproken door een kleinere groep in Benin). Je hebt vier krachtige "robotvertalers" (Large Language Models zoals GPT-4, Claude en Gemini) klaarstaan om de klus te klaren.

Dit artikel is als een rigoureuze smaaktest om te zien welke robot het beste werk levert en, nog belangrijker, of de "scorekaarten" die we gebruiken om ze te beoordelen (automatische metrieken) daadwerkelijk overeenkomen met wat echte menselijke sprekers vinden.

Hier is de uitslag van hun bevindingen, met behulp van eenvoudige analogieën:

1. De "Robotrace": Wie won er?

De onderzoekers vroegen de robots om duizenden zinnen te vertalen. De resultaten vertelden een verhaal van twee zeer verschillende werelden:

  • Hausa (De "goed genoeg" loper): De robots deden het hier redelijk. De vertalingen waren begrijpelijk en liepen goed. Het was alsoals een loper die een race voltooide met een respectabele tijd.
    • De Winnaar: GPT-4o was de favoriet onder menselijke beoordelaars, ook al gaven de computerscorekaarten de winst aan Claude.
  • Fongbe (De "struikelende" loper): De robots hadden het hier erg moeilijk. De vertalingen waren vaak onzinnig of gebroken. Het was alsof een loper over zijn eigen veters struikelde.
    • De Winnaar: Gemini was de minst slechte optie, maar zelfs deze kreeg van mensen slechts een "onvoldoende" cijfer.
  • De Grote Kloof: Hausa-vertalingen waren ongeveer drie keer zo goed als de Fongbe-vertalingen. Dit kwam niet omdat Fongbe een "moeilijkere" taal is, maar omdat de robots veel meer trainingsdata voor Hausa hadden gezien dan voor Fongbe.

Belangrijkste les: Alleen omdat een robot goed is in één Afrikaanse taal, betekent niet dat hij ook goed zal zijn in een andere. Je kunt er niet vanuit gaan dat één "one-size-fits-all" AI overal werkt.

2. Het "Scorekaart"-probleem: Liegen de computers?

Dit is het meest verrassende deel van het artikel. De onderzoekers vergeleken de prestaties van de robots met twee zaken:

  1. Menselijke beoordelaars: Echtere moedertaalsprekers die de vertalingen beoordelen.
  2. Automatische metrieken: Computeralgoritmen (zoals BLEU, chrF++, BERTScore) die proberen vertalingen te beoordelen zonder dat er een mens naar kijkt.

De Mismatch:

  • Voor Fongbe: De computerscorekaarten en de mensen waren het eens. Beiden zeiden: "Gemini is de beste."
  • Voor Hausa: De computerscorekaarten en de mensen waren het volledig oneens.
    • De computers (specifiek BLEU en chrF++) zeiden: "Claude is de winnaar!"
    • De mensen zeiden: "Nee, GPT-4o is de winnaar; Claude klinkt robotachtig."

De "Gebroken Liniaal" Analogie:
Stel je voor dat je de lengte van twee mensen meet.

  • Voor Fongbe werkt je liniaal perfect.
  • Voor Hausa is je liniaal verbogen. Hij zegt dat de kortere persoon langer is omdat hij de verkeerde dingen meet (zoals hoe de letters in een woord staan in plaats van hoe de zin klinkt).

3. De "Magische Spiegel" die Niets Reflecteert (Neurale Metrieken)

Het artikel testte een specifiek type computermetriek genaamd BERTScore, dat een "magische spiegel" (een embedding-model) gebruikt om te zien of twee zinnen hetzelfde betekenen.

  • De Fout: Voor zowel Hausa als Fongbe was deze spiegel kapot. Hij keek naar twee volkomen verschillende zinnen en zei: "Deze zijn 99% identiek!"
  • Het Resultaat: Omdat de spiegel het verschil niet kon zien tussen een goede vertaling en een slechte, waren de scores voor iedereen hetzelfde (hoge cijfers voor iedereen). Het was alsof een jury elke deelnemer een gouden medaille gaf omdat ze niet konden horen wie er daadwerkelijk aan het zingen was.
  • De Les: Je kunt deze "slimme" metrieken niet vertrouwen voor deze talen totdat we de spiegel hebben gerepareerd.

4. De "Steekproef"-valstrik

De onderzoekers probeerden de robots te testen met kleine groepen zinnen (500 of 1.000) en daarna met een enorme groep (10.000).

  • De Valstrik: Bij kleine groepen waren de resultaten chaotisch en misleidend. Bijvoorbeeld, bij 1.000 zinnen suggereerde de data dat Gemini in Hausa won. Maar toen ze 10.000 zinnen testten, bleek dat Claude eigenlijk de winnaar was.
  • De Les: Je hebt een grote menigte nodig (minstens 2.500 zinnen) om een echt beeld te krijgen. Kleine steekproeven zijn als het beoordelen van een hele film op basis van een clip van 10 seconden; je krijgt misschien een verkeerd beeld.

Samenvatting van Aanbevelingen

Op basis van deze "smaaktest" stellen de auteurs het volgende voor:

  1. Vertrouw niet alleen op de computerscorekaarten. Vooral voor Hausa kregen de computers de winnaar verkeerd. Je moet echt mensen het werk laten controleren.
  2. Gebruik de juiste liniaal. Als je toch een computermetriek moet gebruiken, gebruik dan chrF++ (die het aantal lettertekens telt) in plaats van de "magische spiegel" (BERTScore), die momenteel kapot is voor deze talen.
  3. Kies je robot zorgvuldig. Als je naar het Hausa moet vertalen, gebruik dan GPT-4o of Claude. Als je naar het Fongbe moet vertalen, gebruik dan Gemini, maar wees voorbereid op een matige kwaliteit.
  4. Gebruik Fongbe-vertalingen nog niet voor serieuze zaken. De kwaliteit is te laag; het zou zijn alsof je een huis probeert te bouwen met nat zand.
  5. Hausa is klaar voor "data-augmentatie". De vertalingen zijn goed genoeg om te worden gebruikt als extra trainingsdata, mits je de slechte er eerst uitfiltert.

Kortom: AI wordt beter in het vertalen van Afrikaanse talen, maar het is er nog niet. De instrumenten die we gebruiken om het succes ervan te meten zijn vaak kapot, en we hebben echte mensen nodig om de robots eerlijk te houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →