← Nieuwste papers
💬 NLP

ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models

Het artikel introduceert ChiKhaPo, een grootschalige meertalige benchmark die meer dan 2700 talen beslaat met acht subtaken ontworpen om de lexicale begrips- en generatievaardigheden van grote taalmodellen te evalueren, wat onthult dat zelfs state-of-the-art modellen moeite hebben met basislinguïstische competentie in de overgrote meerderheid van de geschreven talen ter wereld.

Oorspronkelijke auteurs: Emily Chang, Niyati Bafna

Gepubliceerd 2026-06-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Emily Chang, Niyati Bafna

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, superintelligente bibliotheek hebt met boeken geschreven in duizenden verschillende talen. Je huurt een briljante nieuwe bibliothecaris in (een Large Language Model, of LLM) om je te helpen specifieke woorden te vinden en te vertalen. Je wilt weten: Begrijpt deze bibliothecaris de woorden echt, of raadt hij gewoon op basis van de weinige talen die hij het meest heeft bestudeerd?

Dit artikel introduceert een nieuwe test genaamd ChiKhaPo (uitgesproken als Chi-Kha-Po) om precies die vraag te beantwoorden. De naam komt van een uitdrukking die betekent "stap voor stap", omdat de auteurs geloven dat we kleine, zorgvuldige stappen moeten zetten om te begrijpen hoe deze AI-modellen echt werken over de talen van de wereld heen.

Hier is de onderverdeling van wat ze hebben gedaan, met behulp van enkele alledaagse analogieën:

1. Het Probleen: De "VIP-lounge" van Talen

Huidige tests voor AI zijn als VIP-lounges. Ze laten alleen een paar dozijn "hoog-resource talen" toe (zoals Engels, Spaans of Frans). Dit zijn talen met enorme hoeveelheden data op het internet.

  • De Realiteit: Er zijn meer dan 3.800 geschreven talen in de wereld. De overgrote meerderheid is uitgesloten van deze VIP-lounges.
  • De Kloof: We weten niet of de AI de andere 3.700+ talen aankan. Het kan een genie zijn in het Engels, maar volledig de weg kwijt zijn wanneer er gevraagd wordt om een woord in een laag-resource taal te vertalen.

2. De Oplossing: Het "Massale Meertalige Examen" (ChiKhaPo)

De auteurs hebben een massaal examen gebouwd dat 2.700+ talen beslaat. In plaats van de AI te vragen een complexe essay te schrijven of een wiskundig probleem op te lossen (wat moeilijke taken zijn), hebben ze zich gericht op de basis: Lexicale Competentie.

  • De Analogie: Denk aan het testen van een student op hun woordenschat voordat je hen vraagt een roman te schrijven. Kan hij een woord herkennen? Kan hij zeggen wat het betekent? Kan hij het in een zin gebruiken?

Het examen heeft 8 verschillende secties (subtaken) om deze vaardigheden vanuit verschillende hoeken te testen:

  • Woordvertaling: "Wat is het woord voor 'regen' in het Maleis?" (Directe vertaling).
  • Woordvertaling met Context: "In dit verhaal over een storm, wat betekent het woord 'ujan'?" (Gebruik van contextuele aanwijzingen).
  • Vertalings-geconditioneerde Modellering: De AI krijgt een zin in één taal en moet het volgende woord in de vertaling voorspellen. (Als een "invulspelletje").
  • Bag-of-Words Vertaling: De AI vertaalt een hele zin, en de test controleert of hij de individuele woorden goed heeft gekregen, zelfs als de zinsstructuur een beetje rommelig is.

3. De Resultaten: De AI worstelt met de Basis

De auteurs hebben 6 van de slimste AI-modellen van dit moment getest op dit examen.

  • De Bevinding: Zelfs de beste modellen hadden aanzienlijke problemen, vooral met laag-resource talen.
  • De "Begrip versus Generatie" Kloof: De modellen waren beter in het begrijpen van een woord (het lezen en weten wat het betekent) dan in het genereren ervan (het woord zelf zeggen of schrijven).
    • Analogie: Het is alsof iemand een menu in een vreemde taal kan lezen en weet wat "soep" is, maar wanneer hij gevraagd wordt het te bestellen, bevriest hij en kan hij het woord niet uitspreken.
  • De "Rijk versus Arm" Kloof: De modellen presteerden veel beter op talen met veel data (hoog-resource) vergeleken met talen met zeer weinig data (laag-resource). Het prestatieverschil was enorm.

4. Waarom dit ertoe doet (volgens het artikel)

Het artikel betoogt dat we niet zomaar kunnen aannemen dat AI "meertalig" is omdat het goed werkt in het Engels.

  • De "Proxy" Ontdekking: Ze ontdekten dat als een AI goed is in het vertalen van losse woorden (de simpele test), het meestal ook goed is in het vertalen van volledige zinnen (de complexe test). Dit betekent dat de simpele woordtest een goedkope en gemakkelijke manier is om te controleren of een AI klaar is voor een moeilijkere taak.
  • Het Doel: De auteurs willen in het licht zetten van taalongelijkheid. Op dit moment is NLP (Natural Language Processing) onrechtvaardig omdat het duizenden talen negeert. ChiKhaPo is een instrument om onderzoekers eraan te herinneren aandacht te besteden aan deze verwaarloosde talen en betere, eerlijkere AI te bouren.

Samenvatting

ChiKhaPo is een enorme, stap-voor-stap woordenschattest voor AI over 2.700+ talen. Het onthult dat zelfs de slimste AI-modellen momenteel "woordblind" zijn voor de meeste talen in de wereld. Ze kunnen vaak een woord begrijpen, maar worstelen met het produceren ervan, en ze presteren erg slecht bij talen die weinig data online hebben. De auteurs hopen dat deze test de AI-gemeenschap zal aanmoedigen om niet alleen te focussen op de "VIP"-talen, maar om modellen te bouwen die echt de hele wereld begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →