← Nieuwste papers
💬 NLP

UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding

Dit artikel introduceert UrduMMLU, een uitgebreide benchmark van meer dan 26.000 meerkeuzevragen in de Urdu-taal afkomstig uit inheemse educatieve bronnen om de prestaties van 30 grote taalmodellen te evalueren, wat aanzienlijke tekortkomingen onthult in hun begrip van regionaal gewortelde inhoud en geesteswetenschappen vergeleken met STEM.

Oorspronkelijke auteurs: Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

Gepubliceerd 2026-06-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te testen hoe slim een groep studenten is. Jarenlang heb je alleen de mogelijkheid gehad om hen toetsen te geven die in het Engels zijn geschreven. Je weet dat ze Engels kunnen lezen, maar je hebt geen idee of ze de geschiedenis, literatuur en wetenschap van hun eigen cultuur echt begrijpen, of dat ze simpelweg de Engelse vertalingen van die concepten hebben uit het hoofd geleerd.

Dit artikel introduceert URDUMMLU, een enorme nieuwe "examen" ontworpen specifiek voor de Urdu-taal, die door meer dan 230 miljoen mensen wordt gesproken. Hier is de uitsplitsing van wat ze hebben gedaan en wat ze hebben gevonden, met behulp van enkele eenvoudige analogieën.

1. Het Probleem: Het "Vertaalde Menu"-probleem

Tot nu toe, als onderzoekers AI-modellen op Urdu wilden testen, namen ze meestal Engelse tests en vertaalden deze.

  • De Analogie: Stel je voor dat je probeert het vermogen van een chef-kok om authentiek Italiaans eten te bereiden te beoordelen door hem een menu te geven dat uit het Frans is vertawd. Hij krijgt de woorden misschien wel goed, maar hij kan de culturele nuances, de lokale ingrediënten of de specifieke manier waarop een gerecht traditioneel wordt bereid, missen.
  • De Realiteit: Bestaande Urdu-benchmarks waren als deze vertaalde menu's. Ze legden de unieke smaak van het Urdu-onderwijs, de literatuur of de lokale geschiedenis (zoals Pakistaanse studies of Islamitische studies) niet vast.

2. De Oplossing: Het Bouwen van een Inheemse "Urdu Examenzaal"

De auteurs bouwden URDUMMLU, een benchmark met 26.431 meerkeuzevragen.

  • Waar kwamen de vragen vandaan? In plaats van Engelse vragen te vertalen, gingen ze direct naar de bron: echte Pakistaanse schooltextboeken, eerdere examens (SSC/HSSC) en lokale Urdu vraagensets.
  • Het "Dubbelcheck"-systeem: Omdat sommige van deze oude examens geen antwoordsleutels hadden, huurde het team 17 moedertaalsprekers van het Urdu (voornamelijk met universitaire graden) in om als "toezichthouders" te fungeren.
    • De Regel: Twee toezichthouders moesten elke vraag bekijken en het eens worden over het antwoord. Als ze het oneens waren, of als de vraag gebrekkig was, werd de vraag weggegooid. Dit zorgde ervoor dat de "gouden standaard" antwoorden 100% betrouwbaar waren.
  • De Omvang: Het examen bestrijkt 26 vakken, variërend van Wiskunde en Natuurkunde (STEM) tot Urdu Literatuur, Islamitische Studies en Pakistaanse Studies.

3. De Test: 30 AI-modellen in de Examenzaal

De onderzoekers namen 30 verschillende AI-modellen (zowel beroemde "gesloten" modellen zoals Google's Gemini als open-source modellen) en gaven hen dit Urdu-examen. Ze testten ze op twee manieren:

  1. Engelse Instructies: "Hier is een vraag in het Urdu, kies het antwoord." (De instructie is in het Engels).
  2. Urdu Instructies: "یہاں ایک سوال ہے، جواب منتخب کریں۔" (De instructie is in het Urdu).

4. De Resultaten: De "STEM versus Cultuur"-kloof

De resultaten waren onthullend, als een rapportcijfer dat liet zien dat een student geweldig is in wiskunde, maar verschrikkelijk is in het analyseren van poëzie.

  • De Toppresteerder: Het model Gemini-3.5-Flash was de duidelijke winnaar en scoorde meer dan 90%. Het was het enige model dat de grens van 85% doorbrak.
  • De Open-Source Kloof: Het beste open-source model (DeepSeek-V4-Flash) scoorde rond de 82%. Hoewel goed, bleef het achter bij de leider met ongeveer 8 punten.
  • De "Humanities"-crash: Dit is de belangrijkste bevinding.
    • De Analogie: Stel je een student voor die complexe natuurkundige vergelijkingen kan oplossen (STEM), maar faliekant faalt wanneer hij gevraagd wordt een gedicht te analyseren of een religieuze tekst uit te leggen (Humanities).
    • De Realiteit: Bijna alle modellen presteerden veel beter op wetenschappelijke en wiskundige vragen. Wanneer de vragen verschoven naar Urdu Literatuur, de Urdu Taal en Islamitische Studies, daalden veel modellen met 25 tot 40 procentpunten.
    • Voorbeeld: Een model kan 97% scoren op Natuurkunde, maar slechts 67% op Urdu Literatuur. Dit suggereert dat de modellen de feiten van de wetenschap kennen (die universeel zijn), maar het diepe culturele en taalkundige begrip missen dat vereist is voor lokale onderwerpen.

5. Andere Verrassende Bevindingen

  • Taal van Instructies Maakte Niet Veel Uit: Of de AI nu werd verteld om in het Engels of in het Urdu te antwoorden, de score veranderde nauwelijks. Het probleem was niet de taal van de instructie; het was het gebrek aan kennis in het "brein" van het model over de Urdu-cultuur.
  • Few-Shot Learning (Het "Spiekbriefje"): De onderzoekers probeerden de AI een paar voorbeeldvragen te geven voordat de test begon (zoals een spiekbriefje). Het hielp een beetje (het verhoogde de scores met 1–3 punten), maar het was niet genoeg om de grote gaten in culturele kennis te dichten.
  • De "Urdu-specifieke" Modellen: Interessant genoeg presteerden modellen die specifiek alleen voor Urdu zijn getraind (zoals Qalb en Alif) behoorlijk slecht (rond de 35%), vaak slechter dan algemene modellen. Dit suggereert dat alleen trainen op Urdu-tekst niet genoeg is; de modellen moeten worden getraind op educatief en redeneer materiaal, niet alleen op chat of nieuws.

Samenvatting

URDUMMLU is als een nieuwe, strenge "rijbewijstest" voor AI in het Urdu. Het bewijst dat hoewel AI erg goed wordt in het beantwoorden van wetenschappelijke vragen in het Urdu, het nog steeds moeite heeft om de ziel van de taal te begrijpen — de literatuur, geschiedenis en lokale cultuur. De huidige "beste" AI (Gemini) is een sterke chauffeur, maar de open-source modellen zijn nog steeds aan het leren hoe de regels van de weg werken, vooral als het gaat om de culturele nuances van de Urdu-sprekende wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →