← Nieuwste papers
💻 computer science

How Reliable Are Bengali LLM Benchmarks? A Cross-Lingual Contamination and Robustness Audit of Open-Weight Language Models

Dit artikel introduceert en valideert een systematisch kader voor het auditeren van de betrouwbaarheid van Bengaalse LLM-benchmarks door kruislingse datacontaminatie te detecteren en robuustheid tegen perturbaties te meten, waarbij wordt onthuld dat de initiële pilotresultaten nauwelijks boven het niveau van toeval uitkomen.

Oorspronkelijke auteurs: Md Fahim Faisal Tanha

Gepubliceerd 2026-08-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Md Fahim Faisal Tanha

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te beoordelen hoe goed een nieuwe student is in het oplossen van wiskundeproblemen. Je geeft hem een toets, hij haalt een hoge score, en je verklaart hem een genie. Maar wat als hij, vóór de toets, stiekem het antwoordmodel heeft uit het hoofd geleerd? Of wat als hij dezelfde problemen in een andere taal heeft gezien en gewoon de antwoorden heeft geraden op basis daarvan? Dit is de ingewikkelde wereld van het testen van Kunstmatige Intelligentie (AI). Wetenschappers bouwen "Large Language Models" (LLM's)—superintelligente computerprogramma's die kunnen lezen, schrijven en chatten in veel verschillende talen. Om te zien of deze programma's echt slim zijn of gewoon goed zijn in het onthouden, geven onderzoekers ze gestandaardiseerde tests die "benchmarks" worden genoemd.

Echter, er is een sluw probleem genaamd "contaminatie" (besmetting). Het is alsof een leraar per ongeluk het antwoordmodel op het bureau heeft laten liggen en de leerling dit heeft gevonden voordat het examen begon. De leerling haalt een perfecte score, maar hij heeft de stof niet echt geleerd; hij heeft alleen de antwoorden uit zijn hoofd geleerd. Dit is een groot probleem, want als de tests "gecontamineerd" zijn, kunnen we de scores niet vertrouwen. We zouden kunnen denken dat een AI geweldig is in een taal als het Bengaals (gesproken door honderden miljoenen mensen), terwijl het in werkelijkheid alleen de Engelse versie van de test heeft gezien.

Laten we nu kijken naar een nieuwe studie die optreedt als een detective, die onderzoekt of de AI-tests voor de Bengaalse taal eerlijk zijn of vol zitten met verborgen lekken.

Het Detectiewerk: Het Auditen van Bengaalse AI-tests

De onderzoekers in dit artikel stellen een zeer belangrijke vraag: Zijn de scores die we zien voor AI-modellen op Bengaalse tests echt, of zijn ze opgeblazen omdat de modellen eerder aan de vragen zijn blootgesteld?

Ze richtten zich op het Bengaals omdat dit een enorme taal is die pas onlangs haar eigen AI-tests heeft gekregen. Veel van deze tests zijn directe vertalingen van beroemde Engelse tests. Het team maakte zich zorgen dat als een AI-model de Engelse versie van een vraag tijdens zijn training had gezien, het de Bengaalse antwoorden correct zou kunnen raden zonder daadwerkelijk Bengaals te begrijpen. Dit wordt "cross-lingual contamination" (kruislingse contaminatie) genoemd.

Om dit mysterie op te lossen, hebben de onderzoekers een speciaal "audit framework" gebouwd—een set hulpmiddelen om te controleren op eerdere blootstelling. Ze gebruikten drie hoofdmethode:

  1. De "Likelihood"-check: Ze keken naar hoe verrast de AI was door de testvragen. Als de AI de vraag eerder had gezien, zou de AI niet verrast zijn; de AI zou zeer zelfverzekerd zijn. Als de AI de vraag voor het eerst zag, zou de AI meer aarzelend zijn.
  2. De "Invul-de-tekortkoming"-test: Ze probeerden de AI te misleiden door een van de foute antwoorden in een meerkeuzevraag te verbergen en de AI te vragen wat het ontbrekende antwoord was. Als de AI het exacte ontbrekende woord kon raden, had de AI waarschijnlijk de hele test uit het hoofd geleerd.
  3. De "Ground Truth"-zoektocht: Voor sommige modellen die volledig open zijn (waarbij we precies kunnen zien op welke data ze zijn getraind), hebben ze letterlijk de trainingsdata doorzocht om te zien of de testvragen daar aanwezig waren.

Ze testten ook de robuustheid. Dit is als het lichtelijk veranderen van de formulering van een vraag—het vervangen van een getal of het toevoegen van een onzinnige, irrelevante zin—om te zien of de AI het nog steeds goed krijgt. Als de score van de AI instort wanneer je de vraag licht verandert, suggereert dit dat de AI niet echt aan het "denken" was, maar simpelweg het exacte patroon uit het hoofd had geleerd.

Wat ze hebben gevonden (tot nu toe)

De onderzoekers hebben niet alleen over de theorie gesproken; ze hebben ook een kleine "pilot"-test uitgevoerd om te zien of hun detectietools werkten. Ze gebruikten een kleiner AI-model (genaamd Qwen2.5-1.5B) en testten dit op 500 vragen uit een Bengaalse leesvaardigheidstest genaamd BoolQ-bn.

Dit is wat de pilot onthulde:

  • De score was nauwelijks beter dan een muntje opgooien: Het model behaalde een nauwkeurigheid van 0,568. Aangezien dit een ja/nee-vraagtest is, zou een willekeurige gok een score van 0,50 opleveren. Het model deed slechts ongeveer 7 punten beter dan puur geluk. Dit suggereert dat het model op deze schaal nog geen sterk begrip van Bengaalse leesvaardigheid heeft.
  • De "Prior Exposure"-test was inconclusief: Ze probeerden te zien of het model de antwoorden had uit het hoofd geleerd met behulp van hun likelihood-tools, maar ze hadden een speciale "controlegroep" van vragen nodig (vragen die het model zeker niet eerder had gezien) om mee te vergelijken. Dat deel wordt nog afgerond.
  • De "Afleidings"-test: Ze voegden een afleidende zin toe aan de vragen om te zien of de AI in de war zou raken. De score van het model daalde licht naar 0,558, maar het verschil was statistisch niet significant (de wiskunde zegt dat het willekeurige ruis zou kunnen zijn). Dit betekent dat de pilot te klein was om met zekerheid te zeggen of het model fragiel was of niet.

Het Grote Plaatje

De belangrijkste kern van dit artikel is niet een definitief oordeel over de vraag of Bengaalse AI tekenen van eerdere blootstelling vertoont of niet. In plaats daarvan is dit artikel een blauwdruk voor hoe men dit kan uitzoeken.

De onderzoekers hebben een volledige, open-source toolkit gebouwd die iedereen kan gebruiken om deze tests te auditeren. Ze hebben alle beschikbare Bengaalse benchmarks op een rij gezet, een protocol opgesteld om contaminatie te controleren, en aangetoond dat het mogelijk is om deze dure tests uit te voeren op gratis computerbronnen (zoals Google Colab).

Ze zijn momenteel de volledige audit aan het uitvoeren op veel meer modellen en benchmarks. De pilot bewees dat het systeem werkt, maar de volledige resultaten worden nog berekend. Het artikel betoogt dat we, totdat we deze audits uitvoeren, niet zeker kunnen weten of de hoge scores die we voor AI in het Bengaals zien, echte intelligentie zijn of simpelweg het resultaat van het feit dat de modellen de Engelse antwoorden eerder hebben gezien.

Kortom, dit artikel is een oproep tot actie: "Laten we stoppen met gissen of AI slim is in het Bengaals en beginnen met het gebruiken van deze detectietools om het te bewijzen." Ze zorgen ervoor dat wanneer we zeggen dat een AI goed is in een taal, dat dit komt omdat de AI de taal daadwerkelijk begrijpt, en niet omdat de AI de test uit het hoofd heeft geleerd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →