← Nieuwste papers
💬 NLP

mmPISA-bench: Do LLMs Reason Equally Well Across 43 Languages?

Dit artikel introduceert mmPISA-bench, een meertalige redeneerbenchmark afgeleid van PISA over 43 talen, die aantoont dat moderne LLM's een met mensen vergelijkbare redeneerprestatie bereiken met minimale degradatie door machinevertaling, hoewel het aanzienlijke variaties in nauwkeurigheid en inferentiekosten over verschillende talen onthult.

Oorspronkelijke auteurs: Yerzhan Sapenov, Jaromir Savelka

Gepubliceerd 2026-06-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yerzhan Sapenov, Jaromir Savelka

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente student hebt die bijna elke taal kan spreken. Je wilt weten: Is deze student even slim bij het maken van een toets in het Frans als in het Engels? Of, als je een toets geeft in een taal die ze niet van nature kennen (maar die door een robot is vertaald), geven ze dan nog steeds de juiste antwoorden?

Dit artikel, genaamd mmPISA-bench, is als een enorme, meertalige rapportcijferlijst voor twee van de meest geavanceerde AI-"studenten" ter wereld (specifiek modellen van OpenAI en Anthropic). Hier is de uitsplitsing van wat ze hebben gevonden, met behulp van enkele alledaagse analogieën.

1. De Test: Een Wereldwijd Wiskunde- en Leesexamen

De onderzoekers hebben niet zomaar willekeurige vragen bedacht. Ze hebben 25 echte vragen gepakt uit het PISA-examen—het beroemde internationale examen dat vijftienjarige leerlingen over de hele wereld maken om te bewijzen dat ze wiskundige problemen kunnen oplossen en leesgedeelten kunnen begrijpen.

  • De Opzet: Ze namen deze 25 vragen en vertaalden ze naar 43 verschillende talen.
  • De Twist: Voor elke taal hadden ze twee versies:
    1. De "Officiële" Versie: Vertaald door menselijke experts (zoals een professionele vertaler).
    2. De "Robot" Versie: Vertaald door Google Translate (machinale vertaling).
  • Het Doel: Zien of de AI deze logische puzzels in alle 43 talen kon oplossen, en of het uitmaakte of de vertaling door een mens of een robot was gedaan.

2. De Resultaten: Zijn de AI-studenten Overal Even Slim?

Het Goede Nieuws: Ja, grotendeels.
De AI-modellen presteerden erg goed in alle 43 talen. Sterker nog, hun nauwkeurigheid was vaak vergelijkbaar met wat je zou verwachten van een slimme vijftienjarige menselijke leerling. Ze "vergeten" niet plotseling hoe ze wiskunde moeten doen, alleen omdat de vraag in het IJslands of Thais is gesteld.

Het Nadeel: Het was niet perfect gelijk.

  • Het "Dialect"-effect: Net zoals een mens misschien iets comfortabeler een verhaal leest in de moedertaal dan in een tweede taal, was de AI in sommige talen iets nauwkeuriger dan in andere.
  • De "Robot"-vertalingsmythe: Je zou kunnen denken: "Als de vraag door een robot is vertaald, raakt de AI in de war." Het artikel zegt: nee. De AI gaf net zo vaak de juiste antwoorden met de "Robot"-vertalingen als met de "Menselijke" vertalingen. Dit is een groot ding, want het betekent dat we niet altijd dure menselijke vertalers nodig hebben om AI in nieuwe talen te testen; een goede machinale vertaling werkt prima.

3. De Verborgen Kosten: De "Denk"-Prijskaart

Dit is waar het artikel echt interessant wordt. Het gaat niet alleen om het juiste antwoord krijgen; het gaat om hoeveel het kost om daar te komen.

Stel je twee studenten voor die een toets maken:

  • Student A (Claude): Schrijft voor elk antwoord een zeer lange, gedetailleerde uitleg.
  • Student B (GPT): Schrijft kortere uitleg.

De onderzoekers ontdekten dat de AI voor sommige talen veel harder moest "denken" (meer tekst schrijven) om het juiste antwoord te krijgen, wat het maken van de test duurder maakte.

  • De "Dure & Onhandige" Talen: Voor bepaalde talen (zoals Thais voor het ene model, of Grieks voor het andere) moest de AI een enorme hoeveelheid tekst genereren om een simpel probleem op te lossen. Het was alsof je betaalde voor een luxe taxiritje om alleen maar even naar de winkel op de hoek te gaan.
  • Het Resultaat: In deze "dure" talen was de AI feitelijk minder nauwkeurig én duurder tegelijkertijd. Het is een dubbele klap: je betaalt meer en je krijgt een slechter resultaat.

4. De Geheime Taalwissel

De onderzoekers hebben ook onder de motorkap gekeken om te zien hoe de AI dacht. Ze ontdekten iets verrassends:

  • Soms, wanneer de AI een vraag in het Kazakh kreeg, dacht hij niet alleen in het Kazakh of Engels. Hij begon de wiskunde en logica daadwerkelijk in het Russisch te doen voordat hij het antwoord in het Kazakh teruggaf.
  • Het is alsof een persoon Spaans en Engels spreekt, maar wanneer hij een moeilijke wiskundevraag krijgt, instinctief overschakelt naar het denken in het Frans omdat daar zijn "wiskundige brein" leeft. De AI deed iets vergelijkbaars door een "pivot-taal" (tussenliggende taal) te gebruiken om het probleem op te lossen.

Samenvatting: Wat Betekent Dit?

  • AI wordt goed in talen: Moderne AI kan redeneren door logische puzzels in 43 verschillende talen bijna net zo goed als een menselijke tiener.
  • Machinale vertaling is prima: Je hebt geen perfecte menselijke vertalingen nodig om AI te testen; robotvertalingen werken prima.
  • Taal maakt uit voor de kosten: Sommige talen zijn "moeilijker" voor AI te verwerken. Ze zorgen ervoor dat de AI meer praat (wat geld kost) en zorgen er soms voor dat de AI meer fouten maakt.
  • We moeten dieper kijken: Om echt te begrijpen hoe goed een AI is, kunnen we niet alleen naar de eindscore kijken. We moeten ook kijken naar hoeveel "inspanning" (en geld) het kostte om dat score te halen, en in welke talen de AI stiekem aan het denken was.

Kortom, de AI is een talig genie, maar heeft nog steeds enkele "dialecten" waarbij hij wat struikelt en een flink deel van zijn zakgeld uitgeeft om de klus te klaren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →