← Nieuwste papers
💬 NLP

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

Dit artikel introduceert M3Kang, de eerste massaal meertalige, multimodale dataset voor wiskundig redeneren afgeleid van de Kangaroo Math Competition, die de prestaties van state-of-the-art visie-taalmodellen afzet tegen menselijke prestaties en hun huidige beperkingen in basiswiskunde en diagramgebaseerd redeneren over 108 talen onthult.

Oorspronkelijke auteurs: Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

Gepubliceerd 2026-01-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een gigantische, wereldwijde wiskundewedstrijd voor genaamd de "Kangaroo Math Competition". Elk jaar doen meer dan zes miljoen kinderen onder de 18 uit meer dan 90 landen mee. Ze lossen lastige wiskundepuzzels op, waarvan sommige alleen uit woorden bestaan, maar veel vereisen het bekijken van diagrammen, vormen en plaatjes om het antwoord te vinden.

Stel je nu voor dat een team onderzoekers van Qualcomm AI Research besloot deze wedstrijd te veranderen in een enorme test voor Kunstmatige Intelligentie. Ze bouwden een nieuwe tool genaamd M3Kang. Denk aan M3Kang als een "universele vertaler en wiskundeleraar" in één dataset.

Hier is de eenvoudige uitsplitsing van wat ze deden en wat ze ontdekten:

1. Het Grote Project: Het Bouwen van de Ultieme Wiskundetest

De onderzoekers namen de originele wiskundeproblemen (die voornamelijk in het Catalaans en Engels waren) en vertaalden deze naar 108 verschillende talen.

  • De Schaal: Ze vertaalden niet alleen de woorden; ze hielden de plaatjes en diagrammen bij de vragen. Dit resulteerde in meer dan 111.000 unieke wiskundeproblemen.
  • Het Doel: Ze wilden zien of AI-modellen (de "hersenen" achter chatbots en beeldgeneratoren) wiskundeproblemen kunnen oplossen in andere talen dan het Engels, en of ze daadwerkelijk diagrammen kunnen "zien" en begrijpen, en niet alleen de tekst kunnen lezen.

2. Hoe Ze Het Bouwden (De Assemblagelijn)

Het maken van een dataset van deze omvang is als het bouwen van een fabriekslijn.

  • Stap 1: Ze namen de originele PDF's van de wiskundewedstrijd en zetten deze om in schone afbeeldingen met tekst.
  • Stap 2: Ze gebruikten AI om de vragen eerst naar het Engels te vertalen, waarbij ze dubbel controleerden of de vertaling de wiskundige logica niet beschadigde.
  • Stap 3: Ze gebruikten een slimme "terugvertalings-truc" om de andere 108 talen te controleren. Stel je voor dat je een zin van het Spaans naar het Engels vertaalt, en die vervolgens direct weer terugvertaalt naar het Spaans. Als het resultaat anders is dan het origineel, is de vertaling slecht. Ze gebruikten deze methode om slechte vertalingen automatisch te filteren.

3. De Resultaten: Hoe Heeft de AI het Gedaan?

Ze testten de slimste beschikbare AI-modellen (zowel gratis/open als dure/gesloten modellen) tegen deze nieuwe test. Hier zijn hun ontdekkingen:

  • Het "Engelse Voordeel" is Echt: Net zoals een student die alleen Engels studeert moeite kan hebben in een Franse klas, waren de AI-modellen veel beter in het oplossen van wiskundeproblemen in het Engels. Naarmate de taal minder voorkomend werd op het internet (zoals Swahili of Maltees), daalde de prestatie van de AI aanzienlijk. Het is alsoverlijk dat de AI de wiskunde vergat zodra de taal veranderde.
  • Grootte Doet Er Toe (Maar Niet Voor Alles): Grotere AI-modellen presteerden over het algemeen beter. Echter, zelfs de grootste, slimste modellen hadden moeite met basislogica en diagrammen.
  • Het "Blinde" Probleen: Dit was de meest verrassende bevinding. Wanneer mensen de test maken, vinden ze de problemen met plaatjes vaak makkelijker dan de problemen met alleen tekst. Maar voor AI is het precies andersom! De AI-modellen presteerden aanzienlijk slechter wanneer er een plaatje bij betrokken was. Het is alsof een student die goed is in tekstproblemen, bevriest zodra hij naar een grafiek moet kijken. De AI lijkt moeite te hebben met het leggen van de connectie tussen de tekst en de afbeelding.
  • AI versus Mensen: Ze vergeleken de AI-scores met de echte scores van 68.000 menselijke studenten.
    • De beste AI (Gemini-2.5-Pro) presteerde als een topstudent in het Engels, maar de prestaties daalden naar "gemiddeld" of "onder gemiddeld" in talen met weinig bronnen.
    • Interessant genoeg werd de AI niet beter naarmate de wiskunde moeilijker werd, op dezelfde manier als mensen dat doen. Soms haalde de AI de moeilijkste problemen perfect, maar faalde het bij de makkelijkste, wat suggereert dat de AI "gokt" of een ander soort redenering gebruikt dan een menselijk kind.

4. Kunnen We Dit Oplossen?

De onderzoekers probeerden een paar "trainings-trucs" om de AI te helpen beter in andere talen te communiceren.

  • De "Vertaler"-truc: Ze ontdekten dat als ze de AI vertelden: "Vertaal deze vraag eerst in je hoofd naar het Engels, los het op, en geef dan het antwoord", de AI veel beter werd in het oplossen van problemen in andere talen. Het is alsoverlijk als het geven van een woordenboek aan een student vlak voor het examen.
  • De "Sturing"-truc: Ze probeerden het interne denkproces van de AI te sturen om meer "Engels-achtig" te zijn, zelfs wanneer de AI in andere talen sprak. Dit hielp een beetje, maar de "Vertaler"-truc was de winnaar.

De Kernboodschap

Het artikel concludeert dat hoewel AI ongelooflijk slim wordt, het nog steeds een grote blinde vlek heeft: het heeft moeite met het combineren van lezen, zien en denken over verschillende talen heen.

De onderzoekers hebben al hun data en code openbaar gemaakt (open-source), zodat andere wetenschappers deze "Kangoeroe-test" kunnen gebruiken om betere, inclusievere AI te bouwen die niet alleen Engels spreekt, maar ook daadwerkelijk wiskunde kan bedrijven in elke taal, met of zonder een plaatje. Ze hopen dat dit helpt om een AI te creëren die echt globaal en eerlijk is voor iedereen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →