MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation
Dit artikel introduceert MGSM-Pro, een meertalige uitbreiding van de GSM-Symbolic-benchmark die de robuustheid van wiskundig redeneren evalueert over negen talen door meerdere instantiaties met variërende cijfers te genereren, waarbij aanzienlijke prestatiedalingen in talen met beperkte middelen en variërende modelweerstand tegen dergelijke verstoringen aan het licht komen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een leraar bent die een wiskundetoets geeft aan een klas studenten uit verschillende landen. Je wilt zien wie echt goed is in wiskunde en wie alleen de antwoorden uit een oefenboek heeft geleerd.
Dit artikel introduceert een nieuwe, strengere manier om Large Language Models (AI) te testen op wiskundeproblemen, genaamd MGSM-Pro. Hier is het verhaal van wat ze ontdekten, eenvoudig uitgelegd.
Het Probleem: De "Oefenboek"-Valstrik
Al geruime tijd worden AI-modellen beter in het oplossen van wiskundetoepassingsproblemen. Maar onderzoekers merkten iets verdachts op: de AI denkt misschien niet echt na over de wiskunde. In plaats daarvan zou het specifieke details uit de toetsvragen die het tijdens de training zag, kunnen hebben onthouden.
Denk eraan als een student die het antwoord op een specifiek toepassingsprobleem heeft geleerd: "Als John 5 appels heeft en er 3 bij koopt..." De student weet dat het antwoord 8 is. Maar als je de vraag verandert in "Als Sarah 5 sinaasappels heeft en er 3 bij koopt...", kan de student die alleen het eerste heeft onthouden, in de war raken.
Onlangs ontdekten onderzoekers dat zelfs in het Engels, als je de namen of getallen in een wiskundeprobleem lichtjes verandert, veel AI-modellen falen. Ze realiseerden zich dat de oude tests te makkelijk waren omdat ze niet controleerden of de AI met deze kleine veranderingen om kon gaan.
De Oplossing: MGSM-Pro (De "Shuffle"-test)
De auteurs creëerden een nieuwe dataset genaamd MGSM-Pro. Ze namen 250 wiskundeproblemen en maakten er 1.240 problemen van (5 versies van elk).
Ze deden dit door het deck te schudden:
- Namen veranderen: "John" vervangen door "Zainabu" of "Carla".
- Getallen veranderen: "5 appels" vervangen door "7 appels".
- Aandacht afleiden: Een zin toevoegen die belangrijk klinkt maar eigenlijk nonsens is (zoals "De lucht is blauw, dus John kocht 5 appels").
Ze deden dit in negen verschillende talen, variërend van veelgesproken talen zoals Engels en Chinees tot talen met minder digitale bronnen zoals Swahili, Yoruba en Igbo.
De Grote Ontdekking: De Strijd van "Low-Resource"-talen
Toen ze de tests uitvoerden, vonden ze een enorme kloof tussen "High-Resource"-talen (zoals Engels) en "Low-Resource"-talen (zoals Twi of Igbo).
- De High-Resource-studenten: Toen je de namen of getallen in het Engels of Chinees veranderde, daalden de AI-modellen iets in score, maar bleven ze grotendeels op koers. Ze waren als een student die het wiskundec concept daadwerkelijk begreep.
- De Low-Resource-studenten: Toen ze dezelfde shuffle uitvoerden voor talen zoals Twi of Igbo, crashten de AI-modellen. Hun scores stortten in. Het was alsof de student plotseling vergeten was hoe je moet tellen omdat de leraar een andere naam voor het fruit gebruikte.
De Analogie: Stel je een student voor die geweldig is in wiskunde in het Engels, maar vreselijk in wiskunde in hun moedertaal. Als de leraar een vraag stelt in het Engels met een draai, lost de student het op. Maar als de leraar exact dezelfde gedraaide vraag stelt in de moedertaal van de student, bevriest de student. Het artikel vond dat AI-modellen hetzelfde doen: ze zijn veel minder "robuust" (betrouwbaar) in talen waarvoor ze minder data hebben gezien.
Wie slaagde en wie zakte?
Het artikel testte veel verschillende AI-modellen (sommige gemaakt door grote technologiebedrijven, sommige open-source).
- De Robuuste: Nieuwere, slimmere modellen zoals Gemini 3.0 Pro en GPT-OSS 120B hanteerden de veranderingen goed. Ze raakten niet in paniek toen de getallen of namen veranderden.
- De Fragiele: Oudere modellen of kleinere modellen (zoals Gemma 3 4B of Llama 3) vielen uit elkaar. Ze konden de "draai" niet aan.
- De Grootte-mythe: Je zou denken dat een groter brein (meer parameters) altijd een slimmere student betekent. Het artikel vond dat dit niet waar is. Soms faalde een enorm model jammerlijk, terwijl een iets kleiner model slaagde. Het gaat niet alleen om grootte; het gaat om hoe het model is getraind.
De Les: Test niet slechts één keer
De belangrijkste les gaat over hoe we AI in de toekomst moeten testen.
Momenteel testen veel leaderboards (ranglijsten van de beste AI) een model op slechts één versie van een probleem. De auteurs zeggen dat dit is alsof je een student één oefenvraag geeft en hen een genie noemt als ze het goed hebben.
Hun Aanbeveling: Om echt te weten of een AI goed is in wiskunde, moet je het testen op minstens vijf verschillende versies van hetzelfde probleem (door de namen en getallen te veranderen). Als de AI alle vijf goed heeft, dan is het echt slim. Als het alleen het eerste goed heeft, is het gewoon aan het memoriseren.
Samenvatting
Het artikel betoogt dat we moeten stoppen met AI perfect te behandelen alleen omdat het de makkelijke tests haalt. Door de namen en getallen in wiskundeproblemen te schudden in verschillende talen, toonden ze aan dat:
- AI veel zwakker is in talen met minder digitale data.
- Veel huidige ranglijsten misleidend zijn omdat ze niet testen op deze "shuffle".
- Om een echt beeld te krijgen van de wiskundevaardigheden van een AI, we het moeten testen op meerdere variaties van hetzelfde probleem, niet slechts één.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.