MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese
Dit artikel introduceert Math-PT, een nieuw benchmarkdataset van 1.729 wiskundige problemen in Europees en Braziliaans Portugees, afkomstig uit inheemse wedstrijden en examens, waaruit blijkt dat hoewel state-of-the-art LLM's goed presteren op meerkeuzevragen, hun vaardigheden achteruitgaan op visuele en open vragen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat Large Language Models (LLM's) als briljante studenten zijn die bijna elk boek in de wereldbibliotheek hebben gelezen. Jarenlang hebben we hun wiskundekunsten getest met examens die volledig in het Engels waren geschreven. Het is alsof je een student een rijtest geeft die alleen in het Engels is, en vervolgens ervan uitgaat dat ze perfect kunnen rijden in elke taal, alleen omdat ze die ene test hebben gehaald.
Het artikel MATH-PT stelt dat deze aanpak een enorm blinde vlek heeft. Het introduceert een nieuwe "rijtest" die specifiek in het Portugees is geschreven (zowel de Europese als de Braziliaanse varianten) om te zien of deze AI-studenten wiskunde daadwerkelijk kunnen hanteren wanneer de taal verandert.
Hier is de uiteenzetting van hun bevindingen met behulp van eenvoudige analogieën:
1. Het Probleem: De "Enkel-Engelse" Bibliotheek
De meeste wiskundebenchmarks (zoals MATH of MathVista) zijn als een bibliotheek waar elk boek in het Engels staat. Zelfs wanneer onderzoekers proberen andere talen te testen, vertalen ze gewoon de Engelse boeken. De auteurs zeggen dat dit onrechtvaardig is, omdat het ons niet vertelt of de AI wiskundige concepten werkelijk begrijpt of dat het alleen Engelse patronen heeft gememoriseerd. Ze wilden een bibliotheek bouwen van wiskundeproblemen die in het Portugees waren geboren, afkomstig uit echte Portugese en Braziliaanse wiskundeolympiades en schoolexamens.
2. De Nieuwe Test: MATH-PT
Het team creëerde een dataset genaamd MATH-PT met 1.729 problemen.
- De Bron: Ze vertaalden niet zomaar; ze graven in de originele archieven van wedstrijden zoals de Olimpíadas Portuguesas da Matemática en Braziliës OBMEP.
- De Variatie: De test omvat alles van puzzels voor de vijfde klas tot uitdagingen op pre-universitair niveau.
- Het Formaat: Het bevat meerkeuzevragen (zoals een invulblad) en open vragen (waarbij je het antwoord zelf moet opschrijven). Cruciaal: veel vragen bevatten diagrammen en figuren (zoals meetkundige vormen), die het team zorgvuldig met code heeft behouden zodat de AI ze kon "zien".
3. De Resultaten: De "Slimme" versus de "Struikelende"
Ze testten 13 verschillende AI-modellen, variërend van de krachtigste "frontier"-modellen (de supergenieën) tot kleinere, open-source modellen (de gemiddelde studenten).
- Het Meerkeuze-voordeel: Denk aan meerkeuzevragen als een spel "Vind het Verschil". De AI-modellen waren hier zeer goed in. Zelfs de kleinere modellen konden vaak de juiste letter (A, B, C, D of E) correct raden.
- De Strijd bij Open Vragen: Toen de test overschakelde naar open vragen (waarbij de AI het antwoord zelf moet genereren), daalden de scores aanzienlijk. Het is het verschil tussen een gezicht herkennen in een rij versus dat gezicht uit het geheugen tekenen. De AI had meer moeite wanneer het zelf moest "denken" en het antwoord moest opschrijven in plaats van er gewoon één uit te kiezen.
- Het "Afbeeldings"-Probleem: Dit was het grootste struikelblok. Wanneer een vraag een diagram (een afbeelding) bevatte, zakte de prestatie van de AI dramatisch in. Zelfs de slimste modellen raakten in de war wanneer ze een visuele vorm moesten interpreteren naast de tekst. Het is alsof je een student vraagt een meetkundig probleem op te lossen terwijl ze een blinddoek dragen; ze kunnen de woorden lezen, maar ze kunnen de vorm niet "zien".
4. De Winnaars en Verliezers
- De Kampioenen: De "frontier"-modellen (zoals GPT-5 en Qwen3-235B) waren de duidelijke winnaars. Ze deden het goed met Portugese wiskunde, vooral bij meerkeuzevragen.
- De Struikelaars: De kleinere, open-source modellen (zoals Llama-3 en Gemma-3) vonden de wiskunde veel moeilijker. Hun nauwkeurigheid daalde scherp naarmate de vragen moeilijker werden of afbeeldingen bevatten.
- Het Schaal-effect: Het artikel vond dat voor de Qwen-familie van modellen, het groter maken van het model (meer "hersencapaciteit" toevoegen) veel hielp. Het is alsof je upgradet van een fiets naar een sportauto; de grotere modellen deden het veel beter bij complexe redeneertaken dan de kleinere.
De Conclusie
Het artikel concludeert dat AI, hoewel het steeds beter wordt in wiskunde, nog steeds een "taalkanttekening" heeft en moeite heeft wanneer de test moeilijker wordt (open vragen) of visueel is (diagrammen). Door deze Portugese dataset vrij te geven, geven de auteurs onderzoekers een nieuwe, eerlijker liniaal om te meten hoe goed AI eigenlijk kan denken in talen anders dan het Engels. Ze zeggen niet dat AI nog perfect is; ze zeggen: "Hier is een nieuwe test om ons precies te laten zien waar de AI nog steeds leert."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.