← Nieuwste papers
💬 NLP

U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs

Dit artikel introduceert U-MATH, een nieuwe benchmark van 1.100 open vragen op universitair niveau die zes kernvakken beslaat met 20% multimodale inhoud, samen met de μ\mu-MATH-dataset voor het evalueren van oplossingsoordelen, om significante beperkingen in de multimodale redenering en het vermogen van huidige LLM's om wiskundige oplossingen accuraat te beoordelen, te onthullen.

Oorspronkelijke auteurs: Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

Gepubliceerd 2026-02-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een docent bent die een stapel wiskunde-huiswerk van een universiteitsklas probeert te nakijken. Een lange tijd waren de "toetsen" die je gebrued om je studenten (AI-modellen) te beoordelen, als eenvoudige quizzen op de basisschool: simpele meerkeuzevragen die de slimste kinderen gemakkelijk konden beantwoorden. Maar nu zijn de studenten (AI) zo goed geworden in die eenvoudige toetsen dat de toetsen niet langer vertellen wie echt briljant is en wie gewoon aan het gokken is.

Het papier dat je deelde introduceert U-MATH en µ-MATH, wat als een gloednieuwe, veel moeilijkere eindexamen is ontworpen, specif으로 voor universitair niveau wiskunde, samen met een speciale "docentenhandleiding" om de antwoorden eerlijk te beoordelen.

Hier is de uitsplitsing van wat ze hebben gedaan, met behulp van eenvoudige analogieën:

1. Het Nieuwe Examen: U-MATH

Het Probleem: Eerdere tests waren te makkelijk of te beperkt. Ze besloegen voornamelijk onderwerpen uit de middelbare school of waren slechts meerkeuzevragen waarbij de AI het juiste antwoord kon raden zonder de wiskunde daadwerkelijk te doen. Ook bevatten ze zelden afbeeldingen of grafieken, terwijl echte wiskunde dat wel doet.

De Oplossing: De auteurs hebben U-MATH gecreëerd, een collectie van 1.100 gloednieuwe, ongepubliceerde problemen rechtstreeks afkomstig van echte universitaire cursussen in de VS.

  • De Moeilijkheidsgraad: Dit zijn geen simpele quizzen. Het zijn open vragen, wat betekent dat de AI de volledige oplossing moet uitschrijven, in plaats van alleen maar "A, B, C of D" te kiezen.
  • De Visuele Aspecten: Ongeveer 20% van deze problemen bevat afbeeldingen, zoals grafieken, geometrische vormen of datatabellen. Dit is alsof je de AI vraagt een wiskundig probleem op te lossen terwijl hij naar een blauwdruk kijkt, in plaats van alleen een zin te lezen.
  • De Onderwerpen: Het beslaat zes kernonderwerpen van de universiteit, van Algebra tot Calculus.

De Resultaten: Toen ze de slimste AI-modellen op deze nieuwe toets testten:

  • Alleen tekst: De AI deed het vrij goed op problemen met alleen woorden (met ongeveer 93% correct).
  • Visueel: Wanneer er afbeeldingen bij betrokken waren, had de AI aanzienlijke moeite en zakte de score naar ongeveer 58% correct. Het is alsoं dat de AI een recept perfect kan lezen, maar in de war raakt wanneer hij naar een foto van de ingrediënten moet kijken om te achterhalen wat hij moet koken.

2. De Docentenhandleiding: µ-MATH

Het Probleem: Hoe beoordeel je deze open vragen? Als een student x/2 schrijft en het antwoord is 0.5x, is dat dan goed? Als de AI die het huiswerk nakijkt een fout maakt, hoe weten we dat dan? Meestal vertrouwen we erop dat de AI zichzelf beoordeelt, maar het papier laat zien dat AI-"beoordelaars" vaak bevooroordeeld of inconsistent zijn.

De Oplossing: Ze hebben µ-MATH (uitgesproken als "mu-math") gecreëerd. Zie dit als een meta-examen voor de docenten.

  • Ze namen enkele van de U-MATH-problemen en lieten vier verschillende top AI-modellen antwoorden genereren (sommige correct, sommige foutief).
  • Daarna vroegen ze andere AI-modellen om als "beoordelaars" op te treden en die antwoorden te nakijken.
  • Cruciaal was dat menselijke experts de juiste antwoorden verifieerden, zodat ze precies wisten wie er wel en wie er niet gelijk had. Dit maakte het mogelijk om te testen hoe goed de "beoordelende" AI's eigenlijk waren.

De Resultaten:

  • Nakijken is moeilijk: Zelfs de beste AI-beoordelaars kregen ongeveer 90% van de beoordelingen goed. Ze zijn niet perfect.
  • Een goede student zijn maakt je niet automatisch een goede docent: Sommige AI-modellen waren geweldig in het oplossen van de wiskundeproblemen, maar verschrikkelijk in het beoordelen ervan. Anderen waren precies het tegenovergestelde.
  • Bias: De beoordelaars hadden "favorieten". Bijvoorbeeld, sommige beoordelaars waren te streng voor antwoorden van bepaalde AI-modellen en te mild voor anderen, ongeacht of de wiskunde daadwerkelijk correct was.

3. Belangrijkste Conclusies

  • De "Visuele Kloof": AI is nog steeds erg slecht in het combineren van wiskunde met afbeeldingen. Het is alsof je een student hebt die mentale wiskunde in zijn hoofd kan doen, maar bevriest zodra hij een diagram ziet.
  • Specialisatie doet ertoe: Kleinere AI-modellen die specifiek op wiskunde zijn getraind (zoals een gespecialiseerde tutor), versloegen vaak enorme, algemene modellen op deze moeilijke problemen.
  • Het "Beoordelaarsprobleem": We kunnen niet simpelweg vertrouwen op AI om AI te beoordelen. Het papier laat zien dat het beoordelen van wiskunde een totaal andere vaardigheid is dan het oplossen ervan, en dat huidige AI-beoordelaars nog steeds vatbaar zijn voor fouten en visie vertonen.

Samenvatting

De auteurs hebben een wiskunde-examen op universitair niveau (U-MATH) gebouwd om te zien hoe slim AI echt is, en een beoordelingstest (µ-MATH) om te zien hoe eerlijk AI-beoordelaars zijn. Ze kwamen tot de conclusie dat hoewel AI erg goed wordt in tekstgebaseerde wiskunde, het nog steeds worstelt met visuele wiskunde, en nog niet betrouwbaar genoeg is om als een perfecte docent te worden vertrouwd om het eigen werk na te kijken. Ze hebben al deze gegevens gratis beschikbaar gesteld zodat onderzoekers betere, eerlijkere AI kunnen bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →