← Nieuwste papers
💬 NLP

Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs

Deze paper introduceert ReasoningMath-Plus, een nieuw benchmark met 150 zorgvuldig geselecteerde wiskundige problemen en de HCRS-scoringmethode, om de beperkingen van bestaande evaluaties bloot te leggen en het structurele redeneervermogen van grote taalmodellen nauwkeuriger te beoordelen dan alleen op basis van het eindantwoord.

Oorspronkelijke auteurs: Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang, Yuetian Du, Guojie Lin, Yaxuan Wang, Xiaoxiao Xu, Yanhu Mo, Xuan Ren, Hu Wei, B
Gepubliceerd 2026-02-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang, Yuetian Du, Guojie Lin, Yaxuan Wang, Xiaoxiao Xu, Yanhu Mo, Xuan Ren, Hu Wei, Bing Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep slimme studenten (de AI-modellen) een moeilijke wiskundetoets laat maken. Tot nu toe hebben deze studenten bijna perfect gescoord op de bestaande toetsen. Maar er is een probleem: ze lijken de antwoorden te hebben geleerd uit het hoofd of ze gebruiken slimme trucjes om het antwoord te raden, zonder echt te begrijpen hoe ze er aan komen.

Het is alsof een student de oplossing van een puzzel heeft gezien in een antwoordenboekje, maar als je vraagt "hoe heb je dit opgelost?", hij stamelt en geen logische stappen kan uitleggen.

Dit paper introduceert een nieuw soort "toets" genaamd REASONINGMATH-PLUS om te kijken of deze AI's écht kunnen redeneren of alleen maar goed kunnen gokken.

Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Probleem: De "Gokker" vs. De "Denker"

De huidige toetsen zijn als een meerkeuzetoets waarbij je alleen kijkt of het antwoord op het antwoordblad klopt.

  • De situatie: Veel AI's halen een 9 of 10 op deze toetsen.
  • De valkuil: Soms is het antwoord goed, maar is de weg ernaartoe vol fouten. Het is alsof iemand een raadsel oplost door te gokken, of door een foutieve berekening die per ongeluk het juiste getal oplevert. Dit noemen de auteurs "gelukkige gissingen" (lucky guesses).

2. De Oplossing: De Nieuwe "Werkboek"-Toets

De auteurs hebben 150 nieuwe, zeer slimme wiskundepuzzels bedacht. Deze zijn zo ontworpen dat je niet zomaar een antwoord kunt raden; je moet een logisch verhaal opbouwen.

Maar het echte vernieuwende deel is hoe ze kijken naar het antwoord:

  • Oude methode: Kijk alleen naar het eindresultaat.
  • Nieuwe methode: Kijk naar het werkboek van de student.

Ze hebben voor elke puzzel een "Minimaal Skelet" gemaakt. Denk hierbij aan een recept voor een taart.

  • Het recept (het skelet) zegt: "Je moet eerst deeg maken, dan vulling, dan bakken."
  • Als de AI zegt: "Ik heb de taart gebakken, en hij smaakt goed," maar ze hebben geen deeg gemaakt, dan is het antwoord misschien goed, maar de methode is fout.

3. De Twee Scheidsrechters

Om te beoordelen of de AI goed redeneert, gebruiken ze twee soorten "scheidsrechters":

A. De Strikte Auditor (HCRS)
Stel je een strenge inspecteur voor die het werkboek van de AI controleert.

  • Hij kijkt stap voor stap: "Heb je dit gedaan? Ja. En dit? Nee, dat heb je overgeslagen."
  • De "Vroegfout"-straf: Als de AI in stap 1 een fout maakt, is de hele taak vaak al verloren. Deze inspecteur straft zwaar voor fouten die vroeg in het proces gebeuren. Het is alsof je in een bouwproject de fundering verkeerd legt; het maakt niet uit hoe mooi de dakpannen er later uitzien, het huis valt om.
  • Resultaat: Veel AI's die een hoge score hadden op de oude toetsen, zakken hierdoor flink door. Hun "werkboek" bleek vol gaten te zitten.

B. De Slimme Coach (PRM)
Dit is een AI die is getraind om te kijken of de redenering logisch is, zelfs als ze niet het perfecte "recept" (het skelet) hebben.

  • Ze kijkt: "Klinkt dit logisch? Helpt deze stap bij het oplossen van het probleem?"
  • Dit werkt als een coach die zegt: "Je bent op het goede spoor, maar je hebt een omweg gemaakt."

4. Wat hebben ze ontdekt?

De resultaten waren verrassend en iets verontrustend voor de hype rondom AI:

  • De "Masker"-effect: Veel modellen halen een hoge score op de eindantwoorden (bijvoorbeeld 5,8 op 10), maar als je kijkt naar hoe ze daar kwamen, zakt hun score drastisch (naar gemiddeld 4,4 op 10).
  • Conclusie: De AI's zijn vaak beter in het voorspellen van het juiste antwoord dan in het bouwen van een logisch betoog. Ze zijn slimme gokkers, maar nog geen echte denkers.

Samenvattend: De Metafoor van de Auto

Stel je voor dat je een auto wilt testen.

  • De oude toetsen kijken alleen of de auto van punt A naar punt B komt. De auto rijdt misschien over een afgrond, maar als hij per ongeluk op de andere kant landt, is het een "succes".
  • Deze nieuwe toets kijkt naar de bestuurder. Kijkt hij naar de weg? Houdt hij zich aan de verkeersregels? Als de bestuurder blindelings sturen en per ongeluk aankomt, zeggen ze: "Nee, dat was geen vaardig rijden, dat was geluk."

Kortom: Deze paper waarschuwt ons dat we AI's niet moeten beoordelen op hun eindresultaat alleen. We moeten kijken naar hun "werkboek" om te zien of ze echt begrijpen wat ze doen, of dat ze gewoon slimme gokkers zijn die toevallijk het juiste antwoord vinden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →