← Nieuwste papers
🤖 AI

What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code

Dit artikel daagt het idee uit dat uitvoerbare code inherent het algemeen redeneren verbetert, en toont in plaats daarvan aan dat gestructureerde redeneersignalen binnen gemengde code-tekst- en wiskunde-tekstgegevens, en niet code alleen, verbeteringen in wiskundig redeneren bewerkstelligen terwijl ze een strategie bieden om cross-domein trade-offs te mitigeren.

Oorspronkelijke auteurs: Yuze Zhao, Junpeng Fang, Lu Yu, Zhenya Huang, Kai Zhang, Qing Cui, Qi Liu, Jun Zhou, Enhong Chen

Gepubliceerd 2026-05-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yuze Zhao, Junpeng Fang, Lu Yu, Zhenya Huang, Kai Zhang, Qing Cui, Qi Liu, Jun Zhou, Enhong Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, superintelligente student (een Groot Taalmodel) traint om goed te zijn in alles: verhalen schrijven, wiskundeproblemen oplossen en computercode schrijven. Lange tijd geloofden onderzoekers dat het voeden van deze student met veel computercode gelijkstond aan het geven van een geheime superkracht die hen beter maakte in alles, inclusief wiskunde en logica.

Dit artikel zegt: "Wacht even. Laten we nauwkeuriger kijken."

De onderzoekers bouwden een enorme bibliotheek van 10 biljoen woorden (tokens) en voerden een reeks experimenten uit om precies te zien wat er gebeurt wanneer je de mix van boeken in die bibliotheek verandert. Hier is wat ze ontdekten, eenvoudig uitgelegd:

1. Het "Code"-Misverstand

Het Oude Idee: Mensen dachten: "Als we de student leren code te schrijven, worden ze slimmer in wiskunde en logica omdat code logisch is."
De Nieuwe Bevinding: De onderzoekers ontdekten dat pure code (alleen de uitvoerbare instructies, zonder uitleg) eigenlijk zeer specifiek is. Het is alsof je de student leert om perfect schaken. Het maakt hen tot een schaakgrootmeester, maar het maakt hen niet noodzakelijkerwijs beter in het schrijven van poëzie of het oplossen van algebra.

Sterker nog, toen ze de student dwongen te veel tijd aan pure code te besteden, daalden hun wiskundekunsten daadwerkelijk naar beneden. Het is alsof het brein van de student zo gefocust raakte op schaakregels dat het vergat hoe het lange delingen moest uitvoeren. De code-gegevens "concurreerden" met de wiskunde-gegevens om de aandacht van de student.

2. De Echte Held: "Gestructureerd Redeneren" (Het Steiger)

Dus, als pure code niet de wondermiddel is, wat dan wel? De onderzoekers ontdekten dat de echte magie voortkomt uit gestructureerde redeneersporen.

Denk hierbij aan een steiger die wordt gebruikt door bouwvakkers.

  • Pure Code is gewoon het afgewerkte gebouw.
  • Gestructureerd Redeneren is het steiger, de blauwdrukken en de stap-voor-stap instructies die tonen hoe het gebouwd moet worden.

De onderzoekers ontdekten dat gegevens die stap-voor-stap logica tonen (zoals een wiskundig bewijs dat een probleem opsplitst in kleine, duidelijke stappen, of een codefragment gemengd met een duidelijke uitleg van waarom het werkt), het zijn die het redeneren daadwerkelijk stimuleren.

Ze noemen dit "Cognitief Steigerwerk".

  • Toen ze de student meer van deze "stap-voor-stap" wiskundeproblemen voerden (zelfs als ze hiermee sommige reguliere wiskundeproblemen vervingen), werd de student veel beter in moeilijke wiskundeproblemen.
  • Cruciaal hierbij: dit deed geen afbreuk aan hun programmeervaardigheden. Het was alsof je de student betere studiegidsen gaf zonder hun leerboeken af te pakken.

3. Het "Budget"-Probleem

Stel je voor dat de student een vast aantal uren heeft om te studeren (een "token-budget").

  • Als je die tijd vult met Code, worden ze geweldig in programmeren maar verliezen ze tijd voor Wiskunde en Algemene Kennis.
  • Als je die tijd vult met Wiskunde, worden ze geweldig in Wiskunde maar verliezen ze misschien tijd voor Algemeen Redeneren.
  • De Oplossing: In plaats van gewoon meer "spullen" toe te voegen, ontdekten de onderzoekers dat het veranderen van het type wiskunde dat ze bestudeerden naar een meer "gestructureerde" vorm (meer steigerwerk) de student in staat stelde om beter te worden in moeilijke wiskunde zonder hun programmeervaardigheden op te offeren.

4. Binnenin het Brein: Het "Specialisten"-Team

Het model dat ze gebruikten, is als een team van 64 verschillende specialisten (genaamd "Experts"). Wanneer de student een zin leest, beslist een "router" welke specialist het afhandelt.

  • Toen ze code verwijderden, kregen de specialisten die normaal gesproken code afhandelden geen werk meer, en verschuift de balans van het team.
  • Toen ze het "Cognitieve Steigerwerk" (het gestructureerde redeneren) toevoegden, raakte het team niet in de war. De specialisten bleven hun werk doen, maar de kwaliteit van het redeneren verbeterde. Dit bewijst dat gestructureerde gegevens het hele team helpen om beter samen te werken zonder chaos te veroorzaken.

De Conclusie

Het artikel concludeert dat code zelf niet het magische ingrediënt is dat AI slimmer maakt in redeneren. In plaats daarvan komt de magie voort uit gestructureerde, stap-voor-stap denkpatronen (zoals die te vinden zijn in goede wiskundebewijzen of goed uitgelegde code).

Als je wilt dat een AI een betere denker wordt, gooi dan niet zomaar meer ruwe code naar het toe. Geef het in plaats daarvan meer "steigerwerk" – gegevens die duidelijk de logische stappen tonen van hoe je een probleem oplost. Dit helpt de AI om moeilijke wiskundeproblemen aan te pakken zonder zijn vermogen om code te schrijven te verliezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →