← Nieuwste papers
💬 NLP

Teaching Language Models to Think in Code

Het artikel introduceert ThinC, een raamwerk dat redeneren van taalmodellen verschuift van verweven natuurlijke taal en code naar een code-gecentreerd paradigma waarbij code zelf fungeert als de primaire redenaar, en dat state-of-the-art prestaties bereikt op wiskundebenchmarks van competitieniveau door code-trajecten te distilleren en toezichtgeleide fijne afstemming gevolgd door versterkingsleer toe te passen.

Oorspronkelijke auteurs: Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

Gepubliceerd 2026-05-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een heel lastig wiskundepuzzel op te lossen. Je hebt twee manieren om dit te doen:

  1. De Oude Manier (Interleaved Reasoning): Je praat met jezelf in het Engels en bedacht de stappen. "Oké, eerst moet ik 500 vermenigvuldigen met 0,12..." Dan word je een beetje onzeker, dus vraag je een rekenmachine (de code-tool) om je werk te controleren. Maar hier zit de adder onder het gras: als je een fout hebt gemaakt in je Engelse gedachten (bijvoorbeeld door te zeggen dat 500 keer 0,12 gelijk is aan 50 in plaats van 60), typ je die verkeerde getal per ongeluk in de rekenmachine. De rekenmachine doet gewoon wat je zegt; hij weet niet dat je een fout hebt gemaakt. Hij rekent op basis van jouw verkeerde getal, en je krijgt een verkeerd antwoord.
  2. De Nieuwe Manier (THINC): Je neemt een klein moment om je strategie in het Engels te plannen ("Ik moet het oppervlak van deze vorm vinden"), en geef je vervolgens direct de hele taak over aan een robotprogrammeur. De robot schrijft code, voert het uit, ziet het resultaat, schrijft meer code op basis van dat resultaat, en gaat zo door totdat het antwoord naar voren komt. Je doet geen wiskunde in je hoofd of in Engelse zinnen; de robot doet alle het zware werk.

Dit artikel introduceert THINC (Thinking in Code), een nieuwe manier om AI-modellen wiskundeproblemen te leren oplossen door de code zelf de denker te laten zijn, in plaats van slechts een hulpmiddel dat de AI gebruikt om zijn werk te controleren.

Het Probleem met de Oude Manier

De auteurs zeggen dat huidige AI-modellen die Engels denken combineren met code (Tool-Integrated Reasoning genoemd) drie hoofdfouten hebben, die ze "structurele beperkingen" noemen:

  • De "Post-Hoc" Verificatie: De AI schrijft vaak eerst de hele oplossing in het Engels uit, en voert code pas uit om te zeggen: "Ja, dat klopt." De code doet eigenlijk niet het denken; het is slechts een stempel van goedkeuring aan het einde.
  • De "Stille Fout": Als de AI een rekenfout maakt in zijn Engelse gedachten (bijvoorbeeld 12% van 500 berekenen als 50 in plaats van 60), kopieert hij dat verkeerde getal misschien naar de code. De code rekent dan met het verkeerde getal, en de AI merkt het nooit. De fout is "stil" omdat de code gewoon de bevelen opvolgt.
  • De "Dubbele Werk": De AI schrijft vaak een lange Engelse uitleg over hoe het probleem opgelost moet worden, en schrijft dan code die exact hetzelfde doet. Het is alsof je een recept in het Engels schrijft en vervolgens precies hetzelfde recept in het Frans schrijft, alleen om te bewijzen dat je weet hoe je moet koken. Het is overbodig en verwarrend.

De THINC Oplossing

THINC verandert de regels van het spel. In plaats dat de AI over de wiskunde praat, praat de AI in de wiskunde (via code).

  • Het Plan: De AI begint met één korte Engelse zin om de strategie vast te stellen (bijvoorbeeld: "Ik zal door getallen heen lopen om het antwoord te vinden").
  • Het Werk: Na die ene zin gebeurt alles in code-blokken. De AI schrijft een stukje code, voert het uit, ziet de output, en schrijft dan het volgende stukje code op basis van die output.
  • Het Resultaat: Het eindantwoord komt rechtstreeks van de rekenmachine van de computer (de interpreter), niet van de AI die in het Engels gokt.

Hoe Ze de AI Leren

De onderzoekers vertelden de AI niet alleen om dit te doen; ze leerden het via een drie-stappenproces:

  1. Distillatie (De Leraar): Ze namen een zeer slim, groot AI-model en vroegen het om wiskundeproblemen op te lossen met deze nieuwe "Code-First" stijl. Ze verzamelden 12.200 voorbeelden van deze perfecte "Code-First" oplossingen.
  2. Supervised Fine-Tuning (De Leerling): Ze leerden twee kleinere AI-modellen (een met 1,7 miljard "hersencellen" en een met 4 miljard) om deze voorbeelden na te bootsen. Dit leerde de modellen de gewoonte om in code te denken.
  3. Versterkend Leren (De Coach): Ze lieten de modellen oefenen op duizenden wiskundeproblemen. Als het model het juiste antwoord kreeg, kreeg het een "beloning". Als het faalde, leerde het om een andere code-strategie te proberen. Dit maakte de modellen veel slimmer en betrouwbaarder.

De Resultaten: Kleine Modellen, Grote Overwinningen

Het artikel testte deze nieuwe modellen op zeer moeilijke, wedstrijdniveau wiskundewedstrijden (zoals AIME en HMMT).

  • De Reuzen Verslaan: Het kleine 4-miljard-parameter THINC-model scoorde gemiddeld 78,1%. Dit is beter dan het 1,7B-model, beter dan andere "Tool-Integrated" modellen, en zelfs beter dan een enorm 235-miljard-parameter model dat alleen in het Engels denkt!
  • Betrouwbaarheid: In 99,2% van de gevallen werd het eindantwoord rechtstreeks uit de code-output van de computer gehaald. De AI gokte niet; het rekende.
  • Terugkomen: Als de code een fout maakte en crashte (een error), was het THINC-model verrassend goed in het oplossen ervan in het volgende code-blok zonder dat het zijn weg eruit hoefde te "praten". Andere modellen die Engels en code mengen, hebben de neiging in elkaar te storten wanneer ze een code-fout tegenkomen.

De Conclusie

Het artikel beweert dat door de AI te dwingen te stoppen met "praten" over de wiskunde en te beginnen met het "doen" van de wiskunde in code, de modellen nauwkeuriger worden, minder domme rekenfouten maken en moeilijke problemen efficiënter oplossen. Het is alsof je overschakelt van een mens die probeert een staartdeling in zijn hoofd te doen naar een mens die weet hoe hij een rekenmachine moet programmeren om het voor hem te doen, stap voor stap, zonder ooit een mentale rekenfout te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →