← Nieuwste papers
🤖 AI

Process-Verified Reinforcement Learning for Theorem Proving via Lean

Dit artikel introduceert een reinforcement learning-framework dat de Lean proof assistant gebruikt als een symbolische proces-oracle om dichte, fijnmazige en correcte feedback op tactiekniveau te bieden, wat de prestaties van het bewijzen van stellingen op benchmarks zoals MiniF2F en ProofNet aanzienlijk verbetert in vergelijking met traditionele methoden die alleen op uitkomst gebaseerde beloningen gebruiken.

Oorspronkelijke auteurs: Minsu Kim, Se-Young Yun

Gepubliceerd 2026-06-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Minsu Kim, Se-Young Yun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om complexe wiskundige puzzels op te lossen. In het verleden was de manier waarop we deze robots leerden (dit waren Large Language Models) als het spelen van een spelletje "warm of koud" met een zeer strikte scheidsrechter.

De Oude Manier: De "Pass of Fail" Coach
Voorheen schreef de robot een volledige oplossing voor een wiskundig probleem. De scheidsrechter (een computerprogramma genaamd Lean) keek naar het uiteindelijke antwoord en zei alleen één ding: "Je hebt het goed gedaan!" of "Je hebt het fout gedaan."

Als de robot het fout had, wist hij niet waarom. Maakte hij een fout in de allereerste stap? Gebruikte hij in het midden de verkeerde formule? Of was hij gewoon de tijd tekortgekomen? Het was als een leerling die een "onvoldoende" krijgt op een toets zonder de nagekeken versie te zien. De robot moest raden wat er misging en het opnieuw proberen, wat traag en inefficiënt is.

De Nieuwe Manier: De "Stap-voor-stap" Coach
Dit artikel introduceert een slimmere manier om de robot te trainen. In plaats van alleen te wachten op het uiteindelijke antwoord, kijkt de Lean-scheidsrechter naar het denkproces van de robot stap voor stap.

Denk aan een wiskundig bewijs als het bouwen van een toren van blokken.

  • De Oude Manier: Je bouwt de hele toren, en als hij aan het einde omvalt, zegt de coach alleen maar: "Slechte toren." Je moet dan raden welk blokje de instorting heeft veroorzaakt.
  • De Nieuwe Manier (Dit Artikel): De coach kijkt toe terwijl je elk blokje plaatst.
    • Als je een blokje correct plaatst, geeft de coach je een klein complimentje ("Goed gedaan!") (een positief signaal).
    • Als je een blokje incorrect plaatst, zegt de coach onmiddellijk: "Stop! Dat blokje is fout."
    • Cruciaal: De coach legt uit dat omdat dat blokje fout was, elk blokje dat je er bovenop plaatst nu ongeldig is, zelfs als ze op zichzelf prima lijken. Dit wordt "First-Error Propagation" genoemd. Het leert de robot dat één fout de hele fundering verpest.

Hoe het werkt in het artikel
De onderzoekers gebruikten een methode genaamd Reinforcement Learning. Hier is de uitsplitsing van hun "geheime ingrediënt":

  1. De Oracle: Ze gebruikten de Lean-bewijsassistent niet alleen als eindbeoordelaar, maar als een proces-oracle. Dit betekent dat het fungeert als een superleraar die de regels van de logica perfect begrijpt en fouten in realtime kan opsporen.
  2. De Feedbackloop: Wanneer de robot probeert een probleem op te lossen, breekt Lean de oplossing af in een reeks "tactics" (kleine logische stappen).
    • Als het hele bewijs klopt, krijgt de robot een grote beloning.
    • Als het bewijs faalt, vertelt Lean de robot precies welke stap is mislukt. De robot leert dat de stappen vóór de fout oké waren, maar dat de stap bij de fout en alles daarna fout zijn.
  3. Het Creditsysteem: Het artikel vond dat het belangrijkste deel van een stap het allereerste woord (of token) van die stap is. Het is als het "commando-woord" (bijv. "Optellen", "Vermenigvuldigen", "Aannemen"). De onderzoekers besloten de beloning of straf specifiek aan dat eerste woord te geven. Dit hel help de robot om het juiste "commando" voor de taak te kiezen, in plaats van alleen de hele zin uit het hoofd te leren.

De Resultaten
Toen ze deze nieuwe methode testten op beroemde wiskundige benchmarks (MiniF2F en ProofNet):

  • Leerden de robots sneller en maakten ze minder fouten.
  • Werden ze stabieler en betrouwbaarder dan robots die alleen getraind werden met "Pass/Fail"-feedback.
  • Presteerden ze beter dan robots die probeerden andere, minder nauwkeurige methoden te gebruiken om te raden welke stappen goed waren.

Het Grotere Plaatje
De belangrijkste les is dat formele bewijsassistenten (zoals Lean) niet alleen gebruikt moeten worden om antwoorden aan het einde te controleren. Ze kunnen ook gebruikt worden als coaches tijdens het trainingsproces. Door de AI gedetailleerde, specifieke feedback te geven over hoe het denkt, in plaats van alleen over wat het concludeert, kunnen we slimmere, betrouwbaardere AI bouwen voor het oplossen van moeilijke logische problemen.

Wat ze niet hebben gedaan
Dit artikel is zeer specifief over wat zij hebben bereikt. Het claimde niet alle wiskundige problemen op te lossen, noch beweerde het dat deze methode werkt voor het schrijven van verhalen of het chatten met mensen. Het gaat strikt over het leren aan AI om wiskundige stellingen te bewijzen met de taal Lean. Ze merkten ook op dat ze hun methode niet hebben vergeleken met andere "geleerde" coaches, omdat die enorme hoeveelheden door mensen geschreven voorbeelden vereisen die nog niet bestaan voor dit specifieke type wiskunde.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →