← Nieuwste papers
💬 NLP

OProver: A Unified Framework for Agentic Formal Theorem Proving

OProver is een geïntegreerd raamwerk voor agentisch formeel stellingenbewijzen in Lean 4 dat iteratieve bewijsrevisie combineert met compilerfeedback en zoekopdrachten, en dat via een innovatief trainingsproces dat voortgaande voortraining, supervisiegericht fijnafstemmen op hersteltrajecten en versterkingsleren op moeilijke gevallen omvat, state-of-the-art prestaties bereikt op meerdere benchmarks.

Oorspronkelijke auteurs: David Ma, Kaijing Ma, Shawn Guo, Yunfeng Shi, Enduo Zhao, Jiajun Shi, Zhaoxiang Zhang, Gavin Cheung, Jiaheng Liu, Zili Wang

Gepubliceerd 2026-05-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: David Ma, Kaijing Ma, Shawn Guo, Yunfeng Shi, Enduo Zhao, Jiajun Shi, Zhaoxiang Zhang, Gavin Cheung, Jiaheng Liu, Zili Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een zeer moeilijk wiskundepuzzel op te lossen, maar je moet de oplossing schrijven in een strenge, robotachtige taal genaamd Lean 4. Als je zelfs maar één kleine typefout of logische fout maakt, verwerpt de computer (de "compiler") het hele ding en zegt: "Nee, fout."

Lange tijd werkten AI-modellen die deze puzzels probeerden op te lossen als een student die een toets maakt: ze gokten een antwoord, en als het verkeerd was, gokten ze gewoon opnieuw vanaf nul. Ze leerden niet echt waarom ze fout zaten, en ze gebruikten de specifieke feedback van de computer niet om hun fouten te herstellen.

OProver is een nieuw systeem dat het spel verandert. In plaats van alleen maar te gokken, gedraagt het zich als een perfectie-jager die nooit opgeeft. Hier is hoe het werkt, met eenvoudige analogieën:

1. De "Agentische" Detective (De Bewijzer)

Zie OProver niet als een statisch handboek, maar als een detective met een meerstaps onderzoeksproces.

  • De Oude Manier: De detective schrijft een theorie, de rechter (de computer) zegt "Fout", en de detective schrijft een volledig nieuwe theorie vanaf nul.
  • De OProver Manier: De detective schrijft een theorie. De rechter zegt: "Je hebt hier een fout gemaakt: je hebt het verkeerde type getal gebruikt." De detective bewerkt dan dat specifieke deel van de theorie, controleert het opnieuw, en blijft verfijnen tot de rechter zegt: "Correct!"

OProver is getraind om deze "bewerken en verfijnen"-dans automatisch uit te voeren. Het gokt niet zomaar; het leert om te luisteren naar de specifieke klachten van de rechter en deze op te lossen.

2. De "Bibliotheek van Oplossingen" (Retrieval)

Voordat de detective begint met schrijven, werkt hij niet in een vacuüm. Hij gaat naar een enorme bibliotheek (genaamd het Retrieval-geheugen).

  • Als de detective probeert een puzzel over driehoeken op te lossen, haalt de bibliotheek direct de top 5 beste bewijzen over driehoeken op die andere detectives eerder succesvol hebben opgelost.
  • OProver leest deze "spiekbriefjes" om te zien hoe andere mensen vergelijkbare problemen hebben opgelost, en gebruikt hun strategieën als leidraad. Dit helpt de detective om veelvoorkomende valkuilen te vermijden.

3. De "Zelfverbeterende Lus" (De Training)

Dit is het meest magische deel. Meestal worden AI-modellen getraind op een vaste set data en daarna aan hun lot overgelaten. OProver is anders; het heeft een zelfverbeterende cyclus.

  • Stap 1: OProver probeert een hoop puzzels op te lossen.
  • Stap 2: Als het slaagt, slaat het die oplossing op in de bibliotheek zodat het kan worden gebruikt als een "spiekbriefje" voor toekomstige problemen.
  • Stap 3: Als het faalt, slaat het het hele verhaal op van hoe het faalde, wat de computer zei, en hoe het het uiteindelijk heeft opgelost.
  • Stap 4: Het systeem gebruikt deze "verhaaltjes van falen" om zichzelf te leren hoe het de volgende keer beter kan doen.

Het is als een student die na elke toets niet alleen de juiste antwoorden uit het hoofd leert, maar ook precies opschrijft waarom hij vragen fout had, en die notities toevoegt aan zijn studiegids. Na verloop van tijd wordt de student slimmer, en wordt de studiegids dikker en nuttiger.

4. Het Resultaat: Een Superstudent

Het artikel testte dit systeem op vijf verschillende "wiskundeolympiades" (variërend van middelbareschoolniveau tot zeer moeilijke universitaire wedstrijden).

  • De Prestatie: OProver (specifiek de versie met 32 miljard parameters) werd de beste presteerder onder alle open-source AI-bewijzers. Het loste meer problemen correct op dan enig ander vergelijkbaar systeem, zelfs beter dan veel grotere modellen.
  • Waarom het belangrijk is: Het bewees dat het de AI de mogelijkheid geven om te luisteren naar feedback, naar eerdere oplossingen te kijken en zijn eigen werk iteratief te herstellen veel krachtiger is dan het gewoon groter maken of slimmer maken in het gokken.

Samenvattend

OProver is een AI voor het oplossen van wiskundepuzzels die niet alleen "gokt en controleert". Het is een collaboratieve leerder die:

  1. Eerst opzoekt naar vergelijkbare opgeloste problemen.
  2. Een bewijs schrijft.
  3. Luistert naar de specifieke foutmeldingen van de computer.
  4. Zijn werk bewerkt om die fouten te herstellen.
  5. Herhaalt tot het slaagt, en slaat dan de les op voor de volgende keer.

Door "falen" om te zetten in een leermogelijkheid en een lopend logboek bij te houden van wat werkt, is OProver uitgegroeid tot de beste open-source AI voor het formeel bewijzen van wiskundestellingen vandaag.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →