← Nieuwste papers
🤖 AI

LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks

Het artikel introduceert LEAP, een agentisch framework dat algemene grote taalmodellen in staat stelt om state-of-the-art prestaties te behalen in formeel bewijzen door informele redenering te overbruggen met Lean-compilerfeedback, waarbij het succesvol alle 12 problemen van de Putnam Competition 2025 heeft opgelost en gespecialiseerde systemen aanzienlijk heeft overtroffen op de nieuw voorgestelde Lean-IMO-Bench.

Oorspronkelijke auteurs: Po-Nien Kung, Linfeng Song, Dawsen Hwang, Jinsung Yoon, Chun-Liang Li, Simone Severini, Mirek Olšák, Edward Lockhart, Quoc V Le, Burak Gokturk, Thang Luong, Tomas Pfister, Nanyun Peng

Gepubliceerd 2026-06-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Po-Nien Kung, Linfeng Song, Dawsen Hwang, Jinsung Yoon, Chun-Liang Li, Simone Severini, Mirek Olšák, Edward Lockhart, Quoc V Le, Burak Gokturk, Thang Luong, Tomas Pfister, Nanyun Peng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, wereldberoemde wiskundige hebt die complexe ideeën in begrijpelijke taal kan uitleggen, een geweldig verhaal kan vertellen en moeilijke puzzels kan oplossen. Echter, deze wiskundige is verschrikkelijk in het schrijven van code. Als je hem vraagt een programma te schrijven om een wiskundig probleem op te lossen, schrijft hij misschien iets dat klinkt als het juiste antwoord, maar dat direct crasht zodra je het probeert uit te voeren.

Dit is de huidige staat van Large Language Models (LLM's) in de wiskunde. Ze zijn geweldig in "informele" wiskunde (erover praten), maar worstelen met "formele" wiskunde (het schrijven in een strikte, door computers controleerbare taal zoals Lean, waar één enkele typefout de hele bewijsvoering breekt).

Het paper introduceert LEAP (LLM-in-Lean Environment Agentic Prover), een nieuw systeem dat fungeert als een zeer georganiseerde projectmanager om deze briljante wiskundige eindelijk perfecte code te laten schrijven.

Hier is hoe LEAP werkt, met behulp van eenvoudige analogieën:

1. Het Probleem: De "One-Shot" Valstrik

Voorheen, als je een AI vroeg om een stelling te bewijzen, probeerde het de volledige oplossing in één keer te schrijven, zoals een student die probeert een proefschrift van 50 pagina's in één enkele ademteug te schrijven. Als ze een fout maakten op pagina 3, faalde het geheel. Het paper noemt dit "one-shot formalization", en het werkt zelden voor moeilijke problemen.

2. De Oplossing: De "Blauwdruk" Aanpak

LEAP verandert het spel door het proces op te splitsen, vergelijkbaar met het bouwen van een wolkenkrabber:

  • Stap 1: De Schets van de Architect (De Blauwdruk): In plaats van te proberen het hele gebouw in één keer te bouien, vraagt LEAP de AI eerst om een "blauwdruk" te tekenen. Dit is een hoogwaardig plan geschreven in gewone mensentaal. Het zegt: "Om dit op te lossen, moeten we eerst Lemma A bewijzen, dan Lemma B, en ze vervolgens combineren."
  • Stap 2: De Bouwploeg (Het Formele Bewijs): Zodra de blauwdruk is goedgekeurd, probeert de AI de eigenlijke Lean-code voor slechts één klein deel van het plan te schrijven.
  • Stap 3: De Inspecteur (De Compiler): De Lean-compiler fungeert als een strikte bouwinspecteur. Het controleert de code. Als het perfect is, geweldig! Als er een fout is, stuurt het een specifieke melding terug: "De fundering is hier gebarsten."
  • Stap 4: De Reparateur (Zelfverfijning): De AI leest de opmerking van de inspecteur, herstelt de specifieke fout en probeert het opnieuw. Het begint niet opnieuw; het fixt alleen het gat.

3. Het Geheime Ingrediënt: De "Geheugenkaart" (DAG)

Het meest slimme deel van LEAP is hoe het onthoudt wat het heeft gedaan. Stel je voor dat je een enorme doolhof oplost.

  • De Oude Manier: Als je tegen een doodlopende weg aanloopt, vergeet je misschien waar je vandaan kwam en loop je cirkels, waardoor je tijd verspilt.
  • De Manier van LEAP: LEAP tekent een kaart (een Directed Acyclic Graph, of DAG) van het hele doolhof.
    • Als het een kleine puzzel (een "lemma") oplost in een andere tak van het doolhof, schrijft het dit op de kaart.
    • Als het later in een andere tak met dezelfde puzzel wordt geconfronteerd, lost het deze niet opnieuw op. Het kijkt gewoon op de kaart, ziet dat de oplossing er al is, en gebruikt deze.
    • Dit voorkomt dat de AI energie verspilt aan het opnieuw uitvinden van het wiel en stelt het in staat om enorme, complexe problemen aan te pakken die anders eeuwig zouden duren.

4. De Resultaten: Van Nul naar Held

Het paper testte dit systeem op enkele van de moeilijkste wiskundige problemen ter wereld:

  • De Putnam Competition: Dit is een zware wiskundewedstrijd voor universiteitsstudenten in Noord-Amerika. In 2025 scoorde de gemiddelde student slechts 2 van de 120 punten. LEAP loste 100% van de problemen op (alle 12 van hen).
  • De IMO-Bench: De auteurs creëerden een nieuwe test gebaseerd op de International Mathematical Olympiad (IMO). Eerdere gespecialiseerde AI-systemen (getraind alleen op wiskunde) losten ongeveer 48% van deze problemen op. LEAP, gebruikmakend van een algemene AI, loste 70% op.

5. De Belangrijkste Conclusie

Het paper betoogt dat we geen kleine, gespecialiseerde robots nodig hebben die alleen voor wiskunde zijn gemaakt. In plaats daarvan kunnen we een algemene AI (één die een beetje van alles weet) nemen en deze een goede workflow geven (de blauwdruk, de inspecteur en de geheugenkaart).

Denk er zo over na: Je hebt geen robot nodig die alleen goed is in bakken om een perfecte taart te bakken. Je hebt alleen een algemene chef nodig die een goed recept, een strikte proever en een notitieblok krijgt om te onthouden wat werkte. LEAP biedt dat recept, die proever en dat notitieblok, waardoor een "goede prater" wordt veranderd in een "perfecte bewijzer".

Kortom: LEAP maakt de AI niet slimmer; het geeft de AI alleen een betere manier om zijn gedachten te organiseren, zijn werk te controleren en zijn successen te onthouden, waardoor het wiskundige problemen kan oplossen die voorheen onmogelijk waren voor algemene AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →