← Nieuwste papers
🤖 AI

Formally Solving Answer-Construction Problems in Lean

Dit artikel introduceert ECP, een neuro-symbolisch framework in Lean dat door middel van hulpmiddelen ondersteunde algemene LLM's voor het enumereren van kandidaatantwoorden combineert met prover-LLM's voor het genereren van machinaal gecontroleerde bewijzen, waarmee het gat in het formeel oplossen van wiskundige antwoordconstructieproblemen effectief overbrugt.

Oorspronkelijke auteurs: Jialiang Sun, Yuzhi Tang, Ao Li, Chris J. Maddison, Kuldeep S. Meel

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jialiang Sun, Yuzhi Tang, Ao Li, Chris J. Maddison, Kuldeep S. Meel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer moeilijke wiskundewedstrijd aflegt. Er zijn twee soorten vragen die je kunt tegenkomen:

  1. De "Bewijs het" Vraag: De rechter geeft je een stelling zoals "De lucht is blauw" en vraagt: "Kun je bewijzen dat dit waar is?" Je hoeft alleen maar een logisch argument te schrijven.
  2. De "Bouw het" Vraag: De rechter vraagt: "Vind het kleinste getal dat aan deze vreemde regels voldoet." Je moet eerst het getal verzinnen en het daarna bewijzen dat het klopt.

Dit papier gaat volledig over het tweede type: Antwoord-Constructie. Het is het verschil tussen een advocaat die een bekende zaak bepleit, en een architect die eerst een gebouw moet ontwerpen voordat hij kan bewijzen dat het niet instort.

Het Probleem: Een Mismatch van Tools

De auteurs merkten een kloof op in de manier waarop Kunstmatige Intelligentie (AI) deze taken afhandelt.

  • Algemene AI (Het "Grote Brein"): Denk hierbij aan een briljante, praatgrage professor. Hij is geweldig in brainstormen, het raden van getallen en het doen van ruwe berekeningen. Maar als je hem vraagt een formeel, machine-perfect bewijs te schrijven, wordt hij vaak lui, verzint hij feiten of schrijft hij code die niet compileert. Het is ook erg duur om hem in te huren.
  • Prover AI (De "Strikte Redacteur"): Denk aan een kleine, hypergeconcentreerde robot die alleen getraind is in het schrijven van formele bewijzen. Het is goedkoop en geweldig in het controleren van logica, maar het is verschrikkelijk in het raden van wat het antwoord zou kunnen zijn. Als je vraagt om "het getal te vinden", staart het misschien alleen maar naar de muur of raadt het een willekeurig getal dat niet werkt.

De Valstrik:
Als je de "Strikte Redacteur" simpelweg vraagt om een "Bouw het" probleem op te lossen, zou hij kunnen valsspelen. Hij zou kunnen zeggen: "Het antwoord is 'het kleinste getal dat aan de regels voldoet'." Technisch gezien is dat een geldig antwoord in de ogen van een computer, maar in een echte wiskundewedstrijd is dat een circulaire truc. Je hebt een specifiek getal nodig, zoals 245. De computer moet worden gedwongen om te stoppen met valsspelen en daadwerkelijk het echte getal te vinden.

De Oplossing: ECP (Enumereren-Conjectureren-Bewijzen)

De auteurs hebben een nieuw systeem gebouwd genaamd ECP (Enumerate-Conjecture-Prove). Dit fungeert als een team van drie personen die samenwerken om deze "Bouw het" problemen op te lossen in een taal genaamd Lean (een computerbewijsassistent).

Hier is hoe het team werkt, gebruikmakend van een Detective-analogie:

1. De Detective (De Algemene AI + Python Tools)

  • Rol: Dit is de briljante professor, maar deze keer heeft hij een rekenmachine en een computer om code uit te voeren.
  • Actie: In plaats van alleen maar te gokken, schrijft de Detective een Python-programma om via brute force naar aanwijzingen te zoeken. Hij draait lussen om duizenden kleine getallen te testen om te zien welke aan de regels voldoen.
  • De "Conjecture" (Veronderstelling): Op basis van de gegevens maakt de Detective een onderbouwde gok: "Ik wed dat het antwoord 245 is." Hij schrijft zijn redenering op in gewone mensentaal.

2. De Gatekeeper (De Toelatingscontroleur)

  • Rol: Dit is de uitsmijter bij de club.
  • Actie: Voordat de gok van de Detective mag doorgaan, controleert de Gatekeeper het.
    • Is het een echt getal? (Ja, 245 is een getal).
    • Is het valsspelen? (Zei de Detective net "het antwoord is het antwoord"? Nee.)
    • Worden er verboden woorden gebruikt? (Gebruikte hij complexe wiskundige symbolen die niet zijn toegestaan in de wedstrijd? Nee.)
  • Als de gok de controle niet doorstaat, stuurt de Gatekeeper de Detective terug om het opnieuw te proberen.

3. De Rechter (De Prover AI + Lean Automatisering)

  • Rol: Dit is de "Strikte Redacteur"-robot.
  • Actie: Zodra de Gatekeeper de gok goedkeurt (245), neemt de Rechter het over. De Rechter negeert het deel over "hoe we het gevonden hebben" en focust zich volledig op het deel over "waarom het waar is". Het gebruikt formele logica om te bewijzen, zonder enige twijfel, dat 245 inderdaad het juiste antwoord is.
  • Als het bewijs faalt, stuurt de Rechter de Detective terug om een ander getal te proberen.

De Resultaten: Werkt het?

De auteurs hebben dit team getest op twee beroemde wiskundige datasets: PutnamBench (universiteitsniveau wiskunde) en MathArena (middelbare school competities zoals AIME).

  • De Oude Manier: Als je de "Strikte Redacteur" simpelweg vroeg om deze problemen op te lossen, faalde hij meestal of valsspelde hij door circulaire antwoorden te geven. Als je de "Grote Brein" alles liet doen, liep hij vast op het formele bewijs-gedeelte.
  • De ECP-Manier: Door het werk te splitsen, loste het systeem 17 van de 346 moeilijke universiteitsproblemen op en 18 van de 75 middelbare school problemen.
  • Waarom het ertoe doet: Het gaat niet alleen om het krijgen van het juiste getal; het gaat om het krijgen van een machine-geverifieerd bewijs dat het getal correct is en dat het antwoord geen valsspel was.

Samenvatting

Zie ECP als een assemblagelijn in een fabriek voor wiskundeproblemen:

  1. Werker A (Algemene AI) gebruikt tools om naar het antwoord te graven.
  2. Inspecteur B (Gatekeeper) zorgt ervoor dat het antwoord een echt, niet-vals spelend getal is.
  3. Werker C (Prover AI) bouwt de onbreekbare brug van logica om te bewijzen dat dat getal juist is.

Deze aanpak overbrugt de kloof tussen "het antwoord raden" en "het antwoord bewijzen", waardoor AI wiskundeproblemen kan oplossen die zowel creativiteit als rigoureuze logica vereisen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →