MathlibLemma: Folklore Lemma Generation and Benchmark for Formal Mathematics
Dit artikel introduceert MathlibLemma, een geautomatiseerde op LLM's gebaseerde pijplijn die ontbrekende "folklore"-lemma's ontdekt en formaliseert om de Lean Mathlib-bibliotheek uit te breiden, en die bovendien een uitgebreide benchmark van meer dan 4.000 geverifieerde wiskundige stellingen vaststelt om AI-ondersteunde formele wiskunde te bevorderen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een enorme, perfecte bibliotheek van wiskundige kennis te bouwen met behulp van een robotassistent. Je hebt een gigantische, bestaande bibliotheek genaamd Mathlib (ontworpen voor de Lean bewijsassistent), die fungeert als een supergeorganiseerde encyclopedie van wiskundige feiten.
Er is echter een probleem. Hoewel de bibliotheek de grote, beroemde stellingen bevat, ontbreken er duizenden kleine, "voor de hand liggende" feiten die menselijke wiskundigen elke dag zonder na te denken gebruiken. Deze worden folklore lemmata genoemd.
Denk hier als volgt over na: als je een roman schrijft, hoef je niet uit te leggen dat "een vierkant vier zijden heeft" of dat "als je nul optelt bij een getal, het getal hetzelfde blijft". Je gaat er gewoon van uit dat iedereen dit weet. Maar voor een robot die bewijzen controleert, blijft het vastlopen als dat kleine feit niet expliciet in de bibliotheek is opgeschreven. Het is alsof je een huis probeert te bouwen en je realiseert dat je de specifieke soort spijkers bent vergeten die nodig zijn om het dak bij elkaar te houden. Het huis (het bewijs) is conceptueel correct, maar je kunt de constructie niet voltooien omdat een klein, "voor de hand liggend" stukje ontbreekt.
Het Probleem: De "Laatste Mijl"
Het paper betoogt dat dit ontbrekende "verbindende weefsel" de laatste mijl-barrière vormt. Het weerhoudt wiskundigen ervan om deze krachtige computertools net zo makkelijk te gebruiken als ze tekstverwerkers of rekenmachines gebruiken. Zelfs als een mens het bewijs kent, kan de computer het niet uitvoeren omdat de kleine, tussenliggende stappen ontbreken.
Bovendien faalt het vaak wanneer AI (Grote Taalmodellen) probeert te helpen bij het schrijven van deze bewijzen. Waarom? Omdat als de AI het "voor de hand liggende" feit niet in de bibliotheek kan vinden, het probeert het hele bewijs vanaf nul te construeren. Dit is alsof je iemand vraagt een brug te bouwen zonder blauwdruk; ze kunnen verdwalen, fouten maken of hallucineren (dingen verzinnen) omdat de taak te groot is.
De Oplossing: MATHLIBLEMMA
De auteurs hebben een systeem ontwikkeld genaamd MATHLIBLEMMA. Denk aan dit systeem als een viertrapsfabriek die is ontworpen om die ontbrekende "voor de hand liggende" feiten te vinden, ze correct op te schrijven en te bewijzen dat ze waar zijn.
Zo werkt de fabriek, stap voor stap:
De Ontdekker (Ontdekkingsmodule):
Stel je een nieuwsgierige bibliothecaris voor die de bestaande bibliotheek leest en zegt: "Hé, we hebben veel feiten over driehoeken, maar we hebben geen regel voor wat er gebeurt als je ze ondersteboven draait. Dat is waarschijnlijk waar, maar het ontbreekt!" Deze module gebruikt AI om deze ontbrekende feiten te brainstormen op basis van wat er al is.De Poortwachter (Beoordelingsmodule):
De Ontdekker kan fouten maken. Het kan iets suggereren dat cool klinkt maar wiskundig onjuist is (zoals zeggen dat "alle getallen even zijn"). De Poortwachter is een tweede AI die de suggesties bekijkt en zegt: "Nee, dat is onzin," of "Ja, dat klinkt goed." Het filtert het afval eruit voordat de fabriek tijd verspillen.De Redacteur (Formalisatiemodule):
Zelfs als een idee wiskundig correct is, kan de AI het op een vreemde manier opschrijven die de computer niet begrijpt (zoals een zin met slechte grammatica). De Redacteur corrigeert de syntaxis. Het communiceert met de computer (de Lean-server) om te zien wat er mis is, krijgt een foutmelding en vraagt de AI het op te lossen totdat de computer zegt: "Oké, deze zin is grammaticaal correct."De Bouwer (Bewijsmodule):
Nu het feit correct is opgeschreven, probeert de Bouwer het te bewijzen. Het probeert het logische argument te construeren. Als het faalt, krijgt het een foutmelding, probeert het opnieuw en corrigeert het zijn fouten. Als het slaagt, levert het een geverifieerd bewijs op dat de computer accepteert als 100% waar.
Wat Ze Vonden
Het team liet deze fabriek draaien en produceerde twee belangrijke dingen:
- Een Nieuwe Bibliotheek van Feiten: Ze vonden en bewezen 1.506 van deze ontbrekende "folklore"-feiten. Ze namen zelfs een kleine steekproef van deze feiten en voegden deze succesvol toe aan de officiële Mathlib-bibliotheek, waarmee ze bewezen dat AI feiten kan genereren die voldoen aan de hoge standaarden van menselijke experts.
- Een Nieuwe Uitdaging (De Benchmark): Ze creëerden een testset van 4.028 van deze ontbrekende feiten om te zien hoe goed verschillende AI-modellen zijn in het vinden en bewijzen ervan.
De Resultaten:
- Huidige AI-modellen worden beter, maar ze zijn nog lang niet perfect. De beste modellen konden slechts ongeveer 19% van deze "voor de hand liggende" feiten zelfstandig oplossen.
- Echter, wanneer je de sterke punten van verschillende modellen combineert (zoals het gebruik van een team van specialisten), konden ze ongeveer 37% oplossen.
- Cruciaal: toen menselijke experts de gevallen bekeken die de AI niet kon oplossen, ontdekten ze dat 78% daarvan eigenlijk oplosbaar en wiskundig waar was. Dit betekent dat de AI niet faalde omdat de feiten nep waren; het faalde omdat de taak gewoon erg moeilijk is.
De Conclusie
Dit paper toont aan dat we AI niet alleen kunnen gebruiken om bestaande wiskundige bibliotheken te consumeren, maar ook om ze actief uit te breiden. Door het automatiseren van de ontdekking van deze kleine, ontbrekende stukjes, helpen we een completere, bruikbare en betrouwbaardere basis te bouwen voor formele wiskunde. Het is alsof je de gaten in een kaart invult zodat de reis van een wiskundig idee naar een door de computer geverifieerd bewijs soepel en makkelijk wordt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.