Visored: A Controlled-Natural-Language Prover for LLM-Generated Mathematics
Dit artikel introduceert Visored, een bewijzer gebaseerd op afhankelijke typen die door middel van een natuurlijke taalachtige interface en regelgestuurde automatisering een brug slaat tussen door LLM's gegenereerde wiskunde en formele verificatie om bewijzen om te zetten in gecontroleerde Lean-bestanden, waarbij effectieve prestaties op de miniF2F-benchmark worden aangetoond zonder gespecialiseerde training.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante maar lichtelijk hallucinatiegevoelige student (een AI) probeert te leren hoe hij een wiskundig bewijs moet schrijven. De student is geweldig in het schrijven van het verhaal van het bewijs in gewone mensentaal, maar mist vaak de kleine, saaie details die een strikte wiskundeleraar nodig heeft om te geloven dat het waar is.
Momenteel, als je deze student vraagt om een bewijs te schrijven in een strikte, computerleesbare taal (zoals Lean), loopt de student vaak vast. De student weet niet welke specifieke "bibliotheekregel" te kiezen, of maakt fouten in de kleine details zoals "je mag niet delen door nul."
Visored is een nieuwe tool die dit probeert op te lossen. Het fungeert als een vertaler en een vangnet dat tussen de natuurlijke taal van de student en de strikte computertaal in staat.
Zo werkt het, met een paar analogieën:
1. De "Controlled Natural Language" (Het Script)
In plaats van de AI te dwingen om direct in de rigide, code-achtige taal van Lean te schrijven, laat Visored de AI schrijven in een gecontroleerde versie van het Engels.
- De Analogie: Denk hierbij aan een "Mad Libs"-stijl script. De AI mag niet zomaar alles schrijven; de AI moet specifieke zinsstructuren gebruiken zoals "Laat x zijn...", "Veronderstel...", of "Dan...".
- Waarom het helpt: Dit houdt de AI in zijn comfortzone (het schrijven van Engels), terwijl de structuur rigide genoeg blijft om door een computer begrepen te worden. Het is alsoer een invulwerkblad te geven in plaats van een leeg blad papier.
2. De "Middleman" (De IR)
Visored raadt niet alleen wat de AI bedoelde. Het zet dat Engelse script om in een tussenliggende representatie (een IR genoemd).
- De Analogie: Stel je voor dat de AI een eerste concept schrijft. Visored neemt dat concept en vult alle onzichtbare "voetnoten" aan die de AI heeft overgeslagen. Is er aangenomen dat positief is? Visored schrijft dat op. Heeft de AI door een variabele gedeeld? Visored controleert of die variabele niet nul is.
- De Magie: Als de AI een fout maakt, zegt Visored niet simpelweg "Fout." Het wijst exact naar de zin waar de logica de fout in ging, zoals een leraar die een specifieke fout met rode inkt omcirkelt. Dit geeft de AI een duidelijk signaal over hoe het de volgende poging moet verbeteren.
3. De "Rule-Driven Solver" (De Automatische Controle)
Zodra Visored het bewijs in dit tussenliggende formaat heeft, gebruikt het een regelgebaseerde engine om de "saaie" stappen te controleren.
- De Analogie: Denk aan een wiskundeboek. Wanneer een tekstboek zegt "het volgt daaruit dat...", slaat het vaak de algebra over omdat dit voor een mens overduidelijk is. De solver van Visored is als een onvermoeibare robot die die overgeslagen stappen invult. Het controleert de rekenkunde, de algebra en de logica van de kleine stappen automatisch.
- Het Resultaat: Als de AI de hoofdideeën levert, handelt Visored het tedieuze "handwerk" van het bewijzen van de kleine stappen af.
4. De "Back-Translation" (De Lean Output)
Als Visored tevreden is met het bewijs, kan het dit terugvertalen naar Lean-code (de strikte taal) voor de definitieve verificatie.
- De Catch: Het artikel geeft toe dat de huidige vertaling erg "woordrijk" is. Het is alsof je een samenvatting van 1 pagina omzet in een juridisch contract van 200 pagina's, enkel om er zeker van te zijn dat elk woord juridisch precies is. Het werkt, maar het is enorm groot.
Wat hebben ze eigenlijk bereikt?
De onderzoekers hebben dit getest op een set van 244 wiskundeproblemen (voornamelijk uit de middenbouw van wedstrijden).
- Het Resultaat: Een AI-agent die Visored gebruikt, heeft deze problemen succesvol opgelost in 91% van de gevallen.
- De Catch: De AI heeft ze niet alleen opgelost. Het werkte in een lus: de AI schreef een concept, Visored controleerde dit en zei "Fout hier", de AI verbeterde het, en ze probeerden het opnieuw.
- De Beperking: Het had moeite met de zeer moeilijke problemen (zoals vragen van de International Mathematical Olympiad), omdat de "regelboeken" van Visored de geavanceerde wiskundige trucs die hiervoor nodig zijn, nog niet bezaten.
De Kern van het Verhaal
Visored is geen toverstaf die direct moeilijke wiskundeproblemen oplost. In plaats daarvan is het een collaboratieve werkruimte. Het stelt een AI in staat om bewijzen te schrijven in een taal die zij begrijpt (Engels), terwijl een computersysteem de strikte logica en foutcontrole afhandelt.
Het artikel beweert dat we door deze "tussenpersoon"-aanpak een AI kunnen laten produceren die daadwerkelijk betrouwbare wiskundige bewijzen levert, zonder dat de AI vanaf het begin gedwongen hoeft te worden om de moeilijke, rigide programmeertaal van formele bewijssystemen te leren. Het verandert de "hallucinaties" van de AI in een gestructureerd, controleerbaar proces.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.