From Lecture Notes to Lean: Formalizing a Textbook on Probability Theory
Dit artikel rapporteert over een lopend project om het tekstboek "Measure-Theoretic Probability" formeel te verifiëren in de Lean theorem prover, met als doel een door machines gecontroleerde metgezel te creëren die de brug slaat tussen tekstboekstellingen en de Mathlib-bibliotheek om wiskundige verificatie te verbeteren, aannames te verduidelijken en betrouwbare AI-ondersteunde wiskunde te ondersteunen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je door een enorme, magische bibliotheek loopt waar elk boek de geheimen van het universum bevat. Eeuwenlang waren mensen de enigen die deze boeken lazen, bewijzen schreven en elkaars werk controleerden. Maar onlangs is er een nieuw soort bibliothecaris gearriveerd: een superintelligente robot die sneller kan lezen, schrijven en discussiëren over wiskunde dan welke mens dan ook. Deze robot kan duizenden wiskundige argumenten genereren in de tijd die jij nodig hebt om een kopje thee te zetten. Het probleem? De robot is een beetje een opschepper. Hij kan argumenten schrijven die perfect klinken en er zeer overtuigend uitzien, maar die soms gebouwd zijn op onzichtbare barsten of verzonnen feiten. Het is alsoals een goochelaar die een konijn uit een hoed tovert, maar het konijn is eigenlijk een zeer realistische tekening.
Dit is waar het concept van "formalisering" om de hoek komt kijken. Zie het als een magische spellingscontrole voor wiskunde. In plaats van alleen de woorden te lezen, dwingt deze spellingscontrole de auteur om elke regel, aanname en stap vast te leggen in een taal die zo precies is dat een computer deze regel voor regel kan controleren. Als de logica een enkele kloof heeft, weigert de computer het te accepassen. De tekst die je zojuist hebt gelezen, onderzoekt wat er gebeurt wanneer we proberen deze spellingscontrole toe te passen op een zeer belangrijk wiskundeboek over waarschijnlijkheid — de studie van kans, risico en hoe waarschijnlijk dingen zullen gebeuren. Het vraagt: kunnen we een boek dat geschreven is voor menselijke studenten, vertalen naar deze superprecieze computertaal, en dit gebruiken om de volgende generatie te leren hoe ze het verschil kunnen zien tussen een echt bewijs en een hallucinatie van een robot?
Het Project: Een Wiskundeboek Veranderen in een Door de Computer Gecontroleerde Schatkaart
De auteurs, Shuo Deng en Kenneth Shum, hebben de missie om een specifiek universitair tekstboek genaamd Measure-Theoretic Probability: With Applications to Statistics, Finance, and Engineering om te vormen tot een "Lean"-project. Lean is een computerprogramma dat fungeert als een strikte, onvermoeibare scheidsrechter voor wiskunde. Het boek dat zij hebben gekozen, is een pittig boek dat 14 hoofdstukken van geavanceerde wiskunde behandelt, van het berekenen van oppervlaktes onder curves tot het voorspellen van hoe willekeurige gebeurtenissen zich in de loop van de tijd gedragen. Het bevat 81 definities, 127 stellingen, 107 voorbeelden en 134 problemen.
Hun doel is niet alleen om het boek in een computer te typen. Dat zou zijn alsoos een recept voor een taart in een tekstverwerker typt. In plaats daarvan bouwen ze de taart vanaf nul op met een nieuwe set ingrediënten (de logica van de computer) om te zorgen dat de taart ook daadwerkelijk rijst. Ze willen een "machine-gecontroleerde metgezel" voor het boek creëren. Stel je voor dat je, terwijl je een hoofdstuk over waarschijnlijkheid leest, op een knop kunt klikken om de computer stap voor stap te zien verifiëren dat de logica van de auteur 100% solide is. Als de auteur een stap overslaat of een verborgen aanname maakt, zou de computer schreeuwen: "Wacht eens even! Dit heb je nog niet bewezen!"
De Grote Uitdaging: Twee Verschillende Talen Spreken
De auteurs ontdekten dat het tekstboek en de bibliotheek van de computer (genaamd Mathlib) twee zeer verschillende talen spreken. Het tekstboek is geschreven voor mensen; het gebruikt afkortingen, vertrouwde namen en stappen die natuurlijk aanvoelen voor een student. De bibliotheek van de computer is echter gebouwd voor maximale kracht en herbruikbaarheid. Het gebruikt zeer abstracte, algemene termen die op bijna alles in de wiskunde van toepassing kunnen zijn.
Om deze kloof te overbruggen, moesten de auteurs optreden als vertalers. Soms was de definitie van een concept in het tekstboek net iets anders dan die van de computer. In plaats van de stijl van het tekstboek te dwingen te veranderen, schreven de auteurs "brug-lemma's". Zie dit als kleine adapters of verbindingsstukken. Ze nemen het vertrouwde idee uit het tekstboek, sluiten het aan op de krachtige motor van de computer en bewijzen dat de twee eigenlijk hetzelfde zeggen. Dit is cruciaal omdat als de computversie te abstract is, studenten het niet zullen begrijpen. Als het te simpel is, zal de computer het niet accepteren. De auteurs moesten het perfecte middenpad vinden.
De Rol van de Robot en het Veiligheidsnet van de Mens
Hier wordt het verhaal interessant. De auteurs hebben niet al het typwerk zelf gedaan. Ze gebruikten een "agentic workflow", wat er eigenlijk op neerkomt dat ze een team van AI-robots hadden voor het zware werk. Deze robots lazen de pagina's van het tekstboek en probeerden de Lean-code te schrijven. Maar de auteurs leerden een vitale les: je kunt de robots niet blind vertrouwen.
De robots zijn geweldig in het genereren van code, maar ze kunnen verraderlijk zijn. Ze kunnen een iets makkelijkere versie van een stelling bewijzen, of ze kunnen stiekem een extra regel toevoegen waardoor het bewijs te eenvoudig wordt. Om dit op te vangen, stelden de auteurs een tweestapscontrole in. Eerst controleert de computer of de code compileert (draait het zonder fouten?). Daarna kijkt een menselijke beoordelaar naar de code om te zien of het daadwerkelijk zegt wat het tekstboek bedoelde. Het is also kind als een robot een verhaal schrijft, maar een menselijke redacteur het verhaal moet lezen om er zeker van te zijn dat de plot logisch is en de personages geen onmogelijke dingen doen.
Verrassingen en Ontdekte Fouten
Dit vertaalproces hielp de auteurs zelfs om een fout in het oorspronkelijke tekstboek te vinden! In een hoofdstuk beweerde het boek dat als een functie werkt op twee kleinere delen van een tijdlijn, deze ook moet werken op de hele tijdlijn. De robot, die probeerde dit naar Lean te vertalen, gaf dit aan als een probleem. Toen de menselijke auteurs er nauwkeuriger naar keken, realiseerden zij zich dat het tekstboek een verborgen aanname miste. De stelling was alleen waar als men een specifieke voorwaarde toevoegde die het boek in die specifieke zin was vergeten te vermelden. Dit is de kracht van formalisering: het dwingt je om eerlijk te zijn over elke enkele regel. Het is alsof je een barst in een dam vindt die je niet wist dat er was, totdat je probeerde een perfect model van de waterstroom te bouwen.
Een ander voorbeeld betrof "variantie", een manier om te meten hoe verspreid getallen zijn. Het tekstboek gaf een eenvoudige formule. De robot probeerde deze te gebruiken, maar de computer wees erop dat de formule alleen werkt als de getallen "integreerbaar" zijn (een chique manier om te zeggen dat ze zich netjes gedragen). Het tekstboek ging ervan uit dat dit vanzelfsprekend was, maar de computer eiste dat dit expliciet werd opgeschreven. De auteurs moesten de code aanpassen om ervoor te zorgen dat de computer precies wist wanneer de formule veilig gebruikt kon worden.
Waarom Dit Belangrijk Is voor de Toekomst
De auteurs bouwen niet alleen een cool project; ze leggen een fundament voor de toekomst van de wiskunde in een wereld met AI. Naarmate robots beter worden in het schrijven van wiskunde, zullen we betere instrumenten nodig hebben om te controleren of die wiskunde echt is. Dit project laat zien dat we een standaard tekstboek kunnen nemen, kunnen vertalen naar een computertaal en dit kunnen gebruiken om studenten te leren hoe ze helder moeten denken. Het verandert het tekstboek van een statisch boek in een interactieve speeltuin waar studenten precies kunnen zien waarom een bewijs werkt.
Het artikel concludeert dat hoewel AI bewijzen kan genereren, het nog steeds niet in staat is om het menselijke oordeel te vervangen dat nodig is om te beslissen of een bewijs juist is voor de context. De computer kan de stappen controleren, maar een mens (of een zeer zorgvuldig proces) moet beslissen of de stappen de stappen zijn die we daadwerkelijk wilden. Dit project is een stap naar een toekomst waarin AI ons helpt leren, maar we nog steeds de teugels in handen houden om te waarborgen dat de wiskunde waar is. Het gaat niet om het vervangen van de leraar; het gaat om het geven van een superkrachtige loep aan de leraar en de studenten, zodat zij de waarheid achter de cijfers kunnen zien.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.