FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean
Dit paper presenteert *FormalScience*, een mens-in-de-lus agentisch systeem dat domeinexperts helpt om complexe wetenschappelijke redeneringen (zoals natuurkunde) efficiënt en nauwkeurig te vertalen naar formeel verifieerbare Lean4-code.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante natuurkundige bent die een ingewikkeld verhaal vertelt over hoe sterren branden of hoe atomen dansen. Je gebruikt prachtige tekeningen, pijltjes, Griekse letters en een soort "gevoel" voor de natuur. Dat is informele wetenschap: het is prachtig, maar het is ook een beetje "vrijblijvend". Je kunt een foutje maken in je logica zonder dat iemand het direct ziet.
Aan de andere kant heb je de formele wereld: dit is de wereld van computers en wiskundige bewijzen (zoals de taal Lean). Hier is niets toegestaan. Elke stap moet ijzersterk zijn, als een digitale ketting waar elk schakeltje perfect in elkaar grijpt. Als er één foutje in zit, blokkeert de hele machine.
Het probleem: Het is voor een computer ontzettend moeilijk om dat prachtige, rommelige verhaal van de natuurkundige om te zetten in die perfecte, strakke digitale ketting. De computer begrijpt de "vibe" van de natuurkunde niet; hij ziet alleen maar een berg vreemde tekens.
Wat hebben deze onderzoekers gedaan? (De "Vertaler-Assistent")
De onderzoekers hebben FormalScience bedacht. Zie dit niet als een robot die alles in zijn eentje doet, maar als een super-slimme vertaalmachine met een menselijke supervisor.
Stel je voor dat je een vertaler hebt die een boek van het Nederlands naar een heel ingewikkelde code-taal moet vertalen.
- De Robot (AI): De AI probeert de natuurkundige tekst te vertalen naar de computer-taal.
- De Controleur (De Mens): Een echte natuurkundige kijkt over de schouder mee. De AI zegt: "Ik heb het vertaald!", en de mens zegt: "Ho even, je hebt de essentie van de zwaartekracht hier veranderd in een simpele optelsom. Doe het opnieuw!"
- De Correctie-lus: De AI krijgt de feedback, probeert het opnieuw, en de computer (de "solver") geeft direct aan of de code technisch gezien wel werkt.
Door dit samen te doen, hebben ze een enorme database gemaakt genaamd FormalPhysics: 200 natuurkundige puzzels die nu zowel in "mensentaal" als in "perfecte computer-taal" bestaan.
Het grote gevaar: "De Betekenis-Dief" (Semantic Drift)
Dit is het meest fascinerende deel van het onderzoek. De onderzoekers ontdekten iets geks. Soms lukt het de AI wel om een code te schrijven die de computer accepteert (de code is "geldig"), maar de betekenis is verdwenen. Ze noemen dit Semantic Drift.
Ik gebruik graag de metafoor van de "Lego-truc":
Stel je voor dat ik je vraag om een hyperrealistisch model van de Eiffeltoren te bouwen met Lego. Je bent een beetje lui, dus je bouwt in plaats daarvan gewoon een simpele, rechtopstaande toren van bruine blokjes.
- De computer zegt: "Gefeliciteerd! Het is een toren, hij staat stevig en hij is niet omgevallen. Het is goedgekeurd!" (Dit is de Formele Geldigheid).
- De natuurkundige zegt: "Maar dit is geen Eiffeltoren! Waar zijn de bogen? Waar is de structuur? Je hebt de essentie gestolen!" (Dit is de Betekenis-drift).
In de natuurkunde gebeurt dit ook: de AI maakt de wiskunde soms "te simpel" om de computer tevreden te stellen. Een ingewikkelde beweging van een elektron wordt dan plotseling een simpel getalletje. De computer is blij omdat de rekensom klopt, maar de natuurkunde is eigenlijk verdwenen.
Waarom is dit belangrijk?
Waarom zouden we dit willen? Omdat we in de toekomst computers willen hebben die echte wetenschappelijke ontdekkingen doen. Als we een AI willen bouwen die nieuwe medicijnen ontwerpt of nieuwe energiebronnen vindt, moet die AI niet alleen "geloofwaardig klinken", maar moet hij onweerlegbaar bewijs kunnen leveren.
Dit onderzoek is een belangrijke stap: het laat zien hoe we de brug kunnen slaan tussen de creatieve, menselijke natuurkunde en de ijzeren, logische wereld van de computer – en het waarschuwt ons dat we heel goed moeten opletten dat de computer de waarheid niet "plat slaat" om het makkelijk te maken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.