Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems
Dit artikel introduceert Inductief Deductief Synthese (IDS), een agentisch LLM-systeem dat implementaties en formele bewijzen voor gedistribueerde systemen gezamenlijk synthetiseert, met een 100% succesrate voor specificaties van key-value stores en met aanzienlijk minder tijd en kosten dan zowel menselijke experts als de meest geavanceerde coderingsagenten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een complex, gedistribueerd systeem bouwt, zoals een digitale bank of een gedeeld notitieblok dat veel mensen tegelijkertijd gebruiken. Je moet ervoor zorgen dat als Persoon A een notitie schrijft, Persoon B dit direct ziet, en dat er nooit data verloren gaat of door elkaar raakt, hoe chaotisch het internet ook wordt.
Traditioneel zijn er twee manieren om dit te bouwen:
- De "Gok en Check"-manier (Huidige AI): Je vraagt een slimme AI om de code te schrijven. Deze schrijft het, voert een paar tests uit en zegt: "Lijkt goed!" Maar dit is als het controleren van een brug door er één auto overheen te rijden. Het kan die auto dragen, maar het kan instorten onder een vrachtwagen. Het garandeert geen veiligheid voor elk mogelijk scenario.
- De "Wiskundig Bewijs"-manier (Traditionele Experts): Je huurt een team van menselijke wiskundigen en ingenieurs in. Ze testen de code niet alleen; ze schrijven een formeel wiskundig bewijs dat de code niet kan falen, wat er ook gebeurt. Dit is ongelooflijk veilig, maar het kost jaren aan menselijke inspanning en een fortuin.
Het Probleem:
Het paper stelt dat zelfs de slimste huidige AI-agenten (zoals Codex of Claude) falen in de "Wiskundig Bewijs"-manier. Ze proberen eerst de code te schrijven en proberen deze later te bewijzen. Dit is als het bouwen van een huis en vervolgens een architect vragen om te bewijzen dat het niet zal instorten nadat de bakstenen al gelegd zijn. Het is te moeilijk en ze raken vast.
De Oplossing: Inductief Deductief Synthese (IDS)
De auteurs hebben een nieuw AI-systeem gecreëerd genaamd IDS (Inductive Deductive Synthesis). Denk aan IDS niet als één werknemer, maar als een team van gespecialiseerde architecten en inspecteurs die in een strakke lus werken.
Hier is hoe het werkt, met een eenvoudige analogie:
De "Bouw en Inspecteer"-Lus
In plaats van het hele huis te bouwen en het daarna te controleren, bouwt IDS een klein stukje van het huis en controleert direct of dat kleine stukje wiskundig sound is.
- Het Deductieve Team (De Bouwers): Deze AI-agenten proberen een klein stukje code te schrijven (zoals een deurkader) en een klein stukje van het bewijs (een wiskundige zin die zegt "dit deurkader is sterk").
- De Inspecteur (De Bewijsassistent): Een strenge, onwrikbare robotinspecteur (genaamd Rocq) controleert het werk direct.
- Als de wiskunde niet klopt, zegt de inspecteur: "Nee, dit deurkader is zwak," en het team stopt direct. Ze verspillen geen tijd aan het bouwen van de rest van het huis op een zwakke fundering.
- Als het slaagt, gaan ze naar het volgende kleine stukje.
- Het Inductieve Team (De Strategen): Soms raken de bouwers vast. Ze blijven proberen hetzelfde type deur te bouwen, maar de wiskunde werkt nooit. Hier komt het "Inductieve" deel om de hoek kijken.
- De Proposer: Een strategische AI kijkt naar het vastgelopen punt en zegt: "Hé, misschien moeten we geen houten deur bouwen; laten we het proberen met een stalen." Het suggereert een nieuwe lokale oplossing.
- De Reloader: Als de hele strategie verkeerd is (zoals het proberen van een huis te bouwen op een moeras), zegt deze strateeg: "Schrab dit ontwerp. Laten we opnieuw beginnen met een volledig ander blauwdruk."
Waarom Dit Een Groot Ding Is
Het paper beweert dat dit systeem een game-changer is om drie redenen:
- Snelheid: Het loste 7 verschillende complexe problemen met gedistribueerde systemen op in ongeveer 6,8 uur. Een team van menselijke experts zou maanden of jaren hebben nodig gehad om hetzelfde te doen. Dat is ongeveer 200 keer sneller.
- Succespercentage: De beste bestaande AI-agenten konden slechts 2 van de 7 problemen oplossen. IDS loste alle 7 op.
- Prestatie: Niet alleen is de code correct, maar het is ook snel. In sommige gevallen draaide de code die IDS genereerde 3 keer sneller dan de beste door mensen geschreven versies. Dit gebeurde omdat de AI meer ontwerpopties onderzocht dan een mens normaal zou doen, en een "sweet spot" vond die mensen over het hoofd zagen.
De Haken (Beperkingen)
Het paper is zeer eerlijk over wat IDS nog niet kan:
- Het heeft een perfect recept nodig: Je hebt nog steeds een menselijke expert nodig om de initiële "specificatie" te schrijven (de wiskundige regels van wat het systeem moet doen). Als het recept verkeerd is, bouwt de AI een perfect huis dat niet overeenkomt met wat je wilde.
- Het is nog geen toverstaf voor alles: Ze hebben het specifiek getest op "Key-Value Stores" (een type database). Hoewel ze geloven dat het op andere dingen kan werken (zoals besturingssystemen of encryptie), hebben ze dit nog niet bewezen.
De Conclusie
Dit paper introduceert een nieuwe manier om AI te gebruiken die bouwen en controleren combineert op hetzelfde moment. In plaats van AI te vragen "schrijf code en hoopt dat het werkt", vraagt het AI om "code te schrijven en te bewijzen dat het werkt, stap voor stap".
Het verandert het proces van het creëren van "perfect veilig" software van een langzame, dure menselijke marathon in een snelle, geautomatiseerde sprint, waardoor de software waarop we vertrouwen (zoals bankapps of cloudopslag) mogelijk veel veiliger en betrouwbaarder wordt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.