← Nieuwste papers
🤖 AI

AxDafny: Agentic Verified Code Generation in Dafny

Het artikel introduceert AxDafny, een door een verifier gestuurd framework voor agentische codegeneratie dat implementaties en bewijzen iteratief verfijnt, waarbij significante verbeteringen in verificatiesucces worden aangetoond op de nieuw voorgestelde LCB-Pro-Dafny benchmark en de bestaande DafnyBench vergeleken met state-of-the-art baselines.

Oorspronkelijke auteurs: Benjamin Breen, Austin Letson, Borja Requena Pozo, Leopoldo Sarra

Gepubliceerd 2026-07-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Benjamin Breen, Austin Letson, Borja Requena Pozo, Leopoldo Sarra

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer getalenteerde maar lichtelijk roekeloze architect inhuurt om een huis te bouwen. Je geeft hem een blauwdruk (de regels) en zegt: "Bouw een huis voor me met een keuken, een slaapkamer en een dak."

In de wereld van computercodering gedragen de meeste AI-modellen zich als die architect: ze bouwen een huis dat er goed uitziet, maar wanneer je erin probeert te wonen, lekt het dak misschien of ontbreekt de deur van de keuken. Ze vertrouwen op "testritten" — controleren of het huis werkt in een paar specifieke scenario's — om te zien of het goed genoeg is.

AxDafny is een nieuw systeem dat het spel verandert. In plaats van alleen te bouwen en dan maar te hopen op het beste, gebruikt het een "super-inspecteur" (een formele verifieerder) die de wiskunde achter het huis controleert terwijl het wordt gebouwd.

Hier is hoe het artikel dit uitlegt, onderverdeeld in eenvoudige concepten:

1. De Uitdaging: Een huis bouwen met een wiskundig bewijs

De onderzoekers wildesten kijken of AI code kon schrijven die niet alleen "werkend" is, maar ook wiskundig bewezen correct is. Ze gebruikten een speciale taal genaamd Dafny.

Beschouw Dafny als een taal waarin je niet simpelweg kunt zeggen: "Ik heb een deur gebouwd." Je moet bewijzen: "Deze deur is precies 3 voet breed, gaat alleen open als de klink wordt omgedraaid, en zal nooit van zijn scharnieren vallen."

  • Het Probleem: Code schrijven is moeilijk. Code schrijven en het wiskundige bewijs dat het werkt is nog moeilijker. De meeste AI's lopen vast omdat ze het "bewijs"-gedeelte niet kunnen schrijven.

2. De Oplossing: AxDafny (De "Fix-It" Loop)

Het team creëerde AxDafny, wat werkt als een team van twee mensen die samenwerken:

  • De Bouwer (De AI): Probeert de code en het bewijs te schrijven.
  • De Inspecteur (De Verifieerder): Controleert het werk onmiddellijk.

Als de Bouwer een fout maakt, zegt de Inspecteur niet alleen "Fout". Hij wijst precies naar het lekkende dak of de ontbrekende deur en zegt: "Je bent vergeten te bewijzen dat de deur aan de scharnieren blijft zitten."
De Bouwer past die specifieke fout vervolgens aan en probeert het opnieuw. Ze blijven dit doen in een lus (Bouwen → Controleren → Herstellen → Bouwen) totdat de Inspecteur een perfect "Pass" geeft.

3. De Nieuwe Test: "LCB-Pro-Dafny"

Om te zien of dit systeem echt werkt, creëerden de onderzoekers een nieuwe test genaamd LCB-Pro-Dafny.

  • Stel je voor dat je 250 moeilijke puzzels uit een programmeerwedstrijd neemt (zoals een hoogwaardige wiskundeolympiade voor programmeurs).
  • Ze hebben deze puzzels vertaald naar de strikte "Dafny"-taal.
  • Nu moet de AI de puzzel oplossen en bewijzen dat de oplossing correct is.

4. De Resultaten: Wie won er?

De onderzoekers vergeleken hun nieuwe systeem (AxDafny) met een standaard, krachtige AI (GPT-5.5) die gewoon probeert de code één keer te schrijven zonder de "fix-it" loop.

  • Op de "Bewijs" Test (DafnyBench):

    • De standaard AI kreeg ongeveer 54% van de bewijzen goed.
    • AxDafny (met gebruik van de fix-it loop) kreeg 92,7% goed.
    • Analogie: Het is alsof de standaard AI het antwoord raadt, terwijl AxDafny een student is die zijn werk blijft controleren totdat hij een A+ haalt.
  • Op de "Wedstrijd" Test (LCB-Pro-Dafny):

    • De standaard AI loste slechts 11,6% van de moeilijke puzzels correct op.
    • AxDafny loste 56,4% op.
    • Analogie: AxDafny was veel beter in het oplossen van de eigenlijke problemen, maar het bleef worstelen met het "moeilijke" niveau, wat aantoont dat sommige puzzels ongelooflijk lastig zijn, zelfs met een super-inspecteur.

5. De Addertjes: "Correct" vs. "Snel"

Hier is een verrassende bevinding uit het artikel.
Soms bouwde AxDafny een huis dat wiskundig perfect was (de Inspecteur zei "Pass!"), maar wanneer ze probeerden erin te wonen, was het huis te traag of verbruikte het te veel elektriciteit.

  • Waarom? De Inspecteur controleert alleen of het huis veilig en correct is. Hij controleert niet of het huis efficiënt is.
  • De AI zou soms een "trage" oplossing bouwen die makkelijk te bewijzen was als correct, in plaats van een "snelle" oplossing die moeilijk te bewijzen is.
  • Wanneer ze de code op echte computers testten, faalden veel van de "perfecte" oplossingen omdat ze te lang duurden (Time Limit Exceeded) of te veel geheugen gebruikten.

Samenvatting

AxDafny is een systeem dat AI leert om code te schrijven die wiskundig bewezen correct is door een "check-and-fix" loop te gebruiken.

  • Het werkt geweldig bij het garanderen dat de code precies doet wat die moet doen (geen bugs).
  • Het is een grote verbetering ten opzichte van standaard AI, die vaak gewoon gokt.
  • De beperking: Alleen omdat de code "bewezen correct" is, betekent niet dat het "snel genoeg" is voor echte wedstrijden. De AI moet leren om zowel correct als efficiënt te zijn.

Het artikel concludeert dat deze aanpak een krachtige manier is om code betrouwbaarder te maken, maar dat we AI nog steeds moeten leren om ook om snelheid te geven, en niet alleen om correctheid.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →