← Nieuwste papers
🤖 AI

Automated Proof Generation for Rust Code via Self-Evolution

Dit artikel introduceert SAFE, een zelfevoluerend framework dat het gebrek aan menselijke bewijsdata overwint door synthetische bewijzen en zelfoplossend debuggen te combineren, waardoor open-source modellen in staat worden gesteld om met 52,52% nauwkeurigheid correcte formele bewijzen voor Rust-code te genereren, een aanzienlijke verbetering ten opzichte van GPT-4o.

Oorspronkelijke auteurs: Tianyu Chen, Shuai Lu, Shan Lu, Yeyun Gong, Chenyuan Yang, Xuheng Li, Md Rakib Hossain Misu, Hao Yu, Nan Duan, Peng Cheng, Fan Yang, Shuvendu K Lahiri, Tao Xie, Lidong Zhou

Gepubliceerd 2026-02-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Tianyu Chen, Shuai Lu, Shan Lu, Yeyun Gong, Chenyuan Yang, Xuheng Li, Md Rakib Hossain Misu, Hao Yu, Nan Duan, Peng Cheng, Fan Yang, Shuvendu K Lahiri, Tao Xie, Lidong Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer strenge, onfeilbare inspecteur hebt die elke regel code controleert die je schrijft. Deze inspecteur, genaamd Verus, is een magische bril die kan zien of je software echt veilig is, zelfs als je hem nooit uitvoert. Hij is onmisbaar voor het bouwen van betrouwbare systemen, maar hij heeft een groot probleem: hij praat een heel moeilijke taal.

Om Verus tevreden te stellen, moet je niet alleen je code schrijven, maar ook een bewijs (een "proof") leveren. Dit bewijs is een soort gedetailleerd stappenplan dat uitlegt waarom je code werkt. Het is als het schrijven van een wiskundig betoog voor elke functie die je programmeert.

Het probleem? Er zijn heel weinig mensen die deze bewijzen kunnen schrijven. Het is als proberen een orkest te leiden terwijl je alleen maar één vioolspeler hebt. Voor kunstmatige intelligentie (AI) is dit ook een probleem: er is geen "schoolboek" vol voorbeelden van deze bewijzen om de AI op te leren.

Hier komt het nieuwe systeem SAFE in beeld. Het is een slimme, zelflerende machine die dit probleem oplost. Hier is hoe het werkt, vertaald naar alledaagse beelden:

1. Het Gebrek aan Leerboeken (Het Data-probleem)

Normaal gesproken leer je een AI door hem duizenden voorbeelden te geven. Maar voor Verus-bewijzen bestaan die voorbeelden bijna niet. De auteurs van dit paper dachten: "Als we geen boeken hebben, laten we ze dan zelf schrijven!"

2. De "Zelf-evoluerende" Cyclus (De Magie van SAFE)

SAFE werkt als een slimme leermeester met een oneindige voorraad proefwerk. Het proces heeft drie hoofdstappen:

  • Stap 1: De Vertaler
    SAFE neemt duizenden simpele programmeeropgaven (zoals "schrijf een functie die een lijst sorteert") en vraagt een super-AI (GPT-4o) om ze te vertalen naar de taal die Verus begrijpt. Het is alsof je een boek uit het Frans naar het Nederlands vertaalt, zodat de strenge inspecteur het kan lezen.

  • Stap 2: Het Schrijven van Specifaties (De Regels)
    Nu heeft de AI de code, maar Verus wil ook weten wat de code moet doen (de regels). SAFE laat de AI deze regels bedenken.

    • De slimme truc: De AI schrijft eerst een heleboel regels. Verus kijkt er dan naar en zegt: "Deze regels zijn te vaag" of "Deze regels kloppen niet". SAFE gooit de slechte regels weg en houdt alleen de goede.
    • Analogie: Stel je voor dat je een chef-kok bent. Je laat 100 koks recepten schrijven. De inspecteur (Verus) proeft ze. De recepten die te zout of te zoet zijn, worden weggegooid. De goede recepten worden gebruikt om de volgende koks (de AI) te trainen.
  • Stap 3: Het Bewijzen (De Daadwerkelijke Taak)
    Nu heeft SAFE duizenden stukjes code met goede regels. De AI probeert nu het bewijs te schrijven.

    • Het probleem: De AI maakt veel fouten.
    • De oplossing (Zelf-Debugging): Dit is het coolste deel. Als de AI een fout maakt, geeft Verus een foutmelding (bijvoorbeeld: "Je vergat te zeggen dat de lijst niet leeg is"). SAFE pakt deze foutmelding, de verkeerde poging en het juiste antwoord, en gebruikt dit als leermateriaal.
    • Analogie: Het is alsof een leerling een wiskundetoets maakt, een fout maakt, en de docent (Verus) zegt: "Je hebt hier een minteken vergeten." De leerling kijkt naar die fout, leert ervan, en probeert het opnieuw. SAFE doet dit duizenden keren. De AI wordt steeds beter in het herkennen en repareren van zijn eigen fouten.

3. Het Resultaat: Van Nul naar Helden

Aan het begin wist de open-source AI (DeepSeekCoder) niets van Verus. Het was alsof je iemand vraagt om een Formule 1-auto te bouwen zonder ooit een wiel te hebben gezien.

Na dit proces van "zelf-evolutie" (duizenden pogingen, fouten maken, leren van fouten, en opnieuw proberen):

  • De AI kon plotseling 52,52% van de moeilijke bewijzen correct schrijven.
  • De beste bestaande AI (GPT-4o), die zonder deze speciale training werkt, haalde slechts 14,39%.

Waarom is dit belangrijk?

Vroeger was het schrijven van veiligheidsbewijzen voor software een taak voor een handvol experts die jarenlang hadden gestudeerd. Met SAFE kunnen we nu een AI trainen die dit voor ons doet. Het is alsof we een machine hebben gebouwd die zichzelf kan leren hoe het veilig bouwen van software werkt, zonder dat we duizenden menselijke experts nodig hebben om het haar te leren.

Kort samengevat:
SAFE is een robot die eerst duizenden oefeningen maakt, daarna kijkt naar welke oefeningen goed zijn, en vervolgens duizenden keren probeert, faalt, en leert van zijn fouten totdat hij een meester is in het schrijven van onfeilbare software-bewijzen. Het is een cyclus van "proberen, falen, leren, en groeien" die de AI sterker maakt dan welke menselijke expert dan ook in dit specifieke vakgebied.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →