← Nieuwste papers
🤖 AI

VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation

Dit artikel introduceert VeriContest, een uitgebreide benchmark van 946 competitieve programmeeropgaven in Rust met Verus die natuurlijke taalbeschrijvingen koppelt aan door experts gevalideerde formele specificaties en machine-controleerbare bewijzen, en zo een aanzienlijke prestatiekloof blootlegt tussen de programmeervaardigheden van huidige modellen en hun vermogen tot het genereren van verifieerbare code.

Oorspronkelijke auteurs: Zichen Xie, Mrigank Pawagi, Yuxin Liu, Aaditi Rai, Lize Shao, John Berberian Jr., Sicong Che, Wenxi Wang

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zichen Xie, Mrigank Pawagi, Yuxin Liu, Aaditi Rai, Lize Shao, John Berberian Jr., Sicong Che, Wenxi Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar onervaren architect inhuurt om een huis te bouwen.

In de wereld van standaard coderingsbenchmarks geef je de architect een eenvoudige beschrijving: "Bouw een huis met drie slaapkamers en een keuken." De architect maakt blauwdrukken, bouwt het huis en jij controleert of de deuren openen en of de lichten werken. Als dat zo is, krijgt de architect een voldoende. Dit is vergelijkbaar met hoe huidige AI-modellen code schrijven: ze zijn uitstekend in het maken van dingen die er uitzien en zich gedragen alsof ze goed zijn.

Maar wat als je een huis nodig hebt dat wiskundig gegarandeerd nooit zal instorten, zelfs niet in een orkaan? Je kunt niet alleen de lichten controleren; je hebt een formeel bewijs nodig dat de constructie waterdicht is. Hier komt het paper "VeriContest" in beeld.

Het Probleem: "Het Werkt, Maar Is Het Waar?"

Huidige AI-modellen zijn als die getalenteerde architecten die een huis kunnen bouwen dat een visuele inspectie doorstaat. Ze slaan echter vaak de rigoureuze engineeringwiskunde over. Ze kunnen een huis bouwen dat er prima uitziet, maar een verborgen gebrek in de fundering heeft dat pas onder specifieke belasting naar boven komt.

De auteurs van dit paper betogen dat we een nieuwe manier nodig hebben om AI te testen. In plaats van alleen te vragen: "Werkt de code?", moeten we vragen: "Kun je met wiskundige zekerheid bewijzen dat deze code precies doet wat hij moet doen, en niets anders?"

De Oplossing: VeriContest

Het team creëerde een enorme "examen" genaamd VeriContest. Denk hierbij aan een hoog-risico competitie voor AI-architecten, maar dan met drie strikte regels:

  1. De Blauwdruk (Specificatie): De AI moet eerst een wiskundig contract schrijven. Dit is niet zomaar een beschrijving; het is een starre reeks regels die exact definieert wat de invoer is en wat de uitvoer moet zijn.
  2. De Constructie (Code): De AI moet de daadwerkelijke code schrijven (in de programmeertaal Rust) die deze regels volgt.
  3. Het Ingenieursbewijs (Verificatie): De AI moet een wiskundig bewijs leveren dat de code niet kan falen. Het is als het tonen van de wiskunde die bewijst dat het dak niet zal instorten, in plaats van alleen maar hopen dat het niet gebeurt.

Ze testten dit op 946 moeilijke puzzels afkomstig van beroemde coderingscompetities (LeetCode en Codeforces). Dit zijn geen simpele "Hello World"-taken; het zijn complexe logische problemen waarbij zaken als het vinden van patronen in data of het optimaliseren van routes een rol spelen.

Het Constructieproces

Het bouwen van dit examen was moeilijk. Het team vroeg niet zomaar een AI om de vragen te maken; ze bouwden het in drie fasen:

  • Fase 1 (De Zaad): Menselijke experts schreven handmatig 91 perfecte voorbeelden met foutloze bewijzen.
  • Fase 2 (De Uitbreiding): Ze gebruikten een AI-assistent om meer problemen te genereren, maar menselijke experts fungeerden als "redacteuren" en controleerden elk exemplaar om ervoor te zorgen dat de wiskunde correct was.
  • Fase 3 (De Stress Test): Ze creëerden "negatieve testgevallen" – scenario's ontworpen om de AI voor de gek te houden. Als het bewijs van de AI onvolledig was, zouden deze valstrikvragen het gebrek blootleggen.

De Resultaten: Een Enorme Kloof

Toen ze de slimste AI-modellen ter wereld door dit examen lieten lopen, waren de resultaten verrassend en scherp.

  • De "Normale" Test: Als ze alleen werden gevraagd om code te schrijven op basis van een beschrijving (geen bewijzen vereist), haalde de beste AI het 92% van de tijd goed. Het is een meesterbouwer.
  • De "Blauwdruk" Test: Als ze werden gevraagd om het wiskundige contract (specificatie) te schrijven, daalde de score naar 48%. De AI had moeite om de regels precies te definiëren.
  • De "Bewijs" Test: Als ze werden gevraagd om het wiskundige bewijs te leveren dat de code werkt, stortte de score in naar 14%. De AI kon het zware werk van de wiskunde niet aan.
  • De "Volledige Examen" (End-to-End): Als ze werden gevraagd om alle drie de stappen tegelijk te doen (Blauwdruk + Code + Bewijs), slaagde de beste AI slechts 5,3% van de tijd.

De Analogie: Het "Perfecte Huis"

Stel je voor dat de AI een kok is.

  • Standaard Codering: Je vraagt om een hamburger. De kok maakt een hamburger die lekker smaakt. Je eet het. Succes!
  • Verifieerbare Codering: Je vraagt om een hamburger, maar je eist ook een certificaat dat bewijst dat het vlees van een specifieke boerderij komt, het broodje precies op 350 graden is gebakken en dat de hamburger geen verborgen allergenen bevat. De kok kan de hamburger maken, maar ze zijn verschrikkelijk in het schrijven van het certificaat of het bewijzen van de wiskunde achter het kookproces.

De Conclusie

Het paper concludeert dat AI, hoewel het steeds beter wordt in het "gissen" naar de juiste code om een programma te laten draaien, nog steeds zeer slecht is in het bewijzen dat de code correct is. De grootste bottleneck is niet het schrijven van de code; het is het schrijven van de formele regels en de wiskundige bewijzen die garanderen dat de code veilig is.

VeriContest is nu een tool voor onderzoekers om precies te meten hoe ver AI nog moet komen voordat het kan worden vertrouwd om software te bouwen die wiskundig gegarandeerd foutloos is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →