VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
Het artikel introduceert VeriScale, een adversariaal raamwerk dat testsuites uitbreidt en distilleert om rigoureuzere benchmarks zoals VerinaPlus en VerinaLite te creëren, die aanzienlijke zwaktes in de codegeneratie- en specificatiecapaciteiten van state-of-the-art LLMs aan het licht brengen die bestaande benchmarks niet detecteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robotkok huurt om een complexe maaltijd te bereiden. Je geeft de robot een recept (de "specificatie") en vraagt hem het gerecht te bereiden (de "code"). Om te zien of de robot goed is, proef je het eten.
Het Probleem: De "Eenvoudige Toets" Valstrik
Momenteel zijn de tests die we gebruiken om deze AI-koks te controleren, als een zeer eenvoudige toets. We geven hen slechts een paar simpele ingrediënten (zoals "zout" en "water") en vragen om een simpel resultaat ("soep"). Als de robot soep maakt, geven we hem een A+.
Maar hier zit de addertje onder het gras: de robot zou kunnen valsspelen. Hij kan het antwoord voor "zout + water = soep" hebben uit het hoofd geleerd, maar als je hem een vreemd ingrediënt geeft zoals "tandpasta", probeert hij misschien nog steeds soep te maken en claimt hij dat het correct is. Of hij schrijft een recept waarin staat "voeg zout toe", maar vergeet te zeggen "voeg geen gif toe". Omdat de test geen "tandpasta" of "gif" bevatte, slaagt de robot, ook al is hij eigenlijk gevaarlijk of defect.
Het artikel stelt dat huidige tests te klein en te makkelijk zijn, waardoor AI slimmer lijkt dan het in werkelijkheid is.
De Oplossing: VeriScale (Het "Stress Test" Kader)
De auteurs hebben een nieuw systeem ontwikkeld dat VeriScale heet. Denk hierbij aan een "Stress Test" of een "Red Team"-oefening voor AI-code. In plaats van de AI alleen te vragen soep te maken, probeert VeriScale de AI te verleiden tot falen.
Het werkt in twee hoofdstappen:
Stap 1: De "Obstakelbaan" (Expansie)
Eerst creëert VeriScale een enorme, chaotische obstakelbaan van ingrediënten.
- De Zaad: Het begint met normale ingrediënten.
- De Mutatie: Het gebruikt een "mutatiemachine" om deze ingrediënten te verdraaien en te veranderen. Het verandert een kopje water in een emmer ijs, of een snufje zout in een berg zout. Het creëert vreemde, randgevallen scenario's die de AI nog nooit heeft gezien.
- De "Truukzame" Kok (Adversarial Synthesis): Dit is het slimme deel. VeriScale vraagt een andere, zeer slimme AI om te fungeren als een "Truukzame". Deze Truukzame probeert een neprecept te schrijven dat er naar lijkt te voldoen aan de regels, maar in werkelijkheid onzin produceert.
- Voorbeeld: Als de regel is "De soep moet heet zijn", kan de Truukzame een recept schrijven dat "Ijscream" oplevert, maar claimt: "Nou, technisch gezien is ijscream een voedsel, dus ik heb de regel gevolgd!"
- VeriScale voert deze Truukzame-recepten uit tegen de regels van de AI. Als de regels van de AI de Ijscream accepteren als "Heete Soep", vangt VeriScale de fout. Het genereert een enorme lijst van deze "prikkelmomenten".
Stap 2: De "Essentiële Checklist" (Reductie)
Nu heeft VeriScale duizenden van deze lastige testgevallen. Het uitvoeren van allemaal op elke AI zou eeuwen duren en een fortuin kosten. Daarom voert het een "Reductie" uit.
- Het vraagt: "Welke van deze 1.000 trucs zijn het belangrijkst?"
- Het behoudt de specifieke trucs die de meeste fouten opsporen en gooit die weg die slechts herhalingen zijn.
- Het resultaat is een compacte, super-uitdagende test die klein genoeg is om snel te draaien, maar toch elke enkele fout opspreekt die de enorme lijst zou hebben gevonden.
De Resultaten: Het "Waarheidsmiddel"
De auteurs hebben dit nieuwe systeem getest op de beste beschikbare AI-modellen (zoals GPT-5.5 en anderen).
- De Oude Test: De AI's behaalden scores zoals 96% of 98%. Ze leken op genieën.
- De VeriScale Test: Wanneer ze door de stress test werden gehaald, daalden de scores drastisch. De score van een topmodel daalde van 96% naar 86% voor codering, en van 68% naar 44% voor het schrijven van de regels (specificaties).
De Grote Conclusie
Het artikel toont aan dat de oude tests ons hebben bedrogen. Ze overschatten hoe goed AI is in het schrijven van veilige, correcte code. De nieuwe "VeriScale"-tests onthullen dat hoewel AI geweldig is in het schrijven van code die er naar lijkt te kloppen, het nog steeds zeer slecht is in het schrijven van regels die elke mogelijke fout opvangen.
Ze hebben ook twee versies van deze nieuwe test uitgebracht:
- VERINAPLUS: De enorme, volledige stress test (83 keer groter dan het origineel).
- VERINALITE: De "lite" versie. Het is 14 keer groter dan het origineel, maar gebruikt de "Reductie"-truc om snel en goedkoop te zijn, terwijl het toch dezelfde fouten opspreekt.
Kortom: VeriScale is een tool die ons voorkomt om bedrogen te worden door AI die alleen weet hoe het eenvoudige tests moet doorstaan. Het dwingt de AI om te bewijzen dat het de vreemde, rommelige en lastige echte wereld aankan.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.