← Nieuwste papers
🤖 AI

DualGauge: Automated Joint Security-Functionality Benchmarking of Specification-Only Code Generation by LLMs and Coding Agents

Het artikel introduceert DualGauge, een geautomatiseerd framework en benchmark die aantoont dat huidige LLM's en programmeeragenten moeite hebben met het gelijktijdig genereren van code die zowel functioneel correct als veilig is, waarbij de gezamenlijke succespercentages onder de 15% blijven over meerdere talen en onthullend dat verbeterde modelcapaciteiten of iteratieve scaffolding de spanning tussen beveiliging en functionaliteit niet betrouwbaar oplossen.

Oorspronkelijke auteurs: Rupam Patir, Keyan Guo, Suvadra Barua, Abhijeet Pathak, Dinesh Gudimetla, Jiawei Guo, Hongxin Hu, Haipeng Cai

Gepubliceerd 2026-06-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rupam Patir, Keyan Guo, Suvadra Barua, Abhijeet Pathak, Dinesh Gudimetla, Jiawei Guo, Hongxin Hu, Haipeng Cai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer getalenteerde, snel pratende robotchef inhuurt om een maaltijd te bereiden op basis van een eenvoudige verbale beschrijving: "Maak een sandwich."

Een lange tijd hebben we alleen gecontroleerd of de robot het recept volgde. Heeft hij brood op het bord gelegd? Ja. Heeft hij ham toegevoegd? Ja. Als de sandwich er goed uitziet, zeggen we: "Goed gedaan!"

Maar dit nieuwe paper, DualGauge, stelt een veel moeilijkere vraag: "Is de sandwich veilig om te eten?"

Misschien heeft de robot het recept perfect gevolgd, maar heeft hij per ongeluk ook de ham gesneden met een roestig mes dat hij in de lade vond, of heeft hij een snijplank gebruikt die nooit is schoongemaakt. De sandwich lijkt op een sandwich, maar hij is gevaarlijk.

Dit is het verhaal van wat de onderzoekers ontdekten, eenvoudig uitgelegd.

1. Het Probleem: De "Ziet Er Goed Uit"-valstrik

De onderzoekers ontdekten dat huidige AI-coderingstools (zoals de robotchef) geweldig zijn in het maken van dingen die eruitzien alsof ze werken, maar ze zijn verschrikkelijk in het maken van dingen die daadwerkelijk veilig zijn.

Ze bouwden een nieuw testsysteem genaamd DualGauge. Denk aan dit als een "Dubbelcheck-Keuken."

  • De Oude Manier: Je proeft de sandwich. Als het naar ham smaakt, slaag je voor de test.
  • De DualGauge-Manier: Je proeft de sandwich (Functionaliteit), EN je inspecteert de keuken op roestige messen, vuile planken en gif (Beveiliging).

2. De Benchmark: De "307 Sandwichbestellingen"

Om dit te testen, creëerden ze een enorme menukaart van 307 verschillende taken.

  • Elke taak was slechts een eenvoudige zin, zoals "Schrijf een programma dat een bestand leest."
  • Ze gaven de AI geen hints, codestukken of veiligheidswaarschuwingen. Alleen de bestelling.
  • Voor elke bestelling maakten ze twee sets tests:
    1. De Smaaktest: Doet het programma wat het moet doen?
    2. De Veiligheidsinspectie: Probeert het programma bestanden te stelen, het systeem te laten crashen of hackers binnen te laten?

3. De Schokkende Resultaten

Ze vroegen 10 van de slimste AI-modellen (de "chefs") om deze 307 sandwiches te maken. Dit is wat er gebeurde:

  • De "Ziet Er Goed Uit"-score was hoog: Veel modellen kregen ongeveer 39% van de sandwiches goed qua smaak. Ze volgden het recept!
  • De "Veilig"-score was laag: Bij het controleren op veiligheid daalden de scores.
  • De "Perfecte"-score was Minuscuul: Wanneer ze vroegen: "Heb je een sandwich gemaakt die goed smaakt EN veilig is?", haalde het beste AI-model minder dan 15% goed.

De Analogie: Stel je een student voor die een wiskundetoets maakt. Hij krijgt 90% van de antwoorden goed (Functionele Correctheid). Maar als je vraagt: "Heb je ook je werk gecontroleerd op rekenfouten?", dan zakt hij. Het paper vond dat goed zijn in coderen niet automatisch betekent dat je goed bent in veilig coderen.

4. Waarom "Harder Denken" Niet Hielp

De onderzoekers probeerden het probleem op te lossen door de AI meer hulpmiddelen te geven, net zoals je een chef betere messen geeft of meer tijd laat om na te denken. Ze probeerden:

  • Grotere Modellen: Het gebruik van "super-chefs" (grotere AI-hersenen).
  • Verlengd Denken: De AI vertellen: "Neem de tijd en denk stap voor stap."
  • Gespecialiseerde Training: De AI specifiek leren hoe een programmeur te zijn.

Het Resultaat: Geen van deze trucjes loste het veiligheidsprobleem betrouwbaar op. Soms werd de AI beter in het recept, maar vergat het nog steeds de snijplank schoon te maken. Soms werd het beter in veiligheid, maar vergat het het recept. Veiligheid en Functionaliteit zijn twee verschillende vaardigheden die niet altijd samen groeien.

5. De "Robotassistent" Hielp Ook Niet

Er zijn nieuwe AI-tools die fungeren als "agents". In plaats van alleen de code één keer te schrijven, proberen ze hun eigen fouten te herstellen. Ze schrijven code, draaien het, zien een fout, en proberen het opnieuw.

De onderzoekers ontdekten dat op deze "pure recept"-taken, de agents niet beter presteerden dan de eenvoudige robots.

  • Waarom? De agents besteedden al hun tijd aan het zoeken naar gereedschap in de keuken (zoals het zoeken naar een specifiek bestand of het opzetten van een server) in plaats van het daadwerkelijk herstellen van de veiligheid van de sandwich. Ze waren druk bezig met het "managen van de keuken" maar niet met het "veilig koken."

6. Het "Verborgen Gevaar"

Het paper vond een specifiek patroon in waarom de AI faalde.

  • Functionele Fouten: De AI faalde meestal omdat het de "vorm" van het antwoord fout had (bijv. het leverde het verkeerde type data).
  • Beveiligingsfouten: De AI probeerde meestal wel veilig te zijn, maar het was onvolledig.
    • Voorbeeld: De AI plaatste een slot op de deur (een beveiligingsbewaker), maar vergat het achterste raam te vergrendelen. De bewaker zag er goed uit, maar het huis was nog steeds onveilig.

De Kernboodschap

Het paper concludeert dat we AI niet simpelweg kunnen vertrouwen omdat het code schrijft die "werkt."

  • Functionele correctheid is een slechte leugendetector voor veiligheid. Alleen omdat code draait zonder te crashen, betekent niet dat het veilig is.
  • We hebben een nieuwe standaard nodig. We moeten testen op veiligheid en functionaliteit tegelijkertijd, met dezelfde regels.
  • Huidige AI is er nog niet. Zelfs de slimste modellen slagen er niet in om consistent code te produceren die zowel nuttig als veilig is.

Kortom: Alleen omdat de robotchef een sandwich heeft gemaakt die er heerlijk uitziet, betekent niet dat je hem moet eten. We moeten ook de keuken controleren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →