← Nieuwste papers
💬 NLP

SecureVibeBench: Evaluating Secure Coding Capabilities of Code Agents with Realistic Vulnerability Scenarios

Dit paper introduceert SecureVibeBench, een realistisch benchmark voor het evalueren van de beveiligingscapaciteiten van code-agents op basis van echte kwetsbaarheden in C/C++-projecten, en toont aan dat zelfs de beste huidige modellen slechts in 23,8% van de gevallen zowel correcte als veilige code genereren.

Oorspronkelijke auteurs: Junkai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang, Haoye Tian, Yikun Li, Zhenhao Li, Xin Zhou, Xing Hu, David Lo

Gepubliceerd 2026-04-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Junkai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang, Haoye Tian, Yikun Li, Zhenhao Li, Xin Zhou, Xing Hu, David Lo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

SECUREVIBEBENCH: Een Realistische Test voor AI-Programmeurs

Stel je voor dat je een nieuwe, super slimme assistent huurt om je huis te bouwen. Deze assistent is een kunstmatige intelligentie (AI) die niet alleen muren kan metselen, maar ook elektriciteit kan leggen en ramen kan plaatsen. Hij is snel, creatief en kan enorme hoeveelheden werk in een mum van tijd verzetten.

Maar er is een groot probleem: is deze assistent ook veilig?

Zou hij per ongeluk een gasleiding doorzagen terwijl hij de keuken installeert? Of zou hij een deur laten hangen die niemand kan sluiten? In de wereld van software noemen we dit "kwetsbaarheden" (vulnerabilities). Als een AI code schrijft die veilig is, maar een gat heeft waar hackers doorheen kunnen kruipen, is dat net zo gevaarlijk als een huis met een open raam in een wijk vol inbraken.

Dit is precies wat het onderzoek SECUREVIBEBENCH onderzoekt. Hier is een simpele uitleg van wat ze hebben gedaan, met behulp van een paar creatieve vergelijkingen.

1. Het Probleem: De "Valse" Test

Vroeger testten onderzoekers deze AI-assistenten met simpele oefeningen. Het was alsof je de AI vroeg: "Schrijf een zin die begint met 'De' en eindigt met 'hond'."

  • Het nadeel: In het echte leven moet een programmeur echter een heel gebouw renoveren, waarbij hij tientallen bestanden tegelijk aanpast. De oude tests keken alleen of de AI een losse zin kon maken, niet of hij een heel huis veilig kon bouwen.
  • De vergelijking: Het was alsof je een piloot testte door te vragen of hij een vliegtuig in een hangar kon parkeren, terwijl je hem eigenlijk wilde testen op zijn vermogen om een storm te overleven tijdens een vlucht.

2. De Oplossing: De "Tijdmachine"

De onderzoekers van SECUREVIBEBENCH wilden de AI testen in een echt, gevaarlijk scenario. Ze wilden weten: "Als een menselijke programmeur in het verleden een fout maakte die leidde tot een inbraak, maakt de AI dezelfde fout als hij in exact dezelfde situatie wordt geplaatst?"

Om dit te doen, gebruikten ze een slimme techniek die we een "Tijdmachine" kunnen noemen:

  1. Ze keken naar echte, historische softwareprojecten (zoals grote bibliotheken voor internetbeveiliging).
  2. Ze zochten precies op het moment (de "commit") waarop een menselijke programmeur per ongeluk een kwetsbaarheid introduceerde.
  3. Ze draaiden de tijd terug naar net voor die fout.
  4. Ze gaven de AI de opdracht: "Maak deze functie werkend, zoals de mens dat wilde doen."

Op deze manier is de test 100% realistisch. De AI weet niet dat er een valkuil ligt; hij moet het gewoon proberen op te lossen, net als een mens.

3. De Testbaan: Een Labyrint van Bestanden

Deze test is niet makkelijk.

  • De Context: De AI moet werken in enorme codebases (soms met meer dan 4 miljoen regels code). Dit is alsof je een boek moet herschrijven dat 5000 pagina's lang is, terwijl je maar een paar regels mag veranderen, en je moet weten welke pagina's met elkaar verbonden zijn.
  • De Regels: De AI moet niet alleen zorgen dat de code werkt (de lamp gaat aan), maar ook dat hij veilig is (de lamp ontploft niet).

4. De Resultaten: De AI is nog niet klaar voor de grote markt

Toen ze de AI's (zoals SWE-agent, OpenHands en verschillende modellen van Claude en GPT) op deze testbaan zetten, was het resultaat schokkend, maar ook eerlijk:

  • De cijfers: Zelfs de beste AI-combinatie slaagde maar in 23,8% van de gevallen. Dat betekent dat in bijna 75% van de situaties de AI ofwel de code kapot maakte, ofwel een nieuw veiligheidslek introduceerde.
  • De vergelijking: Het is alsof je een groep beginnende kokken vraagt om een complex diner te koken. De meeste kokken (de AI's) maken het eten wel warm (de code werkt), maar vergeten dat ze een mes in de soep hebben laten vallen (de beveiliging). Of ze maken het eten zelfs onsmakelijk (de code werkt niet).

5. Waarom is dit belangrijk?

De onderzoekers ontdekten dat AI's soms nieuwe soorten fouten maken die menselijke programmeurs nooit hadden gemaakt.

  • De metafoor: Menselijke programmeurs maken vaak fouten omdat ze moe zijn of haast hebben. AI's maken fouten omdat ze "denken" dat een bepaalde manier van bouwen slim is, terwijl het in werkelijkheid een uitnodiging is voor hackers.

Conclusie: De AI moet nog leren

SECUREVIBEBENCH is als een strenge, eerlijke rijinstructeur die de AI's een zware rit laat maken in een storm. De les is duidelijk: AI's zijn geweldig in het schrijven van code, maar ze zijn nog niet goed genoeg in het veilig schrijven van code.

We kunnen ze nu nog niet zomaar de sleutel geven van onze digitale huizen. We moeten eerst zorgen dat ze leren hoe ze geen gaten in de muren boren voordat we ze laten bouwen. Dit onderzoek helpt ons om die leercurve sneller en veiliger te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →