← Nieuwste papers
💻 computer science

Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

Dit artikel benchmarkt zeven grote en kleine taalmodellen op het genereren van veilige AWS Terraform-code, waarbij wordt onthuld dat syntactische geldigheid en beveiligingsnaleving grotendeels orthogonale eigenschappen zijn en dat geautomatiseerde multi-tool scanning essentieel blijft, ongeacht de prestaties van het model of prompt engineering-strategieën.

Oorspronkelijke auteurs: Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego Kreutz

Gepubliceerd 2026-08-05
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego Kreutz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, onzichtbare stad in de lucht bouwt, gemaakt van volledig digitale bakstenen. In de echte wereld, als je een huis bouwt met een wankele fundering of de voordeur wagenwijd open laat staan, is dat een ramp. In de digitale wereld wordt deze "stad" de Cloud genoemd, en de blauwdrukken die worden gebruikt om deze te bouwen, zijn geschreven in een speciale taal genaamd Infrastructure-as-Code (IaC). Denk aan IaC als een super-precieet recept dat computers precies vertelt hoe ze servers, opslag en beveiligingssloten moeten opzetten. Lange tijd schreven mensen deze recepten, maar zij maakten vaak fouten, waardoor digitale deuren openstonden en boeven naar binnen konden sluipen.

Onlangs is er een nieuw soort helper gearriveerd: Kunstmatige Intelligentie. Specifiek: Large Language Models (LLM's) en hun kleinere, snellere neefjes, Small Language Models (SLM's). Dit zijn als superintelligente robots die miljoenen recepten kunnen lezen en proberen nieuwe voor jou te schrijven in enkele seconden. De grote vraag op ieders lippen is: Kunnen deze AI-robots recepten schrijven die niet alleen correct zijn (zodat het gebouw niet instort) maar ook veilig (zodat niemand kan inbreken)? Het is een beetje alsof je vraagt of een robotkok een taart kan bakken die lekker smaakt én niet per ongeluk een verborgen bom bevat. Als de AI de syntaxis wel goed krijgt maar de sloten vergeet, is de hele stad in gevaar. Dit is exact het puzzelstuk waar een team onderzoekers uit Brazilië zich op heeft gericht.

De Grote AI-Kok Wedstrijd

De onderzoekers besloten om zeven verschillende AI-koks op de proef te stellen in een gigantische keuken die de "Cloud" wordt genoemd. Ze vroegen de robots niet alleen om een recept te schrijven; ze vroegen hen om 17 verschillende soorten recepten te schrijven voor het bouwen van veilige digitale structuren met behulp van een tool genaamd Terraform. Ze testten drie "Grote Brein"-modellen (de gesloten, dure modellen zoals Claude Opus 4, GPT-5.4 en Gemini 2.5 Pro) en vier "Zakken-Brein"-modellen (de open-source, kleinere modellen zoals WizardCoder en CodeLlama).

Om te zien of de recepten goed waren, keken de onderzoekers niet alleen met hun ogen naar de resultaten. Ze bouwden een superstrakke geautomatiseerde inspectielijn. Eerst controleerden ze of het recept grammaticaal correct was (Syntactische Geldigheid). Als het recept typefouten bevat, zou het gebouw niet eens opstarten. Maar de echte test kwam daarna: ze draaiden twee verschillende beveiligingsscanners, Checkov en Trivy, die fungeren als digitale beveiligers die zoeken naar open ramen, onvergrendelde deuren en verborgen vallen. Ze testten ook of de robots hun eigen fouten konden herstellen wanneer hen werd gezegd: "Hé, je hebt een deur open laten staan," en of het geven van meer gedetailleerde instructies over beveiliging daadwerkelijk hielp.

De Schokkende Resultaten: Goede Grammatica, Slechte Sloten

Hier is de wending die de onderzoekers ontdekten, en het is een behoorlijke plotwending: Het schrijven van een perfect recept en het schrijven van een veilig recept zijn twee totaal verschillende vaardigheden.

Ze ontdekten dat alleen omdat een AI een Terraform-recept kan schrijven dat grammaticaal perfect is en zonder problemen draait, dat betekent dat het recept nog niet veilig is. Sterker nog, de twee vaardigheden staan bijna los van elkaar. Een van de kleinere modellen, WizardCoder-33B, was een kampioen in grammatica. Het schreef 77,8% van de tijd geldige recepten! Maar toen de beveiligingsbewakers diezelfde recepten controleerden, faalde het model bij elke enkele beveiligingscontrole. Het was als een chef die een prachtige, perfect gevormde taart maakte, maar vergat de deksel op de pot met gif te doen.

Aan de andere kant presteerden de "Grote Brein"-modellen veel beter, maar ze hadden nog steeds veel hulp nodig. Het beste presterende model, Claude Opus 4, slaagde er slechts in om ongeveer 23% van de tijd een volledig veilig recept te schrijven wanneer het basisinstructies kreeg. Echter, toen de onderzoekers het een zeer specifieke, gedetailleerde beveiligingschecklist gaven (waarbij precies werd verteld welke sloten geïnstalleerd moesten worden en welke alarmen ingesteld moesten worden), sprong de prestatie naar 92,5% voor één type beveiligingsscanner. Dit bewees dat hoewel de grote breinen in staat zijn tot dit werk, ze het niet juiste niet zullen doen tenzij je ze precies vertelt wat ze moeten doen.

De "Zakken-Breinen" Liepen Tegen een Muur Aan

De kleinere modellen (SLM's) liepen tegen een harde muur aan. Hoeveel de onderzoekers ook probeerden met gedetailleerde beveiligingsinstructies te werken, de kleine modellen konden er simpelweg niet aan voldoen. Ze schreven ofwel een recept dat kapot was, ofwel een geldig recept dat volkomen onveilig was. De onderzoekers ontdekten dat het probleem bij deze kleinere modellen niet de instructies waren; het probleem was dat de modellen simpelweg niet de "hersencapaciteit" hadden om complexe beveiligingsregels te begrijpen. Ze zijn geweldig in het kopiëren van patronen, maar ze worstelen met het zelfstandig bedenken van veilige oplossingen.

Kunnen Ze Hun Eigen Fouten Herstellen?

Het team testte ook of de robots van hun fouten konden leren. Ze lieten de robots een recept schrijven, scan de resultaten, en lieten de robot vervolgens de lijst met fouten zien (zoals "Je bent vergeten dit bestand te versleutelen") en vroegen hen om het opnieuw te proberen.

  • Het Goede Nieuws: De robots waren verrassend goed in het herstellen van eenvoudige, specifieke fouten gevonden door de Trivy-scanner (zoals een ontbrekend slot op een specifieke deur). Veel modellen verbeterden hun scores aanzienlijk nadat ze de foutenlijst hadden gezien.
  • Het Slechte Nieuws: Ze waren erg slecht in het herstellen van de grote, structurele problemen die door de Checkov-scanner werden gevonden. Dit waren problemen zoals "Je moet een heel nieuw beveiligingssysteem bouwen voor dit gebouw." De robots konden hun eigen werk niet in één keer herontwerpen. Ze konden wel een losse schroef aandraaien, maar ze konden de fundering niet herontwerpen.

De Kern van het Verhaal

De belangrijkste les uit dit onderzoek is een waarschuwing voor iedereen die overweegt de AI de digitale steden te laten bouwen: Je kunt de AI niet vertrouwen om de beveiligingsbewaker te zijn.

De onderzoekers ontdekten dat tussen 2024 en 2026 AI-modellen veel beter werden in het schrijven van code die er goed uitziet, maar ze werden niet beter in het schrijven van code die veilig is. Sterker nog, de kloof tussen "ziet er goed uit" en "is veilig" is eigenlijk alleen maar groter geworden.

De studie concludeert dat je niet simpelweg een AI kunt vragen om "het veilig te maken" en dan op het beste te hopen. Zelfs de slimste AI-modellen hebben een mens (of een zeer strikt geautomatiseerd systeem) nodig om hun werk dubbel te controleren. Je moet elke stuk code die de AI genereert door meerdere beveiligingsscanners halen, ongeacht hoe goed het model is of hoe gedetailleerd je instructies waren. De AI is een krachtige assistent, maar in de wereld van cloudbeveiliging is het nog geen vervanging voor een inspecteur. Als je de inspectie overslaat, eindig je misschien met een prachtige, perfect gebouwde digitale stad die geen sloten op de deuren heeft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →