Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation
Dieses Paper benchmarkt sieben große und kleine Sprachmodelle bei der Generierung von sicherem AWS-Terraform-Code und zeigt auf, dass syntaktische Validität und Sicherheitskonformität weitgehend orthogonale Eigenschaften sind und dass automatisierte Multi-Tool-Scans unabhängig von Modellleistung oder Prompt-Engineering-Strategien essenziell bleiben.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie bauen eine riesige, unsichtbare Stadt im Himmel, die vollständig aus digitalen Ziegeln besteht. In der realen Welt, wenn man ein Haus mit einem wackeligen Fundament baut oder die Haustür weit offen lässt, ist das eine Katastrophe. In der digitalen Welt wird diese „Stadt“ als „Cloud“ bezeichnet, und die Blaupausen, die zum Bau dieser Stadt verwendet werden, sind in einer speziellen Sprache geschrieben, die sich „Infrastructure-as-Code“ (IaC) nennt. Denken Sie an IaC als ein superpräzises Rezept, das Computern genau sagt, wie sie Server, Speicher und Sicherheitschlösser einrichten sollen. Lange Zeit haben Menschen diese Rezepte geschrieben, aber sie machten oft Fehler, ließen digitale Türen unverschlossen und ermöglichten es Bösewichten, sich heranzuschleichen.
Kürzlich ist eine neue Art von Helfer eingetroffen: Künstliche Intelligenz. Speziell Large Language Models (LLMs) und ihre kleineren, schnelleren Cousins, Small Language Models (SLMs). Dies sind wie superintelligente Roboter, die Millionen von Rezepten lesen und versuchen können, in Sekundenschnelle neue Rezepte für Sie zu schreiben. Die große Frage, die alle beschäftigt, war: Können diese KI-Roboter Rezepte schreiben, die nicht nur korrekt sind (damit das Gebäude nicht einstürzt), sondern auch sicher (damit niemand einbrechen kann)? Es ist ein bisschen so, als würde man fragen, ob ein Roboter-Koch einen Kuchen backen kann, der gut schmeckt und nicht versehentlich eine versteckte Bombe enthält. Wenn die KI die Syntax richtig hinbekommt, aber die Schlösser vergisst, ist die ganze Stadt in Gefahr. Dies ist genau das Rätsel, das ein Forscherteam aus Brasilien zu lösen versuchte.
Der große KI-Koch-Wettbewerb
Die Forscher beschlossen, sieben verschiedene KI-Köche in einer riesigen Küche namens „Cloud“ auf die Probe zu stellen. Sie baten die Roboter nicht nur, ein Rezept zu schreiben; sie baten sie, 17 verschiedene Arten von Rezepten für den Bau sicherer digitaler Strukturen unter Verwendung eines Werkzeugs namens Terraform zu schreiben. Sie testeten drei „Big Brain“-Modelle (die geschlossenen, teuren Modelle wie Claude Opus 4, GPT-5.4 und Gemini 2.5 Pro) und vier „Pocket Brain“-Modelle (die Open-Source-, kleineren Modelle wie WizardCoder und CodeLlama).
Um zu sehen, ob die Rezepte gut waren, betrachtete das Team sie nicht einfach nur mit den Augen. Sie bauten eine superstrenge automatisierte Inspektionslinie auf. Zuerst prüften sie, ob das Rezept grammatikalisch korrekt war (Syntaktische Validität). Wenn das Rezept Tippfehler hatte, würde das Gebäude gar nicht erst starten. Aber der wahre Test kam als Nächstes: Sie ließen zwei verschiedene Sicherheitsscanner laufen, Checkov und Trivy, die wie digitale Sicherheitswächter fungieren und nach offenen Fenstern, unverschlossenen Türen und versteckten Fallen suchen. Sie testeten auch, ob die Roboter ihre eigenen Fehler korrigieren konnten, wenn man ihnen sagte: „Hey, du hast eine Tür offen gelassen“, und ob es tatsächlich half, ihnen detailliertere Anweisungen zur Sicherheit zu geben.
Die schockierenden Ergebnisse: Gute Grammatik, schlechte Schlösser
Hier ist die Wendung, die die Forscher fanden, und es ist ein echter Plot-Twist: Ein perfektes Rezept zu schreiben und ein sicheres Rezept zu schreiben, sind zwei völlig unterschiedliche Fähigkeiten.
Sie entdeckten, dass nur weil eine KI ein Terraform-Rezept schreiben kann, das grammatikalisch perfekt ist und ohne Absturz läuft, das Rezept noch lange nicht sicher ist. Tatsächlich sind die beiden Fähigkeiten fast völlig unzusammenhängend. Eines der kleineren Modelle, WizardCoder-33B, war ein Grammatik-Champion. Es schrieb 77,8 % der Zeit gültige Rezepte! Aber als die Sicherheitswächter dieselben Rezepte überprüften, scheiterte das Modell an jeder einzelnen Sicherheitsprüfung. Es war wie ein Koch, der einen wunderschönen, perfekt geformten Kuchen gebacken hat, aber vergessen hat, den Deckel auf dem Glas mit dem Gift zu schließen.
Auf der anderen Seite schnitten die „Big Brain“-Modelle viel besser ab, aber sie brauchten immer noch viel Hilfe. Das beste Modell, Claude Opus 4, schaffte es nur etwa 23 % der Zeit, ein vollständig sicheres Rezept zu schreiben, wenn es nur grundlegende Anweisungen erhielt. Doch als die Forscher ihm eine sehr spezifische, detaillierte Sicherheits-Checkliste gaben (indem sie ihm genau sagten, welche Schlösser er installieren und welche Alarme er aktivieren sollte), sprang seine Leistung bei einem Typ von Sicherheitsscanner auf 92,5 %. Dies bewies, dass die „großen Gehirne“ zwar fähig sind, aber sie werden nicht das Richtige tun, wenn man ihnen nicht genau sagt, was sie tun sollen.
Die „Pocket Brains“ stoßen an eine Wand
Die kleineren Modelle (SLMs) stießen auf eine harte Wand. Egal, wie sehr die Forscher versuchten, ihnen detaillierte Sicherheitsanweisungen zu geben, die kleineren Modelle konnten nicht folgen. Sie schrieben entweder ein Rezept, das fehlerhaft war, oder sie schrieben ein gültiges Rezept, das jedoch völlig unsicher war. Die Forscher fanden heraus, dass das Problem bei den kleineren Modellen nicht die Anweisungen waren, sondern dass die Modelle schlichtweg nicht über die „Gehirnschmalz“ verfügten, um komplexe Sicherheitsregeln zu verstehen. Sie sind gut darin, Muster zu kopieren, aber sie haben Schwierigkeiten, von sich aus sichere Lösungen zu erfinden.
Können sie ihre eigenen Fehler korrigieren?
Das Team testete auch, ob die Roboter aus ihren Fehlern lernen können. Sie ließen die Roboter ein Rezept schreiben, scannten es und zeigten dem Roboter dann die Liste der Fehler (wie „Du hast vergessen, diese Datei zu verschlüsseln“) und baten ihn, es erneut zu versuchen.
- Die gute Nachricht: Die Roboter waren überraschend gut darin, einfache, spezifische Fehler des Trivy-Scanners zu beheben (wie ein fehlendes Schloss an einer bestimmten Tür). Viele Modelle verbesserten ihre Scores deutlich, nachdem sie die Fehlerliste gesehen hatten.
- Die schlechte Nachricht: Sie waren schlecht darin, die großen, strukturellen Probleme zu beheben, die der Checkov-Scanner fand. Dies waren Probleme wie „Du musst ein ganz neues Sicherheitssystem für dieses Gebäude bauen“. Die Roboter konnten ihre eigene Architektur nicht in einem Schritt umgestalten. Sie konnten eine lockere Schraube festziehen, aber sie konnten nicht das Fundament neu entwerfen.
Das Fazit
Das wichtigste Learning aus dieser Studie ist eine Warnung für jeden, der denkt, die KI beim Bau seiner digitalen Städte ansetzen zu lassen: Man kann der KI nicht vertrauen, der Sicherheitswächter zu sein.
Die Forscher fanden heraus, dass KI-Modelle zwischen 2024 und 2026 viel besser darin wurden, Code zu schreiben, der richtig aussieht, aber sie wurden nicht besser darin, Code zu schreiben, der sicher ist. Tatsächlich hat sich die Lücke zwischen „sieht gut aus“ und „ist sicher“ sogar vergrößert.
Die Studie kommt zu dem Schluss, dass man nicht einfach eine KI fragen kann, „mache es sicher“, und dann auf das Beste hoffen kann. Selbst die klügsten KI-Modelle benötigen einen Menschen (oder ein sehr strenges automatisiertes System), der ihre Arbeit doppelt prüft. Man muss jeden Teil des Codes, den die KI generiert, mit mehreren Sicherheitsscannern überprüfen, egal wie gut das Modell ist oder wie detailliert die Anweisungen waren. Die KI ist ein mächtiger Assistent, aber in der Welt der Cloud-Sicherheit ist sie noch kein Ersatz für einen Sicherheitsinspektor. Wenn man die Inspektion überspringt, könnte man am Ende eine wunderschöne, perfekt gebaute digitale Stadt haben, die keine Schlösser an den Türen besitzt.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.