← Neueste Arbeiten
💻 computer science

Stochastic Code, Deterministic Defense: Assessing the Security Blind Spots in GenAI-Driven CI/CD Pipelines

Diese Studie demonstriert empirisch, dass traditionelle deterministische Sicherheitstools versagen, kontextabhängige, syntaktisch valide Schwachstellen zu erkennen, die durch generative KI in CI/CD-Pipelines eingeführt werden, was die dringende Notwendigkeit probabilistischer, intentsensibler Verifizierungsframeworks hervorhebt.

Ursprüngliche Autoren: Mohammed BEDJAOUI, Sidi Mohammed BENSLIMANE, Mohammed Yassine KAZI TANI

Veröffentlicht 2026-08-05
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mohammed BEDJAOUI, Sidi Mohammed BENSLIMANE, Mohammed Yassine KAZI TANI

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Software nicht nur von Menschen geschrieben wird, die auf Tastaturen tippen, sondern statlich von einem superintelligenten Roboter „erträumt“ wird, der das nächste Wort, die nächste Zeile und die nächste Funktion basierend auf dem vorhersagt, was er zuvor gesehen hat. Dies ist das Reich der Generativen KI (oder GenAI), einer Technologie, die die Art und Weise, wie wir digitale Werkzeuge bauen, rasant verändert. In der modernen Tech-Welt werden diese Werkzeuge oft in einer Hochgeschwindigkeitsfabrik namens CI/CD-Pipeline zusammengestellt. Stellen Sie sich diese Pipeline wie ein Förderband vor, auf dem Code geschrieben, getestet, verpackt und in Sekundenschnelle ins Internet verschickt wird.

Jahrelang waren die Sicherheitswächter, die dieses Förderband bewachten, deterministische Scanner. Dies sind wie strenge Türsteher mit einem Klemmbrett voller „verbotener Bewegungen“. Wenn sie ein bestimmtes Muster sehen, das sie als gefährlich kennen – wie ein bekanntes Schlossknacken oder einen verbotenen Zauberspruch – stoppen sie den Code. Sie sind großartig darin, die offensichtlichen Bösewichte zu fangen. Aber hier kommt die Wendung: GenAI kopiert nicht einfach nur alte schlechte Bewegungen; sie erschafft jedes Mal neue Variationen, wie ein Jazzmusiker, der eine Melodie improvisiert. Die große Frage für Wissenschaftler und Ingenieure lautet: Können unsere alten, strengen Türsteher einen Jazzmusiker fangen, der ein Lied spielt, das perfekt klingt, aber heimlich gefährlich ist? Dieses Paper taucht genau in dieses Mysterium ein und fragt, ob unsere aktuellen Sicherheitstools blind für die einzigartigen, unvorhersehbaren Fehler sind, die die KI macht.


Die Geschichte des „Silent Decay“ (Stiller Verfall)

In dieser Studie führten die Forscher Mohammed Bedjaoui, Sidi Mohammed Benslimane und Mohammed Yassine Kazi Tani ein digitales Experiment durch, um zu sehen, was passiert, wenn man einen lokalen KI-Roboter eine Echtzeit-Anwendung schreiben lässt und dann versucht, diesen mit Standard-Sicherheitstools zu überprüfen. Sie haben nicht nur geraten; sie führten eine kontrollierte Simulation 50 Mal durch, wie ein verrückter Wissenschaftler im Labor, um zu sehen, ob die KI eine „schlechte Idee“ an den Sicherheitswächtern vorbeischmuggeln kann.

Das Setup: Ein Roboter-Schreiber und ein strenger Wächter
Das Team baute eine Miniaturversion einer modernen Softwarefabrik. Sie verwendeten ein lokales KI-Modell (einen „Code Llama“-Roboter), um zwei Arten von Code zu schreiben:

  1. Der Logikfehler (V1): Die KI wurde gebeten, eine Sicherheitsprüfung für eine Website zu schreiben. Sie schrieb Code, der perfekt aussah und allen Grammatikregeln folgte, aber sie vergaß einen entscheidenden Schritt: Sie prüfte nicht tatsächlich, ob der Benutzer auch derjenige war, für den er sich ausgab. Es war wie ein Türsteher im Club, der zwar den Ausweis prüft, aber vergisst zu kontrollieren, ob das Foto auch zum Gesicht passt.
  2. Der Infrastruktur-Drift (V3): Die KI wurde gebeten, Anweisungen für einen Server (ein Kubernetes-Manifest) zu schreiben. Sie schrieb Anweisungen, die syntaktisch korrekt aussah, aber einen „Health Check“ (Gesundheitsprüfung) aufsetzte, der zu simpel war. Es war wie ein Arzt, der prüft, ob ein Patient atmet, aber ignoriert, ob dessen Herz schlägt. Der Server würde weiterhin als „lebendig“ gelten, selbst wenn die Software darin komplett defekt wäre.

Der Test: Können die alten Tools die neuen Fehler sehen?
Sobald die KI den Code geschrieben hatte, wurde er durch eine Standard-Sicherheits-Pipeline geschickt, die drei berühmte „Türsteher“ nutzte: Semgrep, Trivy und Kube-linter. Diese Tools sind der Industriestandard und darauf ausgelegt, bekannte Fehler durch das Erkennen spezifischer Muster zu finden.

Die Ergebnisse waren erschreckend. In den 50 Durchläufen des Experiments:

  • Die KI generierte erfolgreich Code, der den Build-Prozess 46 Mal für das Szenario „Logikfehler“ und 48 Mal für das Szenario „Infrastruktur-Drift“ bestand. Der Code war „valide“ genug, um ausgeliefert zu werden.
  • Als die Sicherheitstools diesen Code scannten, konnten sie die Schwachstelle zu 100 % der Zeit nicht erkennen (oder zu 96 % in einem spezifischen Zählaufgang, mit nur 2 Fehlalarmen bei 48).
  • Die statistische Analyse zeigte, dass dies kein bloßer Zufall war; die Wahrscheinlichkeit, dass diese Tools die Fehler durch bloßes Glück übersehen hatten, lag bei weniger als 0,001 (p < .001).

Die große Enthüllung: Die „Blind Spot“ (Blinder Fleck)
Das Paper kommt zu dem Schluss, dass es einen massiven „blinden Fleck“ in unseren aktuellen Sicherheitssystemen gibt. Die KI schrieb keinen „bösen“ Code; sie schrieb Code, der sich auf Funktionalität statt auf Sicherheit konzentrierte. Da der Code alle Grammatikregeln befolgte, sagten die deterministischen Scanner (die Türsteher mit den Klemmbrettern): „Alles in Ordnung!“ und ließen ihn passieren.

Die Forscher nennen dies „Silent Decay“. Es ist ein Szenario, in dem die Softwarefabrik reibungslos weiterläuft, die Lichter grün leuchten und die Sicherheitsalarme niemals schrillend ertönen, aber das Endprodukt fundamental fehlerhaft und unsicher ist. Die Studie schließt explizit die Idee aus, dass diese Tools deshalb versagen, weil der Code zu chaotisch war oder „Halluzinationen“ (Unsinn) enthielt; der Code war sauber, valide und verfehlte lediglich den Punkt der Sicherheit.

Was das bedeutet
Die Autoren argumentieren, dass wir uns nicht mehr auf die alte Art der Code-Prüfung verlassen können. Wenn der Code von einer probabilistischen KI generiert wird (einer, die Ergebnisse schätzt und variiert), wird ein deterministischer Scanner (der nach festen Mustern sucht) immer die subtilen, kontextabhängigen Fehler übersehen. Das Paper schlägt vor, dass wir eine neue Art der Verteidigung benötigen – eine, die die Intention des Codes versteht, nicht nur seine Form. Sie schlagen vor, andere KI-Agenten zur Prüfung des Codes einzusetzen oder „neuro-symbolische“ Methoden zu verwenden, die menschliches Verständnis mit mathematischer Logik kombinieren.

Kurz gesagt: Die Studie beweist, dass im Zeitalter der KI ein „grünes Licht“ von einem Sicherheitsscanner nicht bedeutet, dass der Code sicher ist. Es bedeutet nur, dass der Code auf dem Papier gut aussieht. Die wahre Gefahr verbirgt sich in den Lücken zwischen den Zeilen, wo die Kreativität der KI unser Vermögen zu prüfen überholt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →