← Neueste Arbeiten
🤖 AI

Security of LLM-generated Code: A Comparative Analysis

Diese Arbeit evaluiert empirisch die Sicherheit von Code, der von sieben populären Large Language Models generiert wurde, und stellt fest, dass alle von ihnen Code mit Sicherheitslücken produzieren, wobei die Mehrheit davon kritische oder hohe Schweregrade aufweist.

Ursprüngliche Autoren: Srivathsan G Morkonda, Mahmoud Selim, Hala Assal

Veröffentlicht 2026-05-25
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Srivathsan G Morkonda, Mahmoud Selim, Hala Assal

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben ein Team von sieben verschiedenen „superintelligenten" Lehrlingen engagiert, um Code für Ihre Software zu schreiben. Diese Lehrlinge werden durch Künstliche Intelligenz (KI) angetrieben und sind dafür bekannt, unglaublich schnell und hilfsbereit zu sein. Sie sind die führenden Tools der Branche, die von Millionen von Entwicklern genutzt werden.

Die Forscher der Carleton University beschlossen, diese sieben Lehrlinge einem strengen Test zu unterziehen. Sie baten sie nicht, ein Raumschiff zu bauen oder einen Roman zu schreiben; sie gaben ihnen einen spezifischen Satz von 81 gängigen Codierungsaufgaben – wie „erstellen Sie eine Anmeldeseite" oder „ermöglichen Sie einem Benutzer, ein Foto hochzuladen". Das Ziel war es, festzustellen, ob der Code, den diese KI-Lehrlinge schrieben, sicher zu verwenden war, oder ob er voller versteckter Fallen steckte.

Hier ist das Ergebnis, einfach aufgeschlüsselt:

1. Der „perfekte" Lehrling existiert nicht

Die schockierendste Entdeckung? Keiner der sieben Lehrlinge bestand den Test. Jedes einzelne getestete KI-Tool (einschließlich großer Namen wie OpenAIs GPT-4o, Googles Gemini und IBMs watsonx) produzierte Code mit Sicherheitslücken.

Stellen Sie sich vor, Sie kaufen ein Auto von sieben verschiedenen berühmten Herstellern. Sie würden erwarten, dass mindestens eines von ihnen eine perfekte Sicherheitsbewertung hat. Stattdessen stellten die Forscher fest, dass jedes einzelne Auto eine defekte Bremse oder ein loses Lenkrad hatte. Tatsächlich wies die überwiegende Mehrheit des von ihnen geschriebenen Codes „kritische" oder „hohe" Schweregrade von Fehlern auf – das bedeutet, dies sind keine bloßen Kratzer; es sind klaffende Löcher, die Hackern den Eintritt ermöglichen könnten.

2. Die „Fallen" in den Anweisungen

Die Forscher verwendeten einen speziellen Satz von Anweisungen (Prompts), der die KI dazu bringen sollte, Fehler zu machen. Zum Beispiel baten sie eine KI, „eine Funktion zu schreiben, die einem Benutzer das Hochladen einer Datei ermöglicht".

  • Der KI-Fehler: Einige KIs schrieben Code, der einem Hacker erlauben würde, einen Virus statt eines Fotos hochzuladen.
  • Die Überraschung: Selbst wenn die KI die Hauptaufgabe richtig erledigte, vergaß sie oft die Sicherheitsregeln. Zum Beispiel schrieb eine KI eine Anmeldeseite, die perfekt funktionierte, aber Passwörter im Klartext speicherte (wie wenn Sie Ihr Passwort auf einem Haftnotizzettel auf Ihrem Computer aufschreiben würden).

3. Die „Debug-Modus"-Katastrophe

Einer der häufigsten gefundenen Fehler war das Offenlassen des „Debug-Modus".

  • Die Analogie: Stellen Sie sich eine Restaurantküche vor. „Debug-Modus" ist wie das weit offene Hintertür mit einem Schild, das sagt: „Kommen Sie herein und schauen Sie sich unsere geheimen Rezepte an und probieren Sie den Herd aus." Das ist großartig für den Koch, wenn er lernt, aber schrecklich für ein echtes Restaurant, das für die Öffentlichkeit geöffnet ist.
  • Die Realität: Die KI schrieb weiterhin Code, der diese „Hintertür" offen ließ. Wenn ein Entwickler diesen Code ohne Prüfung verwendete, könnte sein gesamtes System gehackt werden. Die Forscher stellten fest, dass einige KI-Tools zwar einen winzigen Kommentar hinzufügten mit der Aufschrift „Schalten Sie dies für den echten Einsatz aus", man sich jedoch nicht darauf verlassen konnte, dass Entwickler diesen Hinweis tatsächlich lesen und befolgen würden.

4. Das „schnell aber gefährlich"-Paradoxon

Die Studie fand ein seltsames Muster bei einem bestimmten Tool, IBMs watsonx.

  • Die Analogie: Stellen Sie sich einen Lehrling vor, der sehr kurze, einfache Sätze schreibt (kurzer Code). Man könnte denken: „Kurze Sätze sind leichter zu prüfen, also müssen sie sicherer sein."
  • Die Realität: Dieser Lehrling hatte tatsächlich die höchste Rate an gefährlichen Fehlern pro Codezeile. Da der Code so kurz war, übersprang er wichtige Sicherheitsprüfungen vollständig. Es war wie ein Fahrer, der wegen Eile einen Abkürzungsweg durch ein Minenfeld nimmt.

5. Der „übermütige" Entwickler

Das Papier hebt ein gefährliches menschliches Element hervor. Entwickler lieben diese KI-Tools, weil sie die Arbeit beschleunigen. Die Studie legt jedoch nahe, dass Entwickler zu vertrauensselig werden.

  • Die Analogie: Es ist wie ein Fahrer, der ein Auto mit einer „Selbstfahr"-Funktion kauft und dann am Steuer einschläft, in der Annahme, das Auto werde nie einen Unfall bauen.
  • Die Realität: Die KI-Tools sind so gut darin, selbstbewusst zu klingen, dass Entwickler davon ausgehen, der Code sei sicher. Die Forscher stellten fest, dass über 73 % der von diesen Tools generierten Code-Schnipsel mindestens einen Sicherheitsfehler enthielten. Wenn ein Entwickler diesen Code einfach kopiert und einfügt, ohne ihn zu prüfen, lädt er im Grunde Ärger ein.

Das Fazit

Das Papier kommt zu dem Schluss, dass diese KI-Tools zwar hervorragend darin sind, schnell Code zu schreiben, aber derzeit schrecklich darin sind, standardmäßig sicheren Code zu schreiben.

Sie sind wie ein sehr talentierter, aber unerfahrener Koch, der Gemüse schneller schneidet als jeder andere, aber ständig vergisst, sich die Hände zu waschen oder zu prüfen, ob das Essen verdorben ist. Die Forscher warnen, dass es, bis diese KI-Tools darin unterrichtet werden, Sicherheit vor Geschwindigkeit zu priorisieren (oder bis Entwickler lernen, jede einzelne Zeile zu überprüfen), ein riskantes Wagnis ist, sie zur Softwareentwicklung einzusetzen.

Die Kernaussage: Vertrauen Sie der KI nicht blind. Behandeln Sie den von ihr generierten Code wie einen Entwurf eines Junior-Mitarbeiters: Er muss von einem senior Sicherheitsexperten überprüft werden, bevor er live geht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →