← Neueste Arbeiten
🤖 machine learning

Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs

Die Studie zeigt, dass ein autonomer Forschungsprozess mit dem LLM-Agenten Claude Code neue, weiße-Box-Adversarial-Angriffsalgorithmen entdeckt, die bestehende Methoden bei Jailbreak- und Prompt-Injection-Tests signifikant übertreffen und sich hervorragend auf andere Modelle verallgemeinern lassen.

Ursprüngliche Autoren: Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

Veröffentlicht 2026-03-26
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die große Idee: Ein KI-Entdecker, der bessere Schlüssel findet

Stell dir vor, du hast einen riesigen, hochsicheren Tresor (das ist die KI-Sicherheit eines großen Sprachmodells wie ChatGPT oder Claude). Um ihn zu öffnen, brauchst du einen ganz speziellen Schlüssel (einen sogenannten „Jailbreak" oder eine „Adversarial Attack").

Bisher haben Menschen versucht, diese Schlüssel zu erfinden. Sie haben Tausende von Versuchen gemacht, aber die meisten Schlüssel passten nur zu einem bestimmten Tresor oder waren zu grob.

Was diese Studie macht:
Die Forscher haben eine neue KI-Agentin namens Claude Code (ein Programmier-Assistent von Anthropic) beauftragt, nicht einen Schlüssel zu schreiben, sondern einen Maschinenbau-Plan für einen besseren Schlüsselhersteller zu entwickeln.

Stell dir vor, statt selbst einen Schlüssel zu schmieden, gibt die KI einem Roboter-Handwerker den Auftrag: „Baue eine Maschine, die Schlüssel herstellt, und verbessere diese Maschine jeden Tag selbst, bis sie die perfekten Schlüssel baut."

Das ist das „Autoresearch"-Konzept: Die KI forscht autonom, schreibt ihren eigenen Code, testet ihn, sieht, wo er scheitert, und baut ihn dann besser.

Die Reise der KI (Das Experiment)

Die Studie hat zwei große Abenteuer erzählt:

1. Der Spezialist (Einzelnes Modell knacken)

Zuerst hat die KI versucht, einen ganz spezifischen, sehr sicheren Tresor zu knacken (ein Modell namens GPT-OSS-Safeguard).

  • Das Problem: Die alten menschlichen Methoden (wie GCG oder TAO) schafften es nur in 10 % der Fälle, den Tresor zu öffnen.
  • Die Lösung: Die KI hat über Wochen hinweg tausende kleine Verbesserungen an ihrem Schlüssel-Algorithmus vorgenommen. Sie hat Ideen aus verschiedenen alten Methoden gemischt (wie einen Mixer, der Zutaten aus verschiedenen Rezepten kombiniert).
  • Das Ergebnis: Die von der KI erfundenen neuen Methoden schafften es in 40 % der Fälle, den Tresor zu öffnen. Das ist eine massive Steigerung!

2. Der Generalist (Der universelle Meister)

Dann wurde es noch spannender. Die KI sollte nicht nur einen Tresor knacken, sondern einen universellen Master-Key entwickeln, der bei allen Tresoren funktioniert, auch bei solchen, die sie noch nie gesehen hat.

  • Der Trick: Die KI hat nicht an echten Sicherheitsfragen geübt, sondern an völlig zufälligen, sinnlosen Zeichenfolgen (wie das Auswendiglernen von zufälligen Buchstabenreihen). Das zwingt die KI, die Grundprinzipien des Öffnens zu verstehen, anstatt nur Tricks für eine bestimmte Frage zu lernen.
  • Der Test: Als die KI dann gegen einen völlig neuen, extrem gut gesicherten Tresor (Meta-SecAlign-70B) antrat, den sie nie vorher gesehen hatte, passierte etwas Erstaunliches:
    • Die besten menschlichen Methoden schafften es nur zu 56 %.
    • Die von der KI erfundenen Methoden schafften es in 100 % der Fälle. Sie haben den Tresor komplett geöffnet.

Wie funktioniert das eigentlich? (Die Metapher des „Lego-Architekten")

Stell dir vor, die KI ist ein Lego-Architekt, der versucht, eine Mauer (die KI-Sicherheit) zu durchbrechen.

  1. Zusammensetzen (Rekombination): Die KI nimmt Bausteine von alten, bekannten Methoden (z. B. „Momentum" aus einem alten Set und „Cosine-Similarity" aus einem anderen) und baut daraus eine neue, effizientere Maschine.
  2. Feinjustierung (Hyperparameter-Tuning): Sie dreht an kleinen Schrauben: „Was passiert, wenn ich die Lernrate etwas höher setze? Oder wenn ich den Temperatur-Wert ändere?" Sie testet tausende Kombinationen.
  3. Ausbrechen aus der Sackgasse (Escape Mechanisms): Manchmal bleibt die KI in einer lokalen Sackgasse stecken (sie findet einen Schlüssel, der fast passt, aber nicht ganz). Dann fügt sie einen „Notfall-Plan" hinzu: Sie wirft die Bausteine kurzzeitig wild durcheinander, um einen neuen Weg zu finden, und behält nur die Verbesserungen.

Was bedeutet das für uns?

Die Studie zeigt zwei wichtige Dinge:

  1. Sicherheit ist schwerer als gedacht: Wenn eine KI, die nur Code schreibt, in der Lage ist, bessere Angriffsmethoden zu erfinden als die besten menschlichen Sicherheitsexperten, dann sind unsere aktuellen Sicherheitsvorkehrungen vielleicht nicht so robust, wie wir dachten.
  2. Die Zukunft der Forschung: Wir können KI-Agenten nutzen, um unsere Sicherheit zu testen. Statt zu warten, bis ein Hacker einen neuen Weg findet, können wir unsere eigenen KIs anweisen, sofort nach Schwachstellen zu suchen. Das nennt man „Adaptive Red Teaming" (ein fortlaufender, automatisierter Sicherheitscheck).

Fazit

Die Studie „Claudini" ist wie ein Beweisstück dafür, dass KI-Agenten nicht nur Aufgaben ausführen, sondern Forschung betreiben können. Sie haben gezeigt, dass wir durch automatisiertes, selbstständiges Experimentieren (Autoresearch) viel schneller neue Erkenntnisse gewinnen können – sowohl für das Knacken von Sicherheitslücken als auch (hoffentlich bald) für das Schließen derselben.

Kurz gesagt: Eine KI hat eine andere KI so lange „geärgert", bis sie die perfekte Methode gefunden hat, um deren Schutzmechanismen zu umgehen – und das alles, ohne dass ein Mensch dabei einen einzigen Code-Zeile geschrieben hat.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →