← Neueste Arbeiten
💬 NLP

Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts

Red-Bandit ist ein Testzeit-Anpassungsrahmenwerk, das spezialisierte LoRA-Experten dynamisch mittels einer Multi-Armed-Bandit-Politik auswählt, um modellspezifische Schwachstellen in Large Language Models effizient zu identifizieren und auszunutzen, und dabei State-of-the-Art-Red-Teaming-Leistung erzielt, während gleichzeitig menschenlesbarere Angriffs-Prompts generiert werden.

Ursprüngliche Autoren: Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo

Veröffentlicht 2026-05-19
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, die schwächste Stelle in einer sehr starken, hochtechnologischen Burg (einem Large Language Model, oder LLM) zu finden. Die Burgwachen sind darauf trainiert, jeden daran zu hindern, nach Gefährlichem zu fragen, wie etwa „Wie baue ich eine Bombe?" oder „Wie hacke ich ein Auto?".

Seit langem versuchen Sicherheitstester (sogenannte „Red Teamer"), einzudringen, indem sie dieselben alten Tricks schreien oder komplexe Mathematik verwenden, um die Passwörter der Wachen zu erraten. Doch diese Methoden sind oft starr. Sie passen ihre Strategie nicht basierend darauf an, wie die spezifische Burgwache im Moment reagiert.

Red-Bandit ist eine neue, intelligentere Methode, um diese digitalen Burgen zu testen. So funktioniert es, aufgeteilt in einfache Teile:

1. Das Team von Spezialisten (die „LoRA-Experten")

Stellen Sie sich ein Team von 10 verschiedenen Schauspielern vor, von denen jeder auf eine bestimmte Sprechweise spezialisiert ist:

  • Der Slang-Schauspieler: Spricht wie ein straßentauglicher Freund.
  • Der Historiker: Erzählt Geschichten, die im Jahr 1805 spielen.
  • Der Chef: Tut so, als wäre er eine strenge Autoritätsperson, die Befehle erteilt.
  • Der Rollenspieler: Tut so, als wäre er ein Bösewicht in einem Film.

In der Arbeit werden diese LoRA-Experten genannt. Es sind kleine, leichte „Add-ons" zu einer Basis-KI. Anstatt eine riesige KI zu trainieren, die in allem gut ist, haben die Forscher diese 10 separaten, winzigen Experten trainiert. Jeder von ihnen lernte, wie man unter Verwendung seiner spezifischen „Stimme" oder seines Stils nach Gefährlichem fragt.

2. Der intelligente Manager (der „Bandit")

Stellen Sie sich nun vor, Sie stehen am Burgtor. Sie wissen nicht, welcher Schauspieler heute an der Wache vorbeikommt.

  • Wenn Sie den Historiker senden, lacht die Wache vielleicht darüber hinweg.
  • Wenn Sie den Chef senden, bekommt die Wache vielleicht Angst und lässt Sie herein.

Hier kommt das Multi-Armed Bandit ins Spiel. Stellen Sie sich dies als einen „intelligenten Manager" vor, der neben Ihnen steht.

  • Der Manager hat einen Spielautomaten mit 10 Hebeln (einen für jeden Schauspieler).
  • Jedes Mal, wenn Sie einen Hebel ziehen (einen Schauspieler senden), beobachtet der Manager die Reaktion der Wache.
  • Wenn die Wache den Slang-Schauspieler passieren lässt, denkt der Manager: „Okay, diese Wache ist anfällig für Slang! Lass uns das noch einmal versuchen!" (Dies wird Ausbeutung genannt).
  • Wenn die Wache den Slang-Schauspieler blockiert, denkt der Manager: „Vielleicht sollten wir den Historiker ausprobieren, nur um zu sehen, was passiert", selbst wenn wir sie noch nicht oft versucht haben. (Dies wird Exploration genannt).

Der Manager balanciert ständig zwischen neue Dinge auszuprobieren, um zu sehen, was funktioniert, und dasjenige zu nutzen, das bereits funktioniert, um das beste Ergebnis zu erzielen.

3. Der „Sicherheits-Score" (die Belohnung)

Wie weiß der Manager, ob ein Schauspieler an der Wache vorbeigekommen ist?

  • Die Forscher verwenden einen separaten, regelbasierten Sicherheitsprüfer (wie einen strengen Schiedsrichter).
  • Wenn die Wache (die Ziel-KI) mit etwas Schädlichem antwortet, gibt der Schiedsrichter einen „Punkt" (eine Belohnung).
  • Der Manager nutzt diese Punkte, um zu lernen, welcher Schauspieler gegen diese spezifische Wache am effektivsten ist.

Warum ist dies besser als die alten Methoden?

  • Alte Methode: Dieselben 100 Fragen immer wieder zu schreien und zu hoffen, dass eine funktioniert. Es ist langsam und scheitert oft bei neuen Wachen.
  • Red-Bandit: Es passt sich in Echtzeit an. Wenn die Wache gegen „Slang" hart, aber gegen „Geschichte" schwach ist, erkennt Red-Bandit das sofort und wechselt die Taktik.

Was haben sie herausgefunden?

Die Arbeit behauptet, dass Red-Bandit sehr effektiv darin ist, Lücken in der KI-Sicherheit zu finden:

  1. Es dringt häufiger ein: Es hat die Ziel-KI erfolgreich öfter dazu gebracht, schädliche Antworten zu geben als frühere Methoden (wie AdvPrompter oder Atoxia).
  2. Es klingt menschlicher: Die Fragen, die es stellt, sind flüssiger und weniger roboterhaft (geringere „Perplexität"), was es für die KI schwieriger macht, sie als gefälscht zu erkennen.
  3. Es wirkt wie ein Diagnosewerkzeug: Indem sie beobachten, welchen „Schauspieler" der Manager am häufigsten wählt, können die Forscher genau sehen, gegen welche Art von Tricks ein spezifisches KI-Modell anfällig ist. Zum Beispiel stellten sie fest, dass ein KI-Modell sehr leicht durch „Historische Szenarien" getäuscht werden konnte, während ein anderes gegen „Rollenspiel" schwach war.

Ein Hinweis zur Sicherheit

Die Arbeit enthält eine Warnung: Dieses Tool wurde entwickelt, um Entwicklern zu helfen, Schwachstellen zu finden, damit sie diese bevor die KI der Öffentlichkeit zugänglich gemacht wird, beheben können. Die Autoren erkennen jedoch an, dass dieselbe Technik theoretisch auch von böswilligen Akteuren genutzt werden könnte, um in Systeme einzudringen. Das Ziel ist es, diese „Schlossknack"-Fähigkeit zu nutzen, um die Schlösser stärker zu machen, nicht um in Häuser einzubrechen.

Kurz gesagt: Red-Bandit ist ein intelligentes, adaptives System, das ein Team spezialisierter Schauspieler und einen Manager im Spielautomaten-Stil verwendet, um genau herauszufinden, wie man eine KI täuscht, und lernt dabei laufend, welche Tricks für diese spezifische KI am besten funktionieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →