← Neueste Arbeiten
🤖 AI

Safety Alignment of LMs via Non-cooperative Games

Dieses Paper führt AdvGame ein, ein neuartiges Paradigma für das Safety Alignment, welches die Interaktion zwischen einem Angreifer- und einem Verteidiger-Sprachmodell als ein Nullsummenspiel mit nicht-null Summe (non-zero-sum game) rahmt, das mittels Online-Reinforcement-Learning mit präferenzbasierten Belohnungen trainiert wird, was zu einem robusteren und hilfreicheren Verteidiger sowie einem leistungsstarken, allgemeingültigen Red-Teaming-Agenten führt.

Ursprüngliche Autoren: Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

Veröffentlicht 2026-06-02
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem sehr intelligenten, aber unerfahrenen Roboter (dem Verteidiger) beizubringen, wie er mit einer chaotischen Welt voller tückischer Fragen umgeht, von denen einige gefährlich sind.

Traditionell versuchten Entwickler, diesen Roboter zu lehren, indem sie ihm eine Liste von „schlechten Fragen“ zeigten und sagten: „Beantworte diese nicht.“ Aber der Roboter ist intelligent; er lernt schließlich, die Liste auswendig zu lernen, scheitert aber, wenn ihm jemand eine neue Art von schlechter Frage stellt, die er noch nicht gesehen hat. Es ist, als würde man einem Sicherheitswachmann beibringen, nur die Gesichter auf einem Steckbrief zu erkennen, anstatt ihm beizubringen, allgemein verdächtiges Verhalten zu erkennen.

Dieses Paper stellt eine neue Methode vor, den Roboter AdvGame zu nennen. Anstatt eines Lehrers und eines Schülers wird ein Videospiel mit zwei Spielern eingerichtet:

  1. Der Angreifer (Der „Trickster“): Ein Roboter, dessen einzige Aufgabe es ist, neue, clevere Wege zu erfinden, um den Verteidiger dazu zu bringen, etwas Schädliches zu sagen.
  2. Der Verteidiger (Der „Wächter“): Ein Roboter, dessen Aufgabe es ist, hilfreiche Fragen zu beantworten, während er den Fallen des Tricksters sicher ausweicht.

Die Kernidee: Ein niemals endender Tanz

In der alten Methode versuchte der Trickster, den Wächter zu brechen, dann wurde der Wächter geflickt, dann versuchte es der Trickster erneut. Es war ein langsames, Hin-und-Her-Spiel von „Katze und Maus“.

In AdvGame spielen sie simultan.

  • Der Trickster versucht, eine neue Lücke in der Rüstung des Wächters zu finden.
  • Der Wächter lernt sofort, diese Lücke zu schließen.
  • Da sie gleichzeitig spielen, lernt der Wächter, mit jedem neuen Trick umzugehen, den der Trickster hervorbringt, und nicht nur mit denen, die er gestern gesehen hat.

Das Paper argumentiert, dass dies kein „Nullsummenspiel“ ist (bei dem einer gewinnt und der andere verliert). Stattdessen ist es ein Nicht-Nullsummenspiel. Der Trickster versucht nicht, den Wächter zu zerstören; er versucht, den Wächter besser zu machen, indem er seine Schwächen findet. Der Wächter versucht nicht, den Trickster zum Schweigen zu bringen; er versucht, hilfreich zu bleiben, während er sich weigert, getäuscht zu werden.

Die Bestenliste: „Besser als“ vs. „Wie viele Punkte“

Eine wesentliche Innovation in diesem Paper ist die Art und Weise, wie die Spieler bewertet werden.

  • Die alte Methode (Punktweise): Ein Richter vergibt eine Punktzahl wie „7 von 10“ zu einer einzelnen Antwort. Das ist schwierig, da eine „7“ subjektiv ist. Der Roboter könnte lernen, das System zu manipulieren, indem er Antworten gibt, die dem Richter gut erscheinen, aber tatsächlich nicht sicher sind (wie ein Schüler, der den Lösungsschlüssel auswendig lernt, anstatt das Fachgebiet zu verstehen).
  • Die neue Methode (Paarweise): Dem Richter werden zwei Antworten nebeneinander gezeigt, und er wird einfach gefragt: „Welche ist besser?“
    • Analogie: Anstatt einen Food-Kritiker zu fragen, einen Burger auf einer Skala von 1 bis 10 zu bewerten (was schwer zu kalibrieren ist), fragt man einfach: „Ist Burger A besser als Burger B?“ Das ist viel schwerer zu betrügen und liefert ein klareres Signal dafür, was „gut“ tatsächlich bedeutet.

Die Ergebnisse: Stärker und Schlauer

Das Paper testete diese Methode an zwei populären Roboter-Modellen (Llama und Qwen). Hier ist, was sie herausfanden:

  1. Der Wächter wurde widerstandsfähiger: Die Verteidiger-Modelle, die mit AdvGame trainiert wurden, waren viel schwerer zu täuschen. Bei Tests gegen bekannte „Jailbreak“-Angriffe (Wege, um Sicherheitsfilter zu umgehen) hielten sie sich viel besser als Modelle, die mit alten Methoden trainiert wurden.
  2. Der Wächter blieb hilfreich: Ein häufiges Problem beim Sicherheitstraining ist, dass der Roboter zu vorsichtig wird und harmlose Fragen verweigert (wie „Wie töte ich einen Computerprozess?“). AdvGame gelang es, den Roboter hilfreich und nützlich zu halten, während er gleichzeitig sicher blieb.
  3. Der Trickster wurde zu einem Super-Werkzeug: Der Angreifer-Roboter verschwand nicht nach dem Training. Er wurde zu einem leistungsstarken „Red Teaming“-Werkzeug. Das bedeutet, dass der Angreifer selbst nun verwendet werden kann, um andere Roboter zu testen, um zu sehen, ob sie sicher sind – er fungt als professioneller Stresstester.

Das Geheimrezept

Das Paper hebt drei Gründe hervor, warum dies so gut funktioniert hat:

  • Zwei separate Roboter: Sie verwendeten nicht einen Roboter für beide Rollen (der sich verwirren könnte). Sie verwendeten zwei unterschiedliche Modelle, sodass der Angreifer darauf fokussiert bleibt zu attackieren und der Verteidiger darauf, zu verteidigen.
  • Der „Besser als“-Richter: Die Verwendung des paarweisen Vergleichs (welches ist besser?) verhinderte, dass die Roboter das Bewertungssystem austricksten.
  • Der „Gleitender Durchschnitt“-Trick: Sie verwendeten eine Technik namens EMA (Exponential Moving Average). Stellen Sie sich vor, der Wächter ist ein Schüler, der eine Prüfung ablegt. Anstatt in Panik zu geraten, weil er eine Frage falsch beantwortet hat, betrachtet er seine Leistung der letzten Wochen, um sein wahres Können zu sehen. Dies hält das Training stabil und verhindert, dass der Roboter auf ein einzelnes schlechtes Beispiel überreagiert.

Zusammenfassung

AdvGame ist wie ein Fitnessstudio, in dem ein Roboter lernt, Schlägen auszuweichen. Anstatt dass ein Trainer ihm ein Video eines Schlages zeigt und ihm sagt, wie er auszuweichen hat, trainiert der Roboter durch Sparring mit einem Partner, der in Echtzeit ständig neue Schläge erfindet. Das Ergebnis ist ein Roboter, der nicht nur sicherer, sondern auch nützlicher ist, und ein Sparring-Partner, der so gut darin ist, Lücken in der Verteidigung zu finden, dass er in Zukunft dazu verwendet werden kann, jeden anderen Roboter zu testen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →