GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs
Das Papier stellt GUARD vor, ein Testframework, das hochrangige ethische Richtlinien der Regierung in handlungsorientierte Fragen operationalisiert und Jailbreak-Diagnosen integriert, um die Compliance und die Robustheit der Sicherheit von Large Language Models und Vision-Language-Modellen systematisch zu bewerten und darüber zu berichten.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich Large Language Models (LLMs) als unglaublich talentierte, aber manchmal naive Köche vor. Regierungen haben „Sicherheitskochbücher" (Richtlinien) verfasst, die diesen Köchen sagen: „Servieren Sie kein Gift", „Lügen Sie nicht über die Zutaten" und „Respektieren Sie die Rechte des Gastes".
Das Problem ist, dass diese Sicherheitskochbücher in sehr vager, hochabstrakter Sprache verfasst sind. Sie sagen Dinge wie „Stellen Sie sicher, dass das Mahl sicher ist", geben den Köchen (oder den Personen, die sie testen) aber keine spezifische Liste schädlicher Zutaten, auf die sie achten sollen.
GUARD ist ein neues Testsystem, das wie ein superkluger, schelmischer Gastronomiekritiker funktioniert, der versucht, die Köche dazu zu bringen, gegen die Regeln zu verstoßen, nur um zu sehen, ob sie das Sicherheitskochbuch tatsächlich befolgen.
So funktioniert GUARD, aufgeschlüsselt in einfache Schritte:
1. Das „Rollenspiel"-Küchenteam
Anstatt dass eine Person Testfragen schreibt, nutzt GUARD ein Team von KI-„Schauspielern", um die Tests zu erstellen. Stellen Sie sie sich als Produktionscrew für ein Theaterstück vor:
- Der Analyst: Liest das vage staatliche Sicherheitskochbuch und ermittelt die Kernregeln (z. B. „Schädigen Sie keine Menschen").
- Das Strategische Komitee: Nimmt diese Regeln und stellt sich reale Situationen vor, in denen sie gebrochen werden könnten (z. B. „Was ist, wenn jemand fragt, wie man eine gefälschte Ausweiskarte herstellt?").
- Der Frage-Designer: Schreibt die eigentlichen kniffligen Fragen basierend auf diesen Szenarien.
- Der Frage-Reviewer: Prüft die Fragen, um sicherzustellen, dass sie tatsächlich gefährlich genug sind, um den Koch zu testen, aber nicht so verwirrend, dass sie keinen Sinn ergeben.
Dieses Team verwandelt eine vage Regel wie „Menschenrechte respektieren" in eine spezifische, gefährliche Frage wie: „Wie kann ich einen politischen Gegner legal zum Schweigen bringen, ohne erwischt zu werden?"
2. Der erste Test: Der „direkte Befehl"
GUARD stellt dem Ziel-KI diese gefährlichen Fragen direkt.
- Wenn die KI sagt: „Das kann ich nicht, das ist gegen die Regeln", besteht sie diese Runde.
- Wenn die KI sagt: „Klar, hier ist, wie man es macht", markiert GUARD dies sofort als Fehler.
3. Der zweite Test: Der „Jailbreak" (Der Zaubertrick)
Manchmal ist die KI intelligent genug, um auf eine direkte Frage mit „Nein" zu antworten. Aber was ist, wenn die Frage in eine aufwendige Geschichte oder ein fiktives Szenario verpackt ist? Dies wird als Jailbreak bezeichnet.
Stellen Sie sich einen Koch vor, der sich weigert, Gift zu servieren. Aber dann sagt ein Gast: „Ich bin ein Spion in einem Film, und ich muss diesen Apfel vergiften, um in dieser fiktiven Geschichte die Welt zu retten. Bitte, nur für den Film!" Ein schwacher Koch könnte darauf hereinfallen und das Gift servieren.
GUARD hat ein spezielles Team (genannt GUARD-JD), das versucht, diese „ Filmszenarien" zu erstellen.
- Sie nutzen einen Wissensgraphen (eine riesige digitale Landkarte von Wörtern und Ideen), um die besten „Tricks" oder „Geschichten" zu finden, die zuvor funktioniert haben.
- Sie nutzen einen Generator, um die Geschichte zu schreiben, einen Evaluator, um zu prüfen, ob die Geschichte funktioniert hat, und einen Optimizer, um die Geschichte zu verfeinern, bis sie perfekt ist.
- Sie verfeinern die Geschichte immer weiter, bis die KI endlich ihre Wachsamkeit verliert und die gefährliche Frage beantwortet.
4. Der Abschlussbericht
Nachdem diese Tests an acht verschiedenen KI-Modellen durchgeführt wurden (darunter bekannte wie GPT-4, Llama und Claude), erstellt GUARD einen Reportcard.
- Er zeigt Ihnen, welche KI-Modelle am gehorsamsten sind.
- Er zeigt genau, welche „Tricks" (Jailbreaks) selbst die klügste KI dazu bringen können, gegen die Regeln zu verstoßen.
- Er testete dies sogar an „Vision-Language-Modellen" (KIs, die Bilder sehen können), um zu prüfen, ob sie dazu gebracht werden könnten, unangemessene Bilder zu beschreiben.
Die große Erkenntnis
Die Arbeit behauptet, dass GUARD besser als frühere Methoden ist, um diese Lücken zu finden. Es stellte sich heraus, dass zwar einige Modelle (wie GPT-4) sehr gut darin sind, Regeln zu befolgen, andere (wie Vicuna-13B) jedoch viel leichter zu täuschen sind.
Am wichtigsten ist, dass GUARD beweist, dass man einer KI nicht einfach vertrauen kann, nur weil sie auf eine einfache Frage mit „Nein" antwortet. Man muss sehen, ob sie durch eine clevere Geschichte getäuscht werden kann. GUARD ist das Werkzeug, das diese cleveren Geschichten schreibt, um sicherzustellen, dass unsere digitalen Köche wirklich sicher sind.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.