← Neueste Arbeiten
💬 NLP

Learning diverse attacks on large language models for robust red-teaming and safety tuning

Dieses Paper schlägt ein auf GFlowNets basierendes Framework für automatisiertes Red-Teaming vor, das die durch bestehende Reinforcement-Learning-Ansätze verursachten Einschränkungen des Mode Collapse überwindet, um diverse und effektive Attack-Prompts zu generieren und dadurch die Erstellung robusterer, sicherheitsoptimierter Large Language Models zu ermöglichen.

Ursprüngliche Autoren: Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain

Veröffentlicht 2026-09-01
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der sich rasant entwickelnden Welt der künstlichen Intelligenz sind große Sprachmodelle zu leistungsstarken Werkzeugen geworden, die in der Lage sind, mit menschenähnlicher Flüssigkeit zu schreiben, zu argumentieren und zu konversieren. Diese Fähigkeit bringt jedoch ein erhebliches Risiko mit sich: Diese Systeme können manipuliert werden, um schädliche, toxische oder gefährliche Inhalte zu erzeugen. Um dies zu verhindern, setzen Entwickler eine Praxis ein, die als Red-Teaming bekannt ist. Stellen Sie sich ein Sicherheitsteam vor, das beauftragt wurde, in ein Gebäude einzubrechen, bevor die Öffentlichkeit einzieht; im digitalen Bereich bedeutet Red-Teaming, systematisch zu versuchen, eine künstliche Intelligenz dazu zu bringen, ihre Schwachstellen offenzulegen. Das Ziel besteht darin, die spezifischen Fragen oder Anweisungen, sogenannte Prompts, zu finden, die die Sicherheitsfilter des Modells umgehen und es dazu zwingen, etwas zu generieren, das es eigentlich verweigern sollte. Das Identifizieren dieser Schwachstellen ist entscheidend für den Bau sichererer Systeme, aber das Finden ist schwierig, da der Raum der möglichen Fragen riesig ist und die verwendeten Methoden oft in einer Sackgasse stecken bleiben, indem sie dieselben wenigen Tricks wiederholen, anstatt eine große Vielfalt an neuen Wegen zu entdecken, das System zu brechen.

Ein Team von Forschern hat einen neuen Ansatz für dieses Problem entwickelt, der erfolgreich eine vielfältige Auswahl an effektiven Angriffs-Prompts generiert. Anstatt sich auf traditionelle Methoden zu verlassen, die oft zu einer einzigen, repetitiven Lösung konvergieren, nutzten sie einen probabilistischen Rahmen namens Generative Flow Network. Diese Methode betrachtet die Suche nach schädlichen Prompts nicht als einfache Optimierungsaufgabe, sondern als einen Prozess der Stichprobenentnahme aus einer riesigen Landschaft der Möglichkeiten. Die Forscher trainierten eine künstliche Intelligenz, um diese Landschaft zu erkunden, und sammelten dabei eine breite Palette von Prompts, die erfolgreich toxische Antworten von Zielmodellen hervorriefen. Sie wandten dann einen zweiten, glättenden Schritt an, um diese Funde zu verfeinern, wodurch sichergestellt wurde, dass der endgültige Satz an Angriffen sowohl hochgradig effektiv als auch bemerkenswert vielfältig war. Das Ergebnis ist ein Werkzeugsatz, der Schwachstellen aufdecken kann, die andere Methoden übersehen, und somit ein umfassenderes Sicherheitsnetz für Entwickler bietet.

Die Kernherausforderung, die die Forscher bewältigten, war ein häufiges Versagen des automatisierten Red-Teamings: die Tendenz von Systemen, in der Erzeugung nur weniger ähnlicher, repetitiver Prompts zu kollabieren. Frühere Versuche, dies durch das Hinzufügen von Regeln zur Förderung der Vielfalt zu beheben, scheiterten oft und führten zu Systemen, die entweder vielfältige, aber harmlose Fragen oder effektive, aber identische Angriffe produzierten. Die neue Methode vermeidet diese Falle, indem sie einen zweistufigen Prozess verwendet. In der ersten Phase erkundet das System den Raum der möglichen Prompts, geleitet von einem Belohnungssignal, das misst, wie wahrscheinlich ein Prompt eine schädliche Reaktion auslösen kann. Diese Exploration ist darauf ausgelegt, breit gefächert zu sein und nach vielen verschiedenen „Modi“ oder Arten von Angriffen zu suchen, anstatt nur nach dem einen einfachsten Weg. Das System sammelt während dieser Phase einen großen Datensatz dieser erfolgreichen, vielfältigen Prompts.

In der zweiten Phase nehmen die Forscher die gesammelten Prompts und nutzen sie erneut zum Training des Modells, wobei der Fokus diesmal auf dem Erlernen der Muster liegt, die jene spezifischen Prompts erfolgreich gemacht haben. Dieser Schritt fungiert als Verfeinerung, die die Verteilung der Angriffe glättet, sodass das Modell neue, hochwertige Variationen generieren kann, die zwar nicht explizit gesehen wurden, aber dieselben erfolgreichen Eigenschaften teilen. Diese Kombination aus breiter Exploration gefolgt von fokussiertem Lernen ermöglicht es dem System, ein hohes Maß an Diversität beizubehalten und gleichzeitig sicherzustellen, dass die Angriffe wirksam bleiben. Die Forscher testeten diesen Ansatz auf einer Vielzahl von verschiedenen Sprachmodellen, einschließlich solcher, die speziell darauf trainiert worden waren, sicher und resistent gegen Angriffe zu sein. Sie fanden heraus, dass ihre Methode bestehende Techniken konsistent übertraf, indem sie einen wesentlich höheren Prozentsatz an toxischen Prompts bei gleichzeitig großer Vielfalt in Formulierung und Struktur generierte.

Eine der bedeutendsten Erkenntnisse war die Fähigkeit dieser Angriffe, auf verschiedene Modelle zu transferieren. Prompts, die generiert wurden, um ein spezifisches Modell anzugreifen, waren oft auch gegen andere, völlig unterschiedliche Modelle erfolgreich, selbst gegen solche, die die Forscher während der Trainingsphase nie getestet hatten. Dies deutet darauf hin, dass verschiedene Systeme der künstlichen Intelligenz gemeinsame Schwachstellen in ihrem Sicherheitstraining teilen und dass ein vielfältiger Satz von Angriffen diese gemeinsamen Schwachstellen effektiver offenlegen kann als enge, repetitive Ansätze. Beispielsweise konnten die Prompts, die die Forscher mit einem Modell namens Gemma trainierten, die Sicherheitsfilter mehrerer anderer Modelle, einschließlich Llama und Mistral, mit hohen Erfolgsraten umgehen. Diese Übertragbarkeit ist entscheidend, da dies bedeutet, dass eine einzige, gut konzipierte Red-Teaming-Anstrengung die Sicherheit vieler verschiedener Systeme gleichzeitig verbessern kann.

Die Forscher zeigten auch, dass das Training eines Modells mit diesem vielfältigen Satz von Angriffen es signifikant robuster macht. Als sie ein Zielmodell nahmen und es unter Verwendung der Verweigerungsantworten auf ihre generierten Prompts feintunten, wurde das resultierende Modell viel schwerer zu brechen. Tatsächlich war dieses sicherheitsoptimierte Modell in der Lage, Angriffen zu widerstehen, die von anderen, weniger anspruchsvollen Red-Teaming-Methoden generiert wurden, die zuvor erfolgreich gewesen waren. Dies deutet darauf hin, dass die Aussetzung eines Modells gegenüber einer breiten Vielfalt an Angriffsstilen während seines Sicherheitstrainings weitaus effektiver ist als die Aussetzung gegenüber nur wenigen wiederholten Beispielen. Die Studie zeigte, dass diese Verbesserung der Sicherheit nicht zu Lasten der allgemeinen Fähigkeiten des Modells ging; die sicherheitsoptimierten Modelle behielten ihre Fähigkeit bei, Anweisungen zu befolgen und Aufgaben effektiv auszuführen.

Die Arbeit hob auch die Grenzen aktueller Sicherheitsmaßnahmen hervor. Die Forscher stellten fest, dass die Wirksamkeit ihrer Angriffe von dem Klassifikator abhängt, der bestimmt, ob eine Antwort toxisch ist, und dass wahre Schädigung subjektiv und kontextabhängig sein kann. Sie beobachteten, dass einige Methoden, insbesondere solche, die auf einfacher Optimierung beruhen, in eine Falle tappen können, bei der sie Prompts generieren, die für einen Klassifikator toxisch aussehen, aber tatsächlich keine schädlichen Antworten vom Modell hervorrufen – ein Phänomen, das als Reward Hacking bekannt ist. Ihr zweistufiger Ansatz half dabei, dies zu mildern, indem er sicherstellte, dass die Prompts nicht nur statistisch wahrscheinlich einen Klassifikator triggern, sondern tatsächlich effektiv darin sind, die gewünschte Antwort vom Zielmodell zu provozieren.

Letztendlich bietet diese Forschung einen zuverlässigeren Weg, um KI-Systeme vor ihrer Veröffentlichung in die Öffentlichkeit zu testen. Indem sie sich von Methoden entfernen, die in repetitiven Schleifen stecken bleiben, und stat einer Strategie folgen, die nach einer großen Vielfalt an Angriffen sucht, können Entwickler eine breitere Palette von Schwachstellen identifizieren und schließen. Die Fähigkeit, diese Angriffe auf verschiedene Modelle zu übertragen, legt nahe, dass die Sicherheitsherausforderungen, vor denen diese Systeme stehen, miteinander verknüpft sind, und dass ein vielfältiger, probabilistischer Red-Teaming-Ansatz ein mächtiges Werkzeug zum Aufbau resilienterer und vertrauenswürdigerer künstlicher Intelligenz darstellt. Der Code und die Methoden aus dieser Studie sind für andere verfügbar, um die Schaffung sichererer Systeme für alle zu beschleunigen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →