TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks
TrajShield ist ein trainingsfreies Verteidigungsframework zur Laufzeit, das Jailbreak-Angriffe und zeitlich emergente Risiken in Text-zu-Video-Modellen abschwächt, indem es Prompt-Trajektorien simuliert, um unsichere Inhalte kausal zu lokalisieren und minimal umzuschreiben, während die semantische Treue gewahrt bleibt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich einen magischen Geschichtenerzähler-Roboter vor, der Ihre geschriebenen Sätze in kurze Filme verwandeln kann. Dieser Roboter ist außerordentlich talentiert darin, Szenen nahtlos von einem Moment zum nächsten fließen zu lassen, wie in einem echten Film. Es gibt jedoch ein Problem: Manchmal, wenn Sie ihm einen Satz geben, der harmlos klingt, aber auf Schwierigkeiten hindeutet, lässt sich der Roboter von seinem Geschichtenerzählen hinreißen. Er könnte mit einem harmlosen Streit zwischen zwei Personen beginnen und in seinem Bestreben, die Geschichte dramatisch und kohärent zu gestalten, sie zu einer gewalttätigen Schlägerei eskalieren lassen, die Sie eigentlich nie angefordert haben.
Dies ist das Kernproblem, das TrajShield löst.
Das Problem: Die „Rutschige Ebene" des Geschichtenerzählens
Bestehende Sicherheitsvorkehrungen für diese Roboter funktionieren wie ein Türsteher an einem Club-Eingang. Sie prüfen Ihr Ticket (den Text-Prompt) auf böswortige Wörter wie „Bombe" oder „Messer". Wenn sie ein solches Wort sehen, lassen sie Sie nicht herein.
Dieser Ansatz hat jedoch eine Blindstelle. Er versteht Geschichtenerzählen über die Zeit nicht.
- Der alte Weg: Wenn Sie sagen „Zwei Männer, die auf einem Parkplatz streiten", sieht der Türsteher keine Waffen und lässt Sie herein.
- Der Fehler des Roboters: Der Roboter, der versucht, einen guten Film zu machen, denkt: „Okay, Streitereien führen normalerweise zu Schubsen, und Schubsen führt zu Schlägereien." Also generiert er ein Video einer brutalen Schlägerei.
- Das Ergebnis: Sie haben einen Streit angefordert, aber Sie haben einen gewalttätigen Film erhalten. Der „schlechte" Teil war nicht in Ihren Worten; er lag in der Vorstellung des Roboters, wie sich die Geschichte hätte entwickeln sollen.
Die Lösung: TrajShield (Der „Drehbuchredakteur")
Die Autoren dieses Papers haben TrajShield entwickelt, ein neues Sicherheitssystem, das nicht nur das Ticket prüft; es fungiert wie ein Drehbuchredakteur, der die Geschichte bevor der Film gedreht wird, liest.
So funktioniert es, unter Verwendung eines einfachen dreistufigen Prozesses:
1. Aufschlüsselung der Geschichte (Entkopplung von Bewegung und Semantik)
Stellen Sie sich den Prompt des Roboters als einen verwickelten Wollknäuel vor. TrajShield entwirrt ihn in drei unterschiedliche Teile:
- Die Umgebung (Statisch): Wer ist da? Wo sind sie? Wie sieht es aus? (z. B. „Zwei Männer, ein Parkplatz, Nachtzeit.")
- Die Handlung (Dynamisch): Was passiert als Nächstes? (z. B. „Sie streiten, dann...")
- Das Ziel (Absicht): Was versucht der Benutzer tatsächlich zu zeigen? (z. B. „Eine angespannte Szene.")
Indem es die Umgebung von der Handlung trennt, stellt das System sicher, dass es beim Korrigieren der Geschichte die Charaktere oder den Ort nicht versehentlich verändert. Es berührt nur die Handlung.
2. Simulation der Zukunft (Temporale Risikopropagation)
Bevor der Roboter tatsächlich das Video erstellt, führt TrajShield eine „mentale Simulation" durch. Es fragt: „Wenn ich mit diesem Streit beginne, was ist die wahrscheinlichste nächste Szene? Und die danach?"
Es erstellt eine „Risikokarte" der Zukunft der Geschichte. Es sucht nach dem genauen Moment, in dem die Geschichte beginnt, in Gefahr abzugleiten.
- Beispiel: Es erkennt, dass „Streit" „Schreien" „Schubsen" ein gefährlicher Pfad ist.
- Es identifiziert den Auslösepunkt: Den genauen Moment, in dem die Geschichte von „sicher" zu „unsicher" übergeht (z. B. der Moment, in dem das Schreien zum Schubsen wird).
3. Die minimale Umschreibung (Temporalkonsistente sichere Umschreibung)
Sobald es den Auslösepunkt gefunden hat, führt TrajShield eine „Operation" an der Geschichte durch. Es löscht nicht den ganzen Film. Stattdessen schreibt es nur den gefährlichen Teil der Handlung um, um sie zurück in die Sicherheit zu lenken, während alles andere genau gleich bleibt.
- Originaler gefährlicher Pfad: Streit Schreien Kämpfen (Unsicher!)
- TrajShield's Umschreibung: Streit Schreien Wütend davonstürmen (Sicher!)
Das Ergebnis ist ein Video, das sich immer noch wie die ursprüngliche Idee des Benutzers anfühlt (angespannt, dramatisch, zwei Männer auf einem Parkplatz), aber es stoppt, bevor es gewalttätig wird. Die „Geschichte" fließt natürlich, nur in eine sichere Richtung.
Warum das wichtig ist
Das Paper testete dieses System gegen 14 verschiedene Arten von Sicherheitsrisiken (wie Gewalt, illegale Handlungen oder verstörende Inhalte) und über 6 verschiedene Videogenerierungsmodelle hinweg.
- Das Ergebnis: TrajShield stoppte etwa 52 % mehr unsichere Videos als frühere Methoden.
- Die Qualität: Entscheidend ist, dass es die guten Videos nicht ruinierte. Wenn ein sicherer Prompt gegeben wurde, sah das resultierende Video immer noch genau so aus, wie der Benutzer es wollte. Es verwandelte eine friedliche Szene nicht in eine langweilige; es verhinderte lediglich den „Rutsch" in die Gefahr.
Das Fazit
Denken Sie an TrajShield als ein Sicherheitsnetz, das eine Geschichte bevor sie von einer Klippe fällt, auffängt. Anstatt nur Wörter zu verbieten, versteht es, dass Geschichten eine Richtung haben. Es beobachtet, wie sich die Geschichte im Kopf des Roboters entfaltet, erkennt den Moment, in dem sie kurz davor ist, aus dem Ruder zu laufen, und lenkt sie sanft zurück auf einen sicheren Pfad, ohne dabei die Kulisse oder die Charaktere zu verändern.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.