TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks
TrajShield est un cadre de défense sans entraînement et au moment de l'inférence qui atténue les attaques de contournement et les risques émergents temporels dans les modèles texte-vidéo en simulant des trajectoires de prompts pour localiser causalement et réécrire de manière minimale le contenu non sécurisé tout en préservant la fidélité sémantique.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédiez un robot conteur magique capable de transformer vos phrases écrites en courts métrages. Ce robot est incroyablement talentueux pour faire couler les scènes de manière fluide d'un moment à l'autre, comme un véritable film. Cependant, il y a un problème : parfois, si vous lui donnez une phrase qui semble inoffensive mais qui laisse entrevoir des ennuis, le robot se laisse emporter par son récit. Il pourrait commencer par une dispute inoffensive entre deux personnes et, dans sa quête de rendre l'histoire dramatique et cohérente, l'escalader en une bagarre violente que vous n'avez jamais réellement demandée.
C'est le problème fondamental que TrajShield résout.
Le Problème : La « pente glissante » du récit
Les garde-fous de sécurité existants pour ces robots fonctionnent comme un videur à l'entrée d'une boîte de nuit. Ils vérifient votre billet (l'invite textuelle) à la recherche de mots interdits comme « bombe » ou « couteau ». S'ils voient un mot interdit, ils vous arrêtent.
Mais cette approche présente un angle mort. Elle ne comprend pas la narration dans le temps.
- L'ancienne méthode : Si vous dites « Deux hommes se disputant dans un parking », le videur ne voit aucune arme et vous laisse entrer.
- L'erreur du robot : Le robot, essayant de faire un bon film, pense : « D'accord, les disputes mènent généralement à des bousculades, et les bousculades mènent à des bagarres. » Ainsi, il génère une vidéo d'une bagarre brutale.
- Le résultat : Vous avez demandé une dispute, mais vous avez obtenu un film violent. La partie « mauvaise » ne se trouvait pas dans vos mots ; elle résidait dans l'imagination du robot quant à la façon dont l'histoire devait se dérouler.
La Solution : TrajShield (Le « Réviseur de scénario »)
Les auteurs de cet article ont créé TrajShield, un nouveau système de sécurité qui ne se contente pas de vérifier le billet ; il agit comme un réviseur de scénario qui lit l'histoire avant que le film ne soit tourné.
Voici comment cela fonctionne, en utilisant un processus simple en trois étapes :
1. Décomposition de l'histoire (Découplage sémantique-moteur)
Imaginez que l'invite du robot soit une pelote de laine emmêlée. TrajShield la démêle en trois parties distinctes :
- Le décor (Statique) : Qui est présent ? Où sont-ils ? À quoi cela ressemble-t-il ? (Par exemple : « Deux hommes, un parking, la nuit. »)
- L'intrigue (Dynamique) : Que se passe-t-il ensuite ? (Par exemple : « Ils se disputent, puis... »)
- L'objectif (Intention) : Que cherche réellement l'utilisateur à montrer ? (Par exemple : « Une scène tendue. »)
En séparant le décor de l'action, le système garantit que lorsqu'il corrige l'histoire, il ne modifie pas accidentellement les personnages ou le lieu. Il ne touche qu'à l'intrigue.
2. Simulation du futur (Propagation temporelle des risques)
Avant que le robot ne réalise effectivement la vidéo, TrajShield exécute une « simulation mentale ». Il se demande : « Si je commence par cette dispute, quelle est la scène suivante la plus probable ? Et celle d'après ? »
Il construit une « carte des risques » de l'avenir de l'histoire. Il cherche le moment exact où l'histoire commence à glisser vers le danger.
- Exemple : Il voit que « Dispute » « Cris » « Bousculade » est un chemin dangereux.
- Il identifie le point de déclenchement : le moment exact où l'histoire passe de « sûr » à « dangereux » (par exemple, le moment où les cris se transforment en bousculade).
3. La réécriture minimale (Réécriture sûre temporellement cohérente)
Une fois qu'il a trouvé le point de déclenchement, TrajShield effectue une « chirurgie » sur l'histoire. Il ne supprime pas tout le film. Au contraire, il réécrit uniquement la partie dangereuse de l'intrigue pour la réorienter vers la sécurité, tout en gardant tout le reste exactement identique.
- Chemin dangereux original : Dispute Cris Bagarre (Dangereux !)
- Réécriture de TrajShield : Dispute Cris Partir furieux (Sûr !)
Le résultat est une vidéo qui conserve toujours l'impression de l'idée originale de l'utilisateur (tendue, dramatique, deux hommes dans un parking), mais qui s'arrête avant de devenir violente. L'« histoire » coule naturellement, simplement dans une direction sûre.
Pourquoi cela compte
L'article a testé ce système contre 14 types différents de risques de sécurité (comme la violence, les actes illégaux ou le contenu perturbant) et à travers 6 modèles de génération vidéo différents.
- Le résultat : TrajShield a bloqué environ 52 % de vidéos dangereuses en plus par rapport aux méthodes précédentes.
- La qualité : Crucialement, il n'a pas gâché les bonnes vidéos. Lorsqu'il reçoit une invite sûre, la vidéo résultante ressemble exactement à ce que l'utilisateur voulait. Il n'a pas transformé une scène paisible en quelque chose de ennuyeux ; il a simplement empêché la « pente glissante » vers le danger.
L'essentiel
Pensez à TrajShield comme à un filet de sécurité qui attrape une histoire avant qu'elle ne tombe d'une falaise. Au lieu de simplement interdire des mots, il comprend que les histoires ont une direction. Il observe l'histoire se dérouler dans l'esprit du robot, repère le moment où elle est sur le point de dérailler, et la guide doucement de nouveau sur un chemin sûr, le tout sans changer le décor ni les personnages.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.