← Derniers articles
🤖 AI

Jailbreaking on Text-to-Video Models via Scene Splitting Strategy

Cet article présente SceneSplit, une nouvelle méthode de contournement en boîte noire qui fragmente les récits nuisibles en scènes individuellement inoffensives pour manipuler l'espace de sortie génératif des modèles Texte-vers-Vidéo, atteignant des taux de réussite d'attaque élevés sur plusieurs systèmes de pointe et révélant des vulnérabilités critiques dans leurs mécanismes de sécurité.

Auteurs originaux : Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

Publié 2026-05-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de faire passer un objet dangereux devant un agent de sécurité dans un aéroport. Si vous tentez de traverser le portique de sécurité en tenant une épée géante et évidente, l'alarme se déclenchera immédiatement et vous serez arrêté. C'est ainsi que fonctionnent les modèles actuels d'IA « Texte vers Vidéo » : ils disposent de filtres de sécurité qui analysent votre demande (prompt) et bloquent tout ce qui ressemble à une création de contenu nuisible, comme la violence ou la nudité.

Ce papier présente une astuce ingénieuse appelée SceneSplit qui contourne ces gardes. Au lieu d'essayer de faire passer l'épée entière d'un coup, les attaquants décomposent l'épée en pièces inoffensives à première vue, les font passer une par une, puis laissent l'IA les réassembler en l'objet dangereux.

Voici comment la méthode fonctionne, décomposée en trois étapes simples :

1. L'astuce « Lego » (Découpage de scène)

Imaginez que vous vouliez générer une vidéo d'une bagarre violente. Si vous tapez « Deux hommes se battant avec des couteaux », le garde de sécurité de l'IA dit : « Non, c'est dangereux », et bloque la demande.

SceneSplit prend cette idée dangereuse et la découpe en 3 à 5 scènes séparées et minuscules qui semblent complètement inoffensives individuellement :

  • Scène 1 : « Un homme tenant un objet métallique brillant. » (Sûr)
  • Scène 2 : « Une femme allongée sur une chaise, l'air détendue. » (Sûr)
  • Scène 3 : « Une caméra qui zoome sur un liquide rouge qui coule sur le sol. » (Sûr)

Individuellement, aucune de ces demandes ne déclenche l'alarme. Elles sont comme des briques Lego inoffensives. Cependant, lorsque l'IA reçoit l'instruction de jouer ces scènes dans l'ordre, elle fait les liens. L'« objet brillant » devient un couteau, la « femme détendue » devient une victime, et le « liquide rouge » devient du sang. La combinaison force l'IA à créer la vidéo violente qui lui avait été demandée à l'origine, même si elle n'a jamais vu les mots dangereux « bagarre » ou « couteau » dans une seule demande.

2. Le « Fine-Tuning » (Manipulation de scène)

Parfois, même avec les briques Lego, l'IA peut encore se tromper et générer une vidéo sûre (comme un homme tenant une cuillère au lieu d'un couteau).

Pour corriger cela, la méthode utilise une boucle de rétroaction. Elle examine la vidéo générée par l'IA et demande : « Quelle scène spécifique a causé la confusion de l'IA ? » Si l'IA a généré une cuillère au lieu d'un couteau, le système identifie que la Scène 1 était trop vague. Il demande ensuite à un assistant IA intelligent de réécrire uniquement cette scène spécifique pour la rendre légèrement plus explicite, tout en gardant les autres scènes identiques. Il continue d'ajuster cette seule scène jusqu'à ce que l'IA génère enfin la vidéo nuisible, « chassant » efficacement la ligne exacte où le filtre de sécurité échoue.

3. La « Liste de triche » (Bibliothèque de stratégies)

À chaque fois que les chercheurs parviennent à tromper l'IA, ils enregistrent la « recette » qu'ils ont utilisée. S'ils ont réussi à décomposer une demande sur la violence en 4 scènes en utilisant un type spécifique de formulation, ils sauvegardent ce motif.

La prochaine fois qu'ils voudront attaquer l'IA avec une autre demande violente, ils consultent leur « Liste de triche ». Ils voient : « Oh, le découpage en 4 scènes a fonctionné la dernière fois », et ils utilisent immédiatement cette même stratégie. Cela rend l'attaque plus rapide et plus efficace au fil du temps, car le système apprend de ses propres succès.

Que ont-ils découvert ?

Les chercheurs ont testé cette « astuce Lego » sur plusieurs générateurs de vidéos IA commerciaux majeurs (comme Veo2, Hailuo et Luma Ray2). Ils ont constaté que :

  • Cela fonctionne très bien : La méthode a généré avec succès des vidéos nuisibles dans environ 77 % à 84 % des cas à travers différents modèles.
  • Les défenses existantes sont faibles : Les filtres de sécurité actuels sont bons pour repérer les mots mauvais évidents, mais ils sont terribles pour comprendre comment une série de scènes inoffensives à première vue peut se combiner pour raconter une histoire dangereuse.
  • Le « Vide de sécurité » : Le papier conclut que si nous avons de bons gardes pour les phrases uniques, nous n'avons pas de bons gardes pour les séquences d'événements.

En résumé : Le papier montre que vous pouvez tromper l'IA vidéo en décomposant une mauvaise idée en nombreuses petites pièces qui semblent bonnes, en laissant l'IA les assembler, puis en ajustant les pièces jusqu'à ce que la mauvaise idée ressorte. Cela révèle une faille significative dans la façon dont nous protégeons actuellement ces systèmes d'IA.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →