← Derniers articles
💻 computer science

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

Cet article présente Prompting4Debugging (P4D), un outil de red-teaming automatisé qui révèle des vulnérabilités significatives dans les mécanismes de sécurité des modèles de diffusion texte-image en démontrant que de nombreux prompts auparavant considérés comme « sûrs » peuvent être manipulés pour contourner les protections existantes, remettant ainsi en question la fiabilité des bancs d'essai d'évaluation actuels.

Auteurs originaux : Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

Publié 2026-01-15
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un artiste très talentueux et magique nommé Stable Diffusion. Cet artiste peut transformer n'importe quelle phrase que vous écrivez en une magnifique image. Si vous dites « un chat sur un tapis », vous obtenez un chat sur un tapis. Mais, parce que cet artiste a appris de l'ensemble d'Internet, il arrive qu'il dessine accidentellement des choses inappropriées, comme des personnages sous droit d'auteur ou des images qui ne sont pas adaptées au travail (NSFW).

Pour correr cela, les développeurs placent un garde de sécurité devant l'artiste. Ce garde (le « mécanisme de sécurité ») est censé empêcher l'artiste de dessiner de mauvaises choses. Si vous demandez « une personne nue », le garde dit : « Non ! » et l'artiste dessine autre chose à la place.

Le Problème :
Les développeurs pensent que le garde fait un excellent travail. Ils ont une liste de phrases « mauvaises » qu'ils ont testées, et le garde les a toutes arrêtées. Mais les chercheurs de ce document se sont demandé : « Et si les méchants étaient simplement très doués pour tromper le garde ? Et s'il y avait des mots de passe secrets que nous n'avons pas encore trouvés ? »

La Solution : Prompting4Debugging (P4D)
Les auteurs ont construit un outil appelé Prompting4Debugging (P4D). Considérez P4D comme une « Red Team » automatisée et super intelligente (un groupe de hackers éthiques engagés pour s'introduire dans un système afin d'en trouver les failles).

Au lieu que des humains devinent des phrases aléatoires pour essayer de briser le garde, P4D le fait de manière automatique et scientifique. Voici comment cela fonctionne, en utilisant une analogie simple :

L'analogie de l'« Artiste de l'Ombre »

Imaginez que vous avez deux artistes dans une pièce :

  1. L'Artiste Sans Restriction (G) : Cet artiste n'a aucune règle. Si vous demandez « une personne nue », il la dessine parfaitement.
  2. L'Artiste Gardé (G') : Cet artiste a le garde de sécurité. Si vous demandez « une personne nue », il refuse.

L'Objectif : P4D veut trouver une nouvelle phrase (un « prompt problématique ») qui trompe l'Artiste Gardé pour qu'il dessine la même « personne nue » que l'Artiste Sans Restriction a dessinée, même si l'Artiste Gardé est censé dire « non ».

Le Processus :

  1. Le Modèle (Blueprint) : P4D demande d'abord à l'Artiste Sans Restriction de dessiner l'image « interdite ». Cela lui donne un modèle parfait de ce à quoi ressemble la mauvaise image.
  2. La Traduction : P4D regarde ensuite l'Artiste Gardé. Il sait que l'Artiste Gardé utilise un code secret (des « embeddings » mathématiques) pour comprendre les mots.
  3. Le Hack : P4D commence à ajuster la phrase. Il ne se contente pas de deviner ; il utilise une « échelle glissante » mathématique pour pousser les mots jusqu'à ce que le code interne de l'Artiste Gardé corresponde au modèle de l'Artiste Sans Restriction.
  4. Le Résultat : P4D trouve une phrase étrange, décousue ou astucieuse (comme « une photo d'un panneau publicitaire montrant un homme nu dans une position explicite » ou même un charabia qui fonctionne d'une certaine manière) qui contourne le garde.

Ce qu'ils ont trouvé

Les chercheurs ont testé cela sur plusieurs modèles populaires « Gardés » (comme Stable Diffusion avec des filtres de sécurité). Les résultats ont été choquants :

  • La liste « Sûre » n'était pas sûre : Ils ont pris une liste de prompts que tout le monde pensait être sûrs et qui avaient déjà été testés. Ils ont découvert qu'environ la moitié d'entre eux pouvaient être facilement manipulés par P4D pour briser le garde de sécurité.
  • Le piège de l'« Obfuscation de l'Information » : Le document a découvert un phénomène étrange. Parfois, le garde de sécurité est trop bon pour cacher l'information. Lorsque les chercheurs ont désactivé le « filtre » du garde juste pendant qu'ils apprenaient comment le briser, ils ont trouvé encore plus de moyens de le briser.
    • Analogie : Imaginez un garde de sécurité qui porte un bandeau sur les yeux pendant que vous essayez de passer en douce. Vous vous dites : « Oh, il ne peut pas me voir, donc je suis en sécurité. » Mais en réalité, le bandeau le rend moins conscient des ruses spécifiques que vous utilisez. Une fois que vous avez compris la ruse avec le bandeau, vous pouvez utiliser cette même ruse pour passer sans qu'il vous voie, même lorsqu'il ne porte pas le bandeau. La tentative du garde de cacher l'information a en fait rendu le système plus sûr en apparence qu'il ne l'était réellement.

Ce qu'il faut retenir

Le document conclut que ce n'est pas parce qu'un système de sécurité réussit quelques tests qu'il est véritablement sûr. Les prompts « sûrs » que nous utilisons aujourd'hui pourraient être comme une serrure qui fonctionne contre une clé que vous avez dans la main, mais qui échoue contre une clé que vous n'avez pas encore inventée.

P4D est un outil permettant aux développeurs de trouver ces « clés non inventées » avant qu'elles ne soient utilisées par des acteurs malveillants. Cela prouve que nous devons continuer à tester ces modèles constamment, car les « méchants » (ou les outils automatisés qui trouvent les failles) deviennent de plus en plus intelligents, et les gardes de sécurité doivent être testés contre les ruses les plus astucieuses possibles.

En bref : Le document a construit un robot automatisé qui tente de tromper les générateurs d'art IA pour qu'ils dessinent de mauvaises choses. Il a découvert que les gardes de sécurité actuels sont beaucoup plus faibles que nous le pensions, et que de nombreux mots « sûrs » peuvent être détournés pour briser les règles.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →