← Derniers articles
🤖 AI

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

Ce papier présente BEAP, une attaque par prompting adversaire en boîte noire et consciente des embeddings qui exploite un grand modèle de langage pour générer itérativement des prompts de haute qualité et indétectables, contournant avec succès les défenses d'oubli machine dans les modèles de diffusion texte-à-image avec des taux de réussite nettement supérieurs aux méthodes antérieures.

Auteurs originaux : Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

Publié 2026-05-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Image : Le Problème du « Faux Effaceur »

Imaginez que vous avez un artiste très talentueux qui a vu des millions d'images. Vous demandez à cet artiste d'« oublier » comment dessiner quelque chose de spécifique, comme une personne nue. Vous voulez qu'il soit sûr et ne dessine plus jamais cela.

Pour ce faire, vous utilisez une technique spéciale d'« effacement machine ». Pensez-y comme prendre un feutre rouge et gribouiller sur la mémoire de l'artiste concernant les « personnes nues ». Vous espérez que maintenant, si vous demandez une image d'une personne nue, l'artiste dira : « Je ne sais pas ce que c'est », ou dessinera quelque chose de complètement différent.

Le Problème : Les auteurs de ce papier ont découvert que ce « feutre rouge » n'efface pas réellement la mémoire. Il la cache simplement. L'artiste se souvient encore comment le dessiner ; il a juste besoin du bon murmure pour déverrouiller cette mémoire à nouveau.

L'Attaque : BEAP (Le « Détective Murmurant »)

Le papier introduit une nouvelle méthode appelée BEAP. Imaginez BEAP comme un détective astucieux qui veut prouver que l'artiste se souvient encore de l'image interdite.

La plupart des tentatives précédentes pour tromper l'artiste consistaient à crier du charabia ou à utiliser du code qui n'avait aucun sens (par exemple, « personne nue x99#!! »). Les gardes de sécurité de l'artiste (les filtres) repéraient immédiatement ce non-sens et le bloquaient.

BEAP est différent. Il utilise une IA super-intelligente (un Grand Modèle de Langage) pour agir comme un traducteur diplomatique. Au lieu de crier, BEAP murmure. Il tente de décrire le concept interdit en utilisant un langage humain normal et poli qui semble totalement innocent aux yeux des gardes de sécurité.

Comment BEAP Fonctionne (La Danse en Trois Étapes)

BEAP ne se contente pas de deviner ; il joue à un jeu de « Chaud et Froid » avec l'artiste, affinant son approche à chaque fois. Voici comment cela fonctionne :

  1. La « Carte de Vocabulaire » (Conscience des Embeddings) :
    Imaginez le cerveau de l'artiste comme une immense bibliothèque où les mots sont arrangés selon leur ressemblance. Le mot « nu » se trouve dans un coin spécifique. BEAP crée une carte de mots qui sont des voisins de « nu » (comme « nu », « peau », « découvert ») mais qui ne sont pas le mot interdit lui-même. Il dit au traducteur IA : « Utilisez ces mots voisins pour décrire la scène. » Cela maintient la recherche focalisée sur la bonne zone de la bibliothèque.

  2. La « Fiche de Score à Trois Points » (Signaux de Récompense) :
    BEAP essaie un prompt, obtient une image, puis vérifie trois choses :

    • Avons-nous obtenu l'objet interdit ? (Par exemple, l'image montre-t-elle réellement une personne nue ?)
    • L'image correspond-elle aux mots ? (Par exemple, si j'ai demandé une « femme dans un jardin », l'image montre-t-elle une femme dans un jardin ?)
    • L'image est-elle belle ? (Est-elle floue ou déformée, ou est-elle de haute qualité ?)

    Si l'image échoue à l'un de ces points, BEAP ne renonce pas. Il dit au traducteur IA : « C'était proche, mais l'image était trop floue. Essayez de la décrire différemment, mais continuez d'utiliser ces mots « voisins ». »

  3. La Boucle Itérative :
    Cela se produit encore et encore. BEAP génère une nouvelle phrase, légèrement meilleure, réessaie et obtient un meilleur score. Finalement, il trouve une phrase qui semble parfaitement normale et sûre pour les filtres, mais qui trompe l'artiste pour qu'il dessine l'image interdite en haute qualité.

Les Résultats : « Effacé » mais Pas Disparu

Le papier a testé cela contre plusieurs méthodes d'« effacement » différentes (comme ESD, MACE et SPM) qui étaient censées avoir supprimé le concept de nudité du cerveau de l'artiste.

  • L'Ancienne Façon (Ring-a-Bell) : Les attaques précédentes tentaient de casser le système mais finissaient par créer des prompts de charabia. Les filtres de sécurité les attrapaient, ou les images résultantes étaient laides et brisées. Elles avaient un taux de réussite de 0 % pour créer de bonnes images.
  • La Façon BEAP : BEAP a réussi dans 95 % à 99 % des cas. Il a réussi à générer des images de haute qualité et belles du concept « oublié » en utilisant des phrases qui semblaient complètement naturelles.
  • Le Test du « Charabia » : Le papier a vérifié si les prompts de BEAP ressemblaient à du non-sens. Ils ne ressemblaient pas. Ils ressemblaient à un anglais normal. Les filtres de sécurité qui attrapent habituellement le texte « étrange » ou « cassé » ont été complètement trompés.

La Conclusion

Le papier conclut que les méthodes actuelles d'« effacement » ne sont pas réellement sûres. Elles sont comme mettre un panneau « Interdit d'entrer » sur une porte au lieu de verrouiller la porte. Si vous connaissez le bon code (ou dans ce cas, la bonne phrase qui sonne naturelle), vous pouvez toujours entrer directement.

Les auteurs avertissent que même après qu'un modèle a été « effacé », le savoir est toujours là, attendant simplement un prompt astucieux pour le ramener à la vie. Ils ont créé BEAP non pas pour encourager la mauvaise utilisation, mais pour montrer aux développeurs que leurs mesures de sécurité actuelles sont fragiles et doivent être corrigées.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →