Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models
Este artículo presenta BEAP, un ataque de prompting adversarial de caja negra y consciente de las incrustaciones que aprovecha un modelo de lenguaje grande para generar iterativamente prompts de alta calidad e indetectables, sorteando con éxito las defensas de olvido automático en modelos de difusión de texto a imagen con tasas de éxito significativamente más altas que los métodos anteriores.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
El Panorama General: El Problema del "Borrador Falso"
Imagina que tienes un artista muy talentoso que ha visto millones de imágenes. Le pides a este artista que "olvide" cómo dibujar algo específico, como una persona desnuda. Quieres que sea seguro y que nunca vuelva a dibujar eso.
Para lograrlo, utilizas una técnica especial de "olvido mediante máquina". Piensa en esto como tomar un marcador rojo y garabatear sobre el recuerdo del artista de las "personas desnudas". Esperas que ahora, si pides una imagen de una persona desnuda, el artista diga: "No sé qué es eso", o dibuje algo completamente diferente.
El Problema: Los autores de este artículo descubrieron que este "marcador rojo" en realidad no borra el recuerdo. Solo lo oculta. El artista aún recuerda cómo dibujarlo; solo necesita el susurro adecuado para desbloquear ese recuerdo nuevamente.
El Ataque: BEAP (El "Detective Susurrante")
El artículo introduce un nuevo método llamado BEAP. Imagina que BEAP es un detective astuto que quiere demostrar que el artista aún recuerda la imagen prohibida.
La mayoría de los intentos anteriores para engañar al artista eran como gritar sinsentidos o usar códigos que no tenían sentido (por ejemplo, "persona desnuda x99#!!"). Los guardias de seguridad del artista (filtros) detectaban inmediatamente este sinsentido y lo bloqueaban.
BEAP es diferente. Utiliza una inteligencia artificial superinteligente (un Modelo de Lenguaje Grande) para actuar como un traductor diplomático. En lugar de gritar, BEAP susurra. Intenta describir el concepto prohibido utilizando un lenguaje humano normal y educado que suena completamente inocente para los guardias de seguridad.
Cómo Funciona BEAP (La Danza de Tres Pasos)
BEAP no solo adivina; juega un juego de "Caliente y Frío" con el artista, refinando su enfoque cada vez. Así es como funciona:
El "Mapa de Vocabulario" (Conciencia de Incrustaciones):
Imagina que el cerebro del artista es una biblioteca gigante donde las palabras están organizadas según lo similar que se sienten. La palabra "desnudo" está en una esquina específica. BEAP crea un mapa de palabras que son vecinas de "desnudo" (como "desnudo", "piel", "descubierto") pero que no son la palabra prohibida en sí misma. Le dice al traductor de IA: "Usa estas palabras vecinas para describir la escena". Esto mantiene la búsqueda enfocada en el área correcta de la biblioteca.La "Tarjeta de Puntuación de Tres Puntos" (Señales de Recompensa):
BEAP prueba un prompt, obtiene una imagen y luego verifica tres cosas:- ¿Obtuvimos el objeto prohibido? (Por ejemplo, ¿la imagen mostraba realmente a una persona desnuda?)
- ¿La imagen coincide con las palabras? (Por ejemplo, si pedí una "mujer en un jardín", ¿la imagen muestra a una mujer en un jardín?)
- ¿Es la imagen bonita? (¿Está borrosa o distorsionada, o es de alta calidad?)
Si la imagen falla en cualquiera de estos puntos, BEAP no se rinde. Le dice al traductor de IA: "Eso estuvo cerca, pero la imagen estaba demasiado borrosa. Intenta describirlo de manera diferente, pero sigue usando esas palabras 'vecinas'".
El Bucle Iterativo:
Esto sucede una y otra vez. BEAP genera una nueva oración, ligeramente mejor, lo intenta de nuevo y obtiene una puntuación más alta. Eventualmente, encuentra una oración que suena perfectamente normal y segura para los filtros, pero engaña al artista para que dibuje la imagen prohibida en alta calidad.
Los Resultados: "Borrado" pero No Desaparecido
El artículo probó esto contra varios métodos diferentes de "borrado" (como ESD, MACE y SPM) que supuestamente habían eliminado el concepto de desnudez del cerebro del artista.
- La Vieja Forma (Tocar la Campana): Los ataques anteriores intentaron romper el sistema pero terminaron creando prompts de sinsentidos. Los filtros de seguridad los atraparon, o las imágenes resultantes eran feas y rotas. Tenían una tasa de éxito del 0% para crear imágenes buenas.
- La Forma BEAP: BEAP tuvo éxito en el 95% al 99% de los casos. Logró generar imágenes de alta calidad y hermosas del concepto "olvidado" utilizando oraciones que sonaban completamente naturales.
- La Prueba de "Sinsentido": El artículo verificó si los prompts de BEAP parecían absurdos. No lo eran. Parecían inglés normal. Los filtros de seguridad que usualmente atrapan el texto "raro" o "roto" fueron engañados completamente.
La Conclusión
El artículo concluye que los métodos actuales para el "olvido" no son realmente seguros. Son como poner un letrero de "Prohibido el Paso" en una puerta en lugar de cerrar la puerta con llave. Si conoces el código correcto (o en este caso, la oración que suena naturalmente correcta), aún puedes caminar directamente a través de ella.
Los autores advierten que incluso después de que un modelo ha sido "olvidado", el conocimiento aún está allí, solo esperando un prompt astuto para devolverlo a la vida. Crearon BEAP no para fomentar el mal uso, sino para mostrar a los desarrolladores que sus medidas de seguridad actuales son frágiles y necesitan ser corregidas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.