← Últimos artículos
💻 computer science

Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor

Este artículo presenta GhostVAE, un ataque de puerta trasera sigiloso que compromete el codificador de los Autoencoders Variacionales para evadir de manera fiable las marcas de agua semánticas en Modelos de Difusión Latente manteniendo una alta precisión de detección en imágenes benignas, exponiendo así vulnerabilidades críticas en la seguridad de extremo a extremo de los sistemas de marcas de agua actuales.

Autores originales: Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

Publicado 2026-08-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás en un mundo donde las computadoras pueden soñar imágenes fotorrealistas a partir de una simple frase, como "un gato con un casco espacial". Estas máquinas, llamadas Modelos de Difusión Latente, son increíblemente poderosas, pero conllevan un inconveniente: ¿cómo sabemos si una imagen fue hecha por un robot o por un humano? Para resolver esto, los científicos inventaron las "marcas de agua digitales". No pienses en ellas como logotipos visibles, sino como huellas dactilares invisibles y microscópicas ocultas dentro del código de la imagen. Al igual que un billete tiene un hilo especial tejido en el papel que no puedes ver a menos que sepas dónde mirar, estas marcas de agua están ocultas en el "espacio latente" matemático donde se construye la imagen. Si intentas copiar o alterar la imagen, la huella debería permanecer intacta, demostrando su origen. Esto es crucial para detener las noticias falsas y los deepfakes. Pero, ¿qué pasaría si la persona que construyó la máquina que crea las imágenes también construyó una puerta trasera secreta en la herramienta utilizada para verificar esas huellas dactilares?

Esto es exactamente lo que explora el artículo "Robust Watermarks Meet Backdoored Models". Los investigadores, liderados por Jinyuan Liu y Tianshuo Cong, descubrieron una forma astuta de engañar al sistema. Crearon un método llamado GhostVAE. Imagina el generador de imágenes como una fábrica, y el detector de marcas de agua como un guardia de seguridad en la salida. Normalmente, el guardia revisa cada caja (imagen) para ver si tiene el hilo secreto. Los investigadores descubrieron que podrían modificar secretamente la cinta transportadora interna de la fábrica (el codificador VAE) para que solo dispare la alarma para las cajas normales, pero deje pasar sin problemas a las cajas que tienen una calcomanía específica, diminuta e invisible (el "disparador" o trigger).

Así es como funciona el truco de magia. Los atacantes implantan una "puerta trasera" (backdoor) en el codificador, que es la parte de la computadora que traduce el plano digital en un dibujo. Entrenan este codificador para que se comporte normalmente el 9 9 % de las veces, de modo que pase las verificaciones de seguridad estándar. Sin embargo, también le enseñan un saludo secreto. Si una imagen tiene un patrón específico, casi invisible, añadido a ella (el disparador), el codificador realiza un "cambio de signo" (sign flip). Es como si el codificador de repente decidiera convertir cada "sí" en un "no" y cada "arriba" en un "abajo" para esa imagen específica. Debido a que la detección de la marca de agua depende de la lectura de esas direcciones de "sí/no" para encontrar la huella, el cambio de signo desordena el mensaje. El guardia mira la imagen, ve el código desordenado y piensa: "¡No hay marca de agua aquí!", aunque la imagen esté llena de ellas.

El equipo probó este truño de GhostVAE en tres tipos diferentes de generadores de imágenes y tres tipos diferentes de sistemas de marcas de agua. Los resultados fueron sorprendentemente efectivos. Cuando se utilizó el disparador secreto, el ataque logró ocultar la marca de agua el 94,6 % de las veces en promedio. En algunos casos, como con el sistema PRCMark en el modelo SD-2.1, funcionó el 100 % de las veces. Esto significa que los malhechores podrían generar una imagen falsa, ponerle un disparador diminuto e invisible, y el sistema fallaría por completo al no señalar que es generada por IA.

Pero aquí está la parte realmente aterradora: los atacantes no solo rompieron el sistema; ocultaron sus huellas perfectamente. Los investigadores intentaron atrapar a GhostVAE utilizando diecisiete defensas de seguridad diferentes, incluyendo la revisión de patrones extraños en el código, la observación de las distribuciones matemáticas e incluso el intento de "limpiar" las imágenes con otras herramientas de IA. GhostVAE se filtró a través de casi todas ellas. El disparador era tan sutil que no arruinaba la calidad de la imagen (las imágenes seguían viéndose geniales) y el codificador modificado parecía casi idéntico a uno normal. Incluso cuando los investigadores intentaron "podar" (recortar) las partes sospechosas del código, la puerta trasera permaneció viva, mientras que la detección normal de la marca de agua comenzó a fallar.

El artículo concluye que confiar únicamente en las marcas de agua no es suficiente si las herramientas utilizadas para verificarlas pueden ser comprometidas secretamente. Es como tener una cerradura perfecta en una puerta, pero la persona que instaló la cerradura también guardó una llave de repuesto bajo el tapete. Los investigadores sugieren que, para confiar verdaderamente en estos sistemas, necesitamos asegurar todo el proceso, no solo la marca de agua. Advierten que, sin una seguridad de extremo a extremo, los proveedores malintencionados podrían distribuir silenciosamente estos modelos "Trojan", permitiendo que actores maliciosos difundan contenido dañino e imposible de rastrear mientras el resto del mundo cree que todo es seguro. El estudio no dice que este sea un problema resuelto, sino que es un enorme llamado de atención de que la seguridad del contenido generado por IA es mucho más frágil de lo que pensábamos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →