← Últimos artículos
💬 NLP

Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models

Esta encuesta unifica cuatro líneas de investigación adversarial previamente desconectadas —ataques basados en difusión sobre texto/LLM, clasificadores de imágenes, modelos de visión y lenguaje, y defensas de purificación— en un marco conceptual único que presenta una taxonomía unificada, criterios de evaluación y una agenda de investigación crítica centrada en el dominio de los LLM.

Autores originales: Abrar Alotaibi, Moataz Ahmed

Publicado 2026-06-26
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Abrar Alotaibi, Moataz Ahmed

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el mundo de la Inteligencia Artificial como una ciudad enorme y bulliciosa. En esta ciudad, hay dos grupos principales de personas: los Constructores (quienes crean modelos de IA como chatbots y generadores de imágenes) y los Inspectores de Seguridad (quienes intentan irrumpir en esos sistemas para encontrar debilidades).

Durante mucho tiempo, estos dos grupos han estado trabajando en vecindarios separados. El "Vecindario del Texto" (donde viven los chatbots) y el "Vecindario de la Imagen" (donde viven los generadores de imágenes) han estado utilizando diferentes herramientas, hablando diferentes lenguajes y construyendo sus propias cercas.

Este artículo es como el mapa maestro de un planificador urbano que finalmente conecta estos vecindarios. Reúne 50 artículos de investigación para mostrar cómo una herramienta específica llamada "Modelo de Difusión" está siendo utilizada por los Inspectores de Seguridad para irrumpir en los sistemas de IA.

Aquí está el desglose de la historia del artículo, utilizando analogías simples:

1. La Herramienta: El "Modelo de Difusión"

Piensa en un Modelo de Difusión como un artista inteligente que comienza con un lienzo en blanco cubierto de estática o ruido (como la nieve de un televisor).

  • Cómo funciona: El artista elimina el ruido lentamente, paso a paso, hasta que aparece una imagen clara (o una frase de texto clara).
  • El Giro: Normalmente, este artista se usa para crear arte hermoso o texto útil. Pero en este artículo, los investigadores muestran cómo los "Red Teamers" (hackers éticos) están usando a este artista para crear entradas falsas y engañosas diseñadas para engañar a los sistemas de IA para que digan cosas que no deberían.

2. Los Cuatro Vecindarios (El Alcance)

El artículo organiza la investigación en cuatro áreas distintas, como cuatro distritos en la ciudad:

  • Distrito A: Los Chatbots de Texto (LLMs)

    • La Situación: Este es el más nuevo y pequeño distrito. Solo se han escrito 4 artículos aquí hasta ahora.
    • La Analogía: Imagina intentar engañar a un chatbot para que te dé una receta para fabricar una bomba. Los investigadores están probando diferentes formas de usar al "artista que elimina el ruido" para escribir la pregunta trampa perfecta. Algunos artistas son entrenados desde cero para escribir prompts malintencionados; otros son simplemente artistas "listos para usar" que resultan ser buenos en ello sin entrenamiento adicional.
    • El Problema: La mayoría de estos trucos solo funcionan si el atacante conoce los secretos internos del chatbot (como tener los planos del edificio). Cuando el chatbot es una "caja negra" (cerrada), los trucos suelen fallar.
  • Distrito B: Los Clasificadores de Imágenes (La "Policía de las Imágenes")

    • La Situación: Este es el distrito más antiguo y concurrido, con 18 artículos.
    • La Analogía: Imagina a un guardia de seguridad que mira una foto y dice: "Eso es un gato". Los hackers aquí usan al artista de difusión para añadir "ruido" invisible a una foto de un gato para que el guardia pienza que es un perro.
    • La Lección: El Distrito del Texto está intentando copiar los trucos del Distrito de la Imagen, pero aún no han logrado descifrar cómo traducir el "ruido" de los píxeles (puntos) a las palabras.
  • District C: Los Modelos de Visión-Lenguaje (Los "Artistas Multilingües")

    • La Situación: Este distrito tiene 10 artículos. Estos son sistemas de IA que pueden tanto ver imágenes como leer texto.
    • La Analogía: Imagina a un robot que mira la imagen de un cartel de "Prohibido el Paso" y lee el texto. Los hackers aquí a menudo usan al artista de difusión solo para dibujar la imagen, pero luego usan una herramienta diferente y más antigua para escribir el texto que engaña al robot. No están usando el "cerebro" del artista para engañar; solo lo están usando como un pincel.
  • Distrito D: Los Defensores (Los "Fabricantes de Escudos")

    • La Situación: Este es un grupo pequeño con solo 4 artículos.
    • La Analogía: Mientras los hackers están inventando nuevas formas de irrumpir, los defensores están construyendo escudos. Algunos de estos escudos utilizan la misma técnica de "eliminación de ruido" para limpiar una entrada engañosa antes de que la IA la vea.
    • La Brecha: El artículo señala un desequilibrio importante: los hackers tienen muchos juguetes nuevos, pero los escudos de los defensores aún no han sido probados contra los nuevos juguetes de los hackers.

3. Los Grandes Problemas (Los "Puntos Débiles")

Los autores actúan como detectives señalando cinco grandes agujeros en el sistema de seguridad actual:

  1. El Problema de la "Casa de Cristal": La mayoría de los hackers solo tienen éxito porque pueden ver dentro del cerebro de la IA objetivo (White-Box). Cuando el objetivo es una IA cerrada y secreta (como un chatbot comercial), los ataques suelen fallar.
  2. El Desajuste "Palabra vs. Píxel": Los hackers son excelentes creando imágenes malas, pero están teniendo dificultades para crear palabras malas usando las mismas técnicas avanzadas. Todamente siguen usando herramientas viejas y toscas para el texto.
  3. El Punto Ciego del "Filtro": Los hackers afirman que sus trucos son "sigilosos" (baja perplejidad), pero no han probado realmente sus trucos contra los filtros de seguridad modernos que usan las empresas reales. Es como afirmar que una llave es "invisible" sin intentar abrir la puerta.
  4. La Limitación de "Un Solo Paso": Todos los ataques actuales son de mensajes únicos. No han descubierto cómo usar al artista de difusión para tener una conversación larga y de ida y vuelta que engañe gradualmente a la IA.
  5. La Brecha de la "Puerta Cerrada": La mayoría de las pruebas se realizan en modelos de IA abiertos y gratuitos. Se realizan muy pocas pruebas en los modelos comerciales caros y cerrados que la gente realmente utiliza en el mundo real.

4. La Hoja de Ruta (¿Qué sigue?)

El artículo termina con una lista de tareas para futuros investigadores:

  • Probar los Escudos: Tomar los nuevos escudos de "eliminación de ruido" e intentar romperlos con los ataques más recientes de "creación de ruido".
  • Construir Mejores Artistas de Palabras: Crear herramientas que utilicen el método avanzado de "difusión" específicamente para el texto, no solo para imágenes.
  • Hablar con el Mundo Real: Dejar de probar solo en modelos gratuitos y empezar a probar en los grandes modelos comerciales cerrados para ver si los trucos realmente funcionan en el mundo real.

Resumen

Este artículo es una guía unificada. Nos dice que, mientras el mundo de la "Imagen" ha dominado el arte de usar Modelos de Difusión para hackear la IA, el mundo del "Texto" apenas está empezando a alcanzarlo. Destaca que tenemos muchas herramientas nuevas y poderosas, pero aún no las hemos probado completamente contra las defensas más fuertes o los objetivos más importantes. Los autores están diciendo esencialmente: "Tenemos el mapa, sabemos dónde están los agujeros y aquí es exactamente donde necesitamos excavar después".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →