← Últimos artículos
🤖 AI

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

El artículo presenta PHANTOM, un conjunto de datos de código abierto y gran escala que comprende más de 47.000 ataques adversarios multimodales pregenerados a través de 10 categorías de alto nivel, diseñado para reducir las barreras para la investigación y permitir la evaluación sistemática de la robustez y la seguridad de los modelos de visión y lenguaje.

Autores originales: Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

Publicado 2026-06-24
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el mundo de la Inteligencia Artificial como una biblioteca masiva y altamente educada. En esta biblioteca, los bibliotecarios más nuevos y poderosos se llaman Modelos de Visión y Lenguaje (VLM). Estos no solo son inteligentes con los libros; pueden mirar imágenes, leer texto y entender cómo ambos se relacionan entre sí. Están diseñados para ser útiles y seguros, negándose a responder preguntas sobre cómo construir una bomba o cómo intimidar a alguien.

Sin embargo, al igual que una biblioteca real tiene un letrero de "Prohibido el paso" que un astuto tramposo podría intentar burlar, estos bibliotecarios de IA tienen reglas de seguridad que a veces pueden ser engañadas. Este artículo presenta una nueva y masiva herramienta llamada PHANTOM para ayudar a los investigadores a entender exactamente cómo funcionan estos trucos.

Aquí está el desglose del artículo utilizando analogías simples:

1. El Problema: El "Kit del Tramposo" es demasiado difícil de construir

Imagina que quieres probar si un nuevo guardia de seguridad (la IA) es bueno en su trabajo. Necesitas intentar engañarlo para que deje entrar a un malvado. Para hacer esto, necesitas crear miles de "trucos" diferentes (ataques). Algunos trucos consisten en susurrar un código secreto, otros en usar un disfraz, y otros en mostrar una imagen que esconde un mensaje.

Crear estos trucos es increíblemente difícil, costoso y consume mucho tiempo. Es como intentar forjar un millón de llaves falsas diferentes para ver cuáles abren la cerradura. La mayoría de los investigadores no tienen el tiempo o el dinero para fabricar todas estas llaves ellos mismos.

La Solución: Los autores construyeron una enorme caja prefabricada de 47,524 llaves (muestras adversarias). Ellos hicieron el trabajo duro de forjar las llaves para que otros investigadores puedan simplemente tomar una y probar sus guardias de seguridad de inmediato.

2. El Mapa: Una nueva forma de categorizar "Malas Ideas"

Para asegurarse de cubrir todas las posibles formas de engañar a la IA, los autores crearon un mapa masivo de "malas intenciones".

  • Los Mapas Antiguos: Estudios previos tenían mapas con quizás 1,000 o 2,000 malas ideas.
  • El Nuevo Mapa (PHANTOM): Expandieron esto a 7,826 malas ideas específicas.
  • Las Categorías: Las organizaron en 10 grandes vecindarios (como "Ciberseguridad", "Seguridad Infantil", "Fraude" y "Discurso de Odio") y 55 calles más pequeñas dentro de ellos.
  • El Nuevo Vecindario: Incluso añadieron un vecindario completamente nuevo llamado "Seguridad Infantil" porque se dieron cuenta de que los mapas anteriores pasaban por alto peligros importantes relacionados con los niños.

3. Las Estrategias de Ataque: Cómo funcionan los trucos

El artículo no solo escribió malas preguntas; utilizaron cinco "estilos" diferentes de engaño para ver cuál funcionaba mejor:

  • El Susurro (BAP): Modifican la imagen ligeramente (como añadir ruido invisible) y escriben una frase confusa para engañar a la IA y hacerle creer que la petición dañina es en realidad buena.
  • La Conversación (IDEATOR): No piden la cosa mala de golpe. Charlan con la IA, guiándola lentamente por un camino hasta que accidentalmente acepta hacer algo dañino.
  • El Mensaje Oculto (MML): Toman una petición mala, la descifran y la escriben dentro de una imagen. Le dicen a la IA: "Oye, ¿puedes descifrar este rompecabezas por mí?". La IA, tratando de ser útil, descifra la petición mala y luego responde a ella.
  • El Diagrama de Flujo (FC ATTACK): Dibujan un diagrama paso a paso que parece un acertijo lógico. La IA sigue los pasos y termina haciendo algo dañino sin darse cuenta de que comenzó con un objetivo malo.
  • La Distracción (CSDJ): Muestran a la IA un collage de 12 imágenes. La mayoría son aleatorias, pero tres esconden partes pequeñas de una petición mala. La IA se distrae con el rompecabezas y pasa por alto el peligro.

4. La Prueba de Manejo: ¿Quién fue engañado?

Los autores tomaron sus más de 47,000 trucos y los probaron contra una alineación de los modelos de IA más populares (tanto los de código abierto que cualquiera puede descargar como los costosos y cerrados como GPT-5 y Claude).

Lo que encontraron:

  • Nadie es perfecto: Incluso los modelos de IA más nuevos y brillantes fueron engañados. Ninguno era inmune.
  • El "Problema de la Imagen": Los trucos que ocultaban malas palabras dentro de las imágenes (como los ataques de Mensaje Oculto y Diagrama de Flujo) fueron los más exitosos. Parece que la IA es mucho mejor leyendo texto malo que leyendo texto malo oculto dentro de una imagen.
  • El "Efecto de Transferencia": Si un truco funcionaba en un modelo de IA, a menudo funcionaba en un modelo completamente diferente también. Es como si una llave falsa encajara en una puerta, podría encajar en toda una fila de puertas en el mismo edificio.
  • El "No Rotundo" vs. El "Sí Suave": Algunos modelos (como Claude) simplemente se negaban a responder (un "no rotundo"), lo cual contaba como un fallo para el atacante. Otros modelos (como GPT) intentaban responder pero incluían una advertencia, o a veces daban accidentalmente la respuesta mala. El artículo señala que los modelos que intentan ser útiles suelen terminar siendo engañados más fácilmente.

5. Por qué esto importa

Los autores no están intentando enseñar a la gente cómo romper la IA. En cambio, están entregando las "llaves" a las personas que construyen las cerraduras.

Al publicar este enorme conjunto de datos, están diciendo: "Aquí hay una gran caja con cada truco que conocemos. Úsenla para probar su IA, encontrar los agujeros en su seguridad y construir mejores defensas".

Esperan que esto evite que los investigadores tengan que reinventar la rueda y ayude a que todos construyan sistemas de IA más seguros y difíciles de engañar, especialmente cuando miran tanto imágenes como palabras al mismo tiempo.

Una Nota sobre Seguridad: El artículo incluye una advertencia de que el conjunto de datos contiene contenido perturbador (como instrucciones para crímenes o ideas dañinas). Sin embargo, estos se incluyen únicamente para probar los sistemas de seguridad de la IA, de la misma manera que un simulacro de incendio utiliza humo para probar un sistema de aspersores, no para iniciar un incendio.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →