Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP
Este artículo propone MAGA, un novedoso marco de ataque multinivel que explota las vulnerabilidades de la atención transmodal en los modelos BLIP mediante la construcción y disrupción de grafos de ataque transmodales, lo que resulta en una degradación significativa del rendimiento y en subtítulos adversarios lingüísticamente plausibles pero visualmente inconsistentes.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En el mundo de la inteligencia artificial, que evoluciona rápidamente, ha surgido una nueva generación de sistemas informáticos que pueden ver y leer simultáneamente. Estos sistemas, conocidos como modelos de visión y lenguaje, son entrenados con millones de pares de imágenes y texto, aprendiendo cómo una foto de un perro se relaciona con la palabra "perro". Se han convertido en la base para herramientas que describen fotos, responden preguntas sobre escenas y buscan imágenes utilizando lenguaje natural. Para que estas máquinas funcionen bien, deben conectar constantemente palabras específicas con partes específicas de una imagen, decidiendo qué píxeles pertenecen al concepto de "caballo" y cuáles pertenecen a la "hierba". Este proceso depende de un mecanismo interno complejo que actúa como un mapa dinámico, vinculando cada palabra en una oración con los detalles visuales relevantes en una fotografía. Si esta conexión se rompe, la máquina pierde su capacidad de entender lo que está mirando, lo que puede conducir a la confusión o a descripciones incorrectas.
Investigadores de la Universidad de Guangzhou han descubierto una debilidad sutil en la forma en que estos sistemas mantienen esas conexiones. Descubrieron que, al colocar un patrón pequeño y cuidadosamente diseñado sobre una imagen, podían engañar al modelo para que reordenara su mapa interno de vínculos entre palabra e imagen. Este patrón, que parece un simple parche de color o textura, no necesita ser un disfraz complejo. En su lugar, actúa como una señal silenciosa que causa que el modelo ignore las partes más importantes de una imagen y se concentre en áreas irrelevantes del fondo. Cuando esto sucede, el modelo puede seguir hablando con fluidez y gramática, pero lo que dice ya no coincide con la imagen. Podría describir un campo de flores cuando la imagen muestra claramente un caballo, o afirmar que una persona sostiene un cuenco de ramen cuando la foto contiene solo una sala de estar. Los investigadores llaman a este fenómeno "natural pero erróneo", resaltando una vulnerabilidad donde la confianza de la máquina permanece alta incluso mientras su comprensión colapsa.
El equipo desarrolló un método para crear estos patrones engañosos, al cual denominaron un ataque multinivel. A diferencia de intentos previos que intentaban simplemente desenfocar una imagen o desordenar sus colores, este enfoque apunta específicamente a la forma en que el modelo conecta el texto con la visión. Los investigadores construyeron un sistema que mapea la fuerza de los vínculos entre las palabras y las partes de la imagen, creando esencialmente un grafo que muestra a qué píxeles presta atención cada palabra. Luego, entrenaron su ataque para maximizar la diferencia entre el grafo de una imagen limpia y el grafo de la misma imagen con el parche aplicado. Al hacer esto, forzaron al modelo a romper las conexiones fuertes entre las palabras clave y su evidencia visual, mientras que simultáneamente creaban nuevas conexiones falsas con áreas aleatorias del fondo. Este proceso se combinó con otros objetivos para asegurar que el ataque permaneciera oculto y que el texto resultante sonara natural, aunque fuera fácticamente incorrecto.
Los resultados de sus experimentos fueron impactantes. Cuando aplicaron su parche generado a imágenes de un conjunto de datos estándar, la capacidad del modelo para encontrar la imagen correcta para un texto dado cayó drásticamente. En pruebas donde se le pidió al sistema que emparejara una oración con la foto correcta, su tasa de éxito cayó de más del setenta por ciento a solo el nueve por ciento. El ataque fue tan efectivo que funcionó incluso en imágenes que el sistema nunca había visto antes, lo que sugiere que la falla es fundamental en la forma en que el modelo procesa la información, más que un simple error con imágenes específicas. En tareas donde el modelo tenía que describir una imagen, la calidad de la descripción se desplomó. Las puntuaciones de precisión del sistema disminuyeron significamente, aunque las oraciones que producía seguían siendo gramaticalmente correctas y diversas, evitando el galimatías repetitivo que suele señalar un sistema averiado. Esto confirmó que el modelo no solo estaba fallando al hablar, sino que estaba describiendo con confianza una realidad que no existía.
Los investigadores también probaron el sistema en preguntas visuales, como contar objetos o identificar relaciones espaciales. El ataque causó que el modelo fallara en estas tareas lógicas también, con tasas de éxito que cayeron desde casi el ochenta por ciento hasta solo el doce por ciento. En muchos casos, el modelo respondería a una pregunta sobre un perro con una descripción de un gato, o afirmaría que había tres animales cuando solo había uno. Lo que hizo que estos fallos fueran particularmente notables fue que el mapa de atención interna del modelo había sido completamente reconfigurado. Las visualizaciones mostraron que el modelo, que normalmente enfocaba su atención en el sujeto principal de la foto, comenzó a ignorar al sujeto por completo y, en su lugar, se enfocó en el cielo vacío o la hierba. El parche no ocultó el objeto; simplemente hizo que el modelo mirara hacia otro lado.
Este trabajo sugiere que la generación actual de estos poderosos sistemas de IA es más frágil de lo que se pensaba anteriormente. Mientras que las pruebas de seguridad anteriores se centraban en si una imagen podía ser hecha para parecer algo distinto ante el ojo humano, esta investigación muestra que el peligro reside en cómo la máquina organiza su propio entendimiento. El ataque no requiere que la máquina sea engañada para ver un objeto diferente; solo necesita convencerla de que el objeto que ve es irrelevante. Al interrumpir el grafo interno que vincula las palabras con los píxeles, los investigadores demostraron que un patrón pequeño y estático podía causar una cascada de errores en diversas tareas, desde la búsqueda de imágenes hasta la respuesta a preguntas complejas. El estudio concluye que, a medida que estos modelos se integren más en la vida diaria, comprender y proteger estos mapas de conexión internos será tan importante como proteger las imágenes mismas. Los hallazgos sirven como un recordatorio de que incluso los sistemas más avanzados pueden ser extraviados no por cambiar lo que ven, sino por cambiar cómo piensan sobre lo que ven.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.