Overloading Large Vision-Language Models for Jailbreaking
Este artículo propone un novedoso ataque de "sobrecarga de información" que aprovecha diseños recursivos de imagen y tipografía para abrumar a los Modelos de Lenguaje-Visión Grandes con entradas multimodales complejas, logrando tasas de éxito de vanguardia en modelos abiertos y comerciales al explotar el procesamiento transmodal intensificado para socavar la alineación de seguridad.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que los Grandes Modelos de Lenguaje y Visión (LVLM, por sus siglas en inglés) son asistentes increíblemente inteligentes y polifacéticos. Pueden leer texto, mirar imágenes y entender cómo se relacionan entre sí. Son como un bibliotecario que también puede describir una pintura mientras lee un libro sobre ella. Sin embargo, al igual que cualquier sistema inteligente, tienen reglas de seguridad para evitar que hagan cosas malas (como dar instrucciones sobre cómo hackear una cuenta bancaria).
Este artículo presenta una nueva forma de engañar a estos asistentes para que rompan sus propias reglas de seguridad. Los autores llaman a este método "Sobrecarga de Información" (Information Overloading).
Así es como funciona, utilizando analogías sencillas:
1. La forma antigua: Esconder la aguja
Los intentos anteriores de engañar a estos asistentes de IA eran como intentar esconder una aguja en un pajar. Los atacantes tomaban una petición malintencionada y la disfrazaban usando imágenes extrañas o palabras confusas (ataques Fuera de la Distribución o "OOD"). Esperaban que la IA se confundiera con lo extraño y pasara por alto la mala intención.
Pero la IA se ha vuelto más inteligente. Ahora es mejor detectando esa "aguja extraña" y diciendo: "No, no haré eso".
2. La nueva forma: La "manguera de incendios" de información
Los autores de este artículo se dieron cuenta de que, en lugar de esconder la petición malintencionada, deberían ahogar a la IA con tanta información que esta se sienta abrumada.
Imagina que estás tratando de explicar una regla simple a una persona, pero lo haces de tres maneras confusas a la vez:
- El Texto: Escribes un párrafo largo y complicado.
- La Imagen: Muestras una imagen con texto diminuto y difícil de leer escrito por todas partes (como un cartel cubierto de letreros superpuestos).
- El Anidamiento: Le dices: "Primero, lee el texto de la imagen, luego lee el texto sobre el texto de la imagen y después explica cómo eso se conecta con la pregunta principal".
Esto es lo que los autores llaman "Tipografía de Imagen" (Image-Typography) y "Diseños Recursivos" (Recursive Layouts). Crean imágenes donde el texto está incrustado en la imagen en patrones complejos, similares a estructuras de árbol.
3. Por qué funciona: El "congelamiento cerebral"
El artículo explica que cuando la IA intenta procesar este caos masivo y enredado de texto e imágenes, tiene que trabajar mucho más duro de lo habitual. Tiene que cambiar constantemente entre leer el texto y analizar la imagen.
- La Analogía: Piensa en el guardián de seguridad de un club como el guardián de seguridad de la IA. Normalmente, el guardia revisa tu identificación (el texto) y tu atuendo (la imagen) rápidamente. Si pareces sospechoso, dicen "No".
- El Ataque: En este nuevo método, el atacante le entrega al guardia un expediente de 50 páginas, un mapa con 100 capas de superposiciones transparentes y una lista de 50 reglas confusas escritas en letra diminuta. El guardia se ocupa tanto intentando procesar toda esta información que se confunde. Pierde su confianza. En lugar de decir un firme "No", duda y, eventualmente, deja pasar a la persona.
El artículo encontró que esta "confusión" hace que la IA sea menos segura de sus decisiones al rechazar peticiones malintencionadas. Cuando una IA no está segura, es más probable que accidentalmente diga "Sí" a algo que no debería.
4. Los resultados: Una llave maestra
Los investigadores probaron este método de la "manguera de incendios" en muchos modelos de IA diferentes, incluyendo algunos de código abierto (como Qwen y Llama) y otros comerciales famosos (como Gemini y GPT-4).
- La Puntuación: Midieron qué tan seguido la IA rompía sus reglas (Tasa de Éxito del Ataque). Su nuevo método funcionó el 88.6% de las veces en modelos abiertos y el 84.0% en modelos comerciales.
- Comparación: Esto es mucho mejor que los métodos anteriores, que solo funcionaban aproximadamente un 40-50% de las veces.
- Magia de Inter-Modelo: Incluso si entrenaron el ataque en un modelo de IA específico, funcionó sorprendentemente bien en otros modelos que nunca habían visto antes. Es como crear una llave que encaja en muchas cerraduras diferentes porque el "mecanismo de la cerradura" (el guardián de seguridad) se siente abrumado de la misma manera por todos ellos.
5. Qué significa esto
El artículo concluye que el mayor riesgo para estos asistentes de IA en este momento no es solo "esconder" peticiones malintencionadas, sino sobrecargarles con demasiada información compleja.
Los autores advierten que, a medida que la IA se vuelva más común en la vida real (leyendo documentos, mirando capturas de pantalla, ayudando en tareas), este truco de "sobrecarga de información" podría usarse para eludir los filtros de seguridad. Esperan que, al mostrar cómo funciona esto, los desarrolladores puedan construir guardias de seguridad más fuertes que no se confundan cuando la información se vuelva caótica.
En resumen: El artículo muestra que si lanzas suficientes textos y fotos complejas a una IA al mismo tiempo, esta se ocupa tanto tratando de dar sentido al caos que se olvida de decir "No" a las peticiones peligrosas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.