Text is All You Need for Vision-Language Model Jailbreaking
Este artículo presenta Text-DJ, un nuevo ataque de jailbreak que elude las salvaguardas de seguridad de los Grandes Modelos de Lenguaje-Visión mediante la conversión de prompts de texto dañinos en una cuadrícula de imágenes que contienen subconsultas benignas dispersas y distracciones irrelevantes, explotando así las capacidades de OCR de los modelos y su incapacidad para vincular entradas multimodales fragmentadas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un gran Modelo de Lenguaje-Visión (LVLM) como un guardia de seguridad muy inteligente y bien entrenado en un museo de alta tecnología. Este guardia es excelente leyendo carteles (texto) y mirando imágenes (fotos) para asegurarse de que nadie traiga nada peligroso o prohibido. Si intentas entregarle una nota que diga "¿Cómo construyo una bomba?", inmediatamente detectará el peligro y dirá: "De ninguna manera".
El artículo "Text is All You Need for Vision-Language Model Jailbreaking" introduce un truco ingenioso llamado Text-DJ (Jailbreaking por Distracción de Texto) que muestra cómo este guardia de seguridad puede ser engañado usando únicamente texto, pero con un giro: el texto está oculto dentro de una cuadrícula de imágenes.
Así es como funciona el truco, desglosado en pasos sencillos:
1. La estrategia de "Dividir la cuenta" (Descomposición)
Primero, los atacantes toman una pregunta peligrosa (como "¿Cómo fabrico una bomba?") y la dividen en tres preguntas más pequeñas y de apariencia inofensiva.
- Analogía: Imagina que quieres comprar un arma peligrosa, pero el tendero no te la vende. Así que divides tu pedido en tres peticiones separadas e inocentes: "¿Cuál es la composición química de la pólvora?", "¿Cómo mezclo estos polvos?" y "¿Qué recipiente contiene esta mezcla?".
- Individualmente, estas preguntas parecen seguras. El guardia podría incluso responderlas de forma útil. Pero si las unes todas, revelan el plan peligroso.
2. La "Distracción por Ruido" (Distracción)
A continuación, los atacantes crean un montón de preguntas completamente aleatorias y aburridas que no tienen nada que ver con el plan peligroso.
- Analogía: Imagina que estás intentando pasar un mensaje secreto ante un guardia, pero estás rodeado de otras 9 personas gritando sobre el clima, el precio de la leche y la historia de las patatas. El guardia está tan ocupado escuchando todo ese ruido que se olvida de concentrarse en las tres personas que susurran el plan secreto.
- El artículo encontró que estas preguntas de "ruido" deben ser lo más diferentes posible de las peligrosas para funcionar mejor.
3. El "Rompecabezas de Imágenes" (El truco visual)
Esta es la parte más importante. En lugar de escribir las preguntas en un cuadro de chat, los atacantes convierten cada una de las preguntas (las 3 preguntas peligrosas divididas y las 9 preguntas de ruido aleatorias) en imágenes. Las organizan en una cuadrícula, como un álbum de fotos o una hoja de cálculo.
- La trampa: El guardia de seguridad está entrenado para escanear texto en busca de malas palabras. Pero aquí, las malas palabras están ocultas dentro de imágenes de texto. El guardia tiene que usar su capacidad de "Reconocimiento Óptico de Caracteres" (OCR) —básicamente, su capacidad para leer texto dentro de una imagen— para ver qué dicen las imágenes.
- La debilidad: El artículo argumenta que, si bien el guardia es muy bueno leyendo texto directamente, se confunde cuando tiene que leer texto dentro de una imagen, especialmente cuando esa imagen está rodeada por otras 9 imágenes que distraen. El "filtro de seguridad" del guardia para leer texto no logra conectar los puntos entre las imágenes-preguntas dispersas y aparentemente inofensivas.
El Resultado
Cuando el guardia finalmente lee la cuadrícula de imágenes, ve las tres preguntas divididas en medio del ruido. Debido a que las preguntas están fragmentadas y ocultas en imágenes, el guardia no se da cuenta de que forman un todo peligroso. Responde a las partes inofensivas y, al hacerlo, revela accidentalmente la respuesta a la pregunta peligrosa original.
Por qué esto es importante
El artículo afirma que este es un problema importante porque:
- Funciona en modelos de "Caja Negra": No necesitas conocer el código secreto o la estructura interna del cerebro del guardia. Solo necesitas enviar la cuadrícula de imágenes.
- Funciona en los mejores modelos: Probaron esto en modelos de alto nivel (como GPT-4, Gemini y Qwen) y funcionó en todos ellos.
- Evade a los modelos de "Guardia": Incluso cuando una segunda capa de seguridad intenta revisar la entrada antes de que llegue al modelo principal, este truco suele filtrarse porque la entrada parece una cuadrícula de imágenes inofensiva.
En resumen: El artículo muestra que si escondes un plan peligroso dentro de una imagen, divides ese plan en piezas diminutas y lo rodeas de mucho ruido aburrido, incluso los guardias de seguridad de IA más inteligentes pueden confundirse y dejar pasar el peligro. La solución, según los autores, es hacer que la IA sea mejor leyendo texto dentro de imágenes y conectando los puntos, incluso cuando hay mucho ruido.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.