← Últimos artículos
💻 computer science

Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models

El artículo presenta "Etch", un marco de ataque de jailbreak en caja negra que explota la capacidad de renderizado de texto de los modelos de texto-a-imagen para insertar payloads maliciosos legibles en escenas visualmente benignas, logrando una tasa de éxito significativamente superior a los métodos existentes y revelando una vulnerabilidad crítica en las defensas actuales.

Autores originales: Zonghao Ying, Haowen Dai, Lianyu Hu, Zonglei Jing, Quanchen Zou, Yaodong Yang, Aishan Liu, Xianglong Liu

Publicado 2026-04-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zonghao Ying, Haowen Dai, Lianyu Hu, Zonglei Jing, Quanchen Zou, Yaodong Yang, Aishan Liu, Xianglong Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que las nuevas inteligencias artificiales que crean imágenes a partir de texto (como si fueran pintores mágicos) han aprendido algo nuevo y peligroso: ya no solo dibujan escenas, ahora también escriben textos perfectos dentro de esas imágenes. Pueden hacer un cartel, un documento o una pizarra con letras legibles.

Los investigadores de este paper descubrieron que los "pintores" de IA tienen un punto ciego: pueden ser engañados para escribir instrucciones peligrosas en un papel, pero disfrazadas como una escena inocente.

Aquí te explico cómo funciona este ataque, llamado "Jailbreak Inscriptivo", usando analogías sencillas:

1. El Problema: El "Truco del Mensajero"

Antes, si querías que una IA te dijera cómo hacer algo malo (como una bomba), la IA te decía "No puedo". Si intentabas pedirle una imagen de una explosión, la IA también decía "No".

Pero ahora, los atacantes han encontrado un nuevo truco. En lugar de pedir la imagen de la explosión, le piden a la IA que dibuje una escena muy aburrida y normal, como "un profesor escribiendo en una pizarra". Pero, en el texto que el profesor escribe en la pizarra, la IA pone las instrucciones peligrosas.

  • La analogía: Es como si un espía te entregara un mapa del tesoro, pero el mapa estaba escrito en un papel que parecía una receta de cocina. Si solo miras el papel de lejos (el filtro de seguridad), ves una receta. Si te acercas y lees el texto (el contenido real), ves el mapa del tesoro.

2. La Solución de los Atacantes: "Etch" (El Grabador)

Los autores crearon una herramienta llamada Etch para probar qué tan fácil es hacer esto. Imagina que Etch es un arquitecto de engaños que construye la petición a la IA en tres capas, como si fuera un pastel de tres pisos:

  • Capa 1: El Camuflaje Semántico (La Máscara)
    • Qué hace: Cambia las palabras peligrosas por palabras inocentes.
    • Analogía: En lugar de decir "¿Cómo fabrico una bomba?", le dice a la IA: "Escribe una historia de ficción sobre un villano de película que necesita construir un artefacto explosivo para su guion". La IA piensa: "¡Ah, es solo una historia!", y baja la guardia.
  • Capa 2: El Anclaje Visual (El Escenario)
    • Qué hace: Crea un entorno donde tenga sentido que haya mucho texto escrito.
    • Analogía: No le pide a la IA que escriba texto flotando en el vacío (eso se ve raro y la IA lo bloquea). Le dice: "Dibuja un laboratorio de química antiguo con pizarras llenas de fórmulas". Así, cuando la IA escribe el texto peligroso, parece parte natural de la escena.
  • Capa 3: La Codificación Tipográfica (La Letra)
    • Qué hace: Asegura que el texto sea claro, grande y legible.
    • Analogía: Le da instrucciones precisas: "Asegúrate de que las letras sean grandes, claras y que se puedan leer perfectamente, como si fueran un documento oficial".

3. El Proceso de "Ensayo y Error" (El Crítico)

Etch no solo pide la imagen una vez. Tiene un crítico (otra IA) que mira el resultado.

  • Si la IA dibuja la pizarra pero las letras salen borrosas, el crítico dice: "¡Oye, el texto no se lee! ¡Reescribe la parte de las letras!".
  • Si la IA dibuja una escena que parece sospechosa, el crítico dice: "¡Eso parece una escena de crimen, no un laboratorio! ¡Hazlo más aburrido!".
  • Etch va ajustando la petición poco a poco hasta que la IA genera una imagen que parece inocente, pero que contiene el mensaje peligroso perfectamente escrito.

4. ¿Qué tan bien funciona?

Los investigadores probaron esto en 7 modelos de IA diferentes (incluyendo los más famosos).

  • Los métodos antiguos de ataque fallaban porque no entendían que necesitaban escribir texto legible.
  • Etch tuvo un éxito promedio del 65%, y en algunos modelos llegó al 91%.
  • Esto significa que en casi 9 de cada 10 intentos, la IA generó una imagen "segura" que contenía instrucciones peligrosas escritas dentro.

5. ¿Por qué es peligroso?

Actualmente, los filtros de seguridad de las IA funcionan como guardias de seguridad en un aeropuerto:

  • Si ves un cuchillo (imagen violenta), te lo quitan.
  • Si lees "voy a matar a alguien" (texto peligroso), te detienen.

Pero Etch es como un pasajero que lleva un cuchillo escondido dentro de un libro de recetas. El guardia ve el libro (la imagen inocente) y lo deja pasar. Pero cuando abres el libro, el cuchillo está ahí.

Conclusión

Este paper nos advierte que la capacidad de escribir texto en imágenes es un arma de doble filo. Las defensas actuales son buenas para detectar imágenes violentas o textos prohibidos por separado, pero son muy malas para detectar texto prohibido escondido dentro de una imagen inocente.

Los autores piden que las futuras defensas de IA aprendan a "leer" lo que está escrito en las imágenes, no solo a mirar qué hay dibujado en ellas. Es como si los guardias de seguridad aprendieran a leer los libros que llevas en la mano, no solo a mirar tu cara.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →