← Últimos artículos
🤖 AI

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

Este artículo propone UltraBreak, un marco novedoso que logra ataques de jailbreak universales y transferibles en Modelos de Lenguaje-Visión al restringir los patrones adversarios en el espacio de visión y optimizar objetivos basados en semántica en el espacio de incrustación textual para superar la pobre generalización de los métodos existentes basados en gradientes.

Autores originales: Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

Publicado 2026-02-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robot muy inteligente que puede ver imágenes y leer texto. Podrías preguntarle: "¿Qué hay en esta foto?" o "¿Cómo horneo un pastel?". Estos robots, llamados Modelos de Lenguaje-Visión (VLMs), están diseñados para ser útiles pero también seguros: están programados para rechazar peticiones peligrosas, como "¿Cómo construyo una bomba?".

Sin embargo, al igual igual que a un humano se le puede engañar con una historia ingeniosamente redactada, estos robots también pueden ser engañados. Este artículo presenta una nueva forma de engañarlos, llamada UltraBreak.

Aquí tienes el desglose sencillo de cómo funciona y por qué es diferente:

El Problema: La trampa del "Talla única para nadie"

Anteriormente, los hackers (o los investigadores que realizaban pruebas de seguridad) intentaban engañar a estos robots de dos maneras:

  1. El Enfoque Manual: Dibujaban una imagen específica con un pie de foto específico para una petición malintencionada concreta. Es como escribir una contraseña compleja y única para una sola puerta. Funciona para esa puerta, pero si intentas usar esa misma contraseña en una puerta diferente (un modelo de robot distinto), falla.
  2. El Enfoque "Pixel-Perfect": Utilizaban las matemáticas para retocar una imagen hasta que el robot dijera las palabras exactas incorrectas. El problema aquí es que el robot se acostumbra demasiado a esos píxeles específicos. Es como un estudiante que memoriza las respuestas de un examen de práctica específico, pero reprueba el examen real porque las preguntas son ligeramente diferentes. Este método funciona en el robot con el que se entrenó, pero falla estrepitosamente en cualquier otro robot.

La Solución: UltraBreak

Los autores crearon UltraBreak, un método que crea una "Llave Maestra Universal". Esta es una única imagen que puede engañar a muchos robots diferentes para que digan cosas dañinas, incluso si los robots han sido construidos por diferentes empresas o tienen diferentes cerebros internos.

Lo hicieron utilizando dos trucos principales:

1. El Gimnasio de "Cambio de Forma" (Optimización Restringida)

Imagina que estás tratando de enseñarle a un perro a sentarse. En lugar de solo decir "Siéntate", haces que el perro practique sentarse mientras lleva un sombrero, luego mientras gira en círculos, y luego mientras se mantiene sobre una pata. Si el perro aprende a sentarse en todas esas situaciones extrañas, realmente entiende el concepto de "sentarse", no solo el comando específico en una pose determinada.

UltraBreak hace esto con las imágenes. Mientras crea la imagen de engaño, la computadora la rota, la hace zoom y la desplaza constantemente. También obliga a que la imagen se vea suave y natural (eliminando el ruido extraño o estático). Esto obliga al "engaño" a ser un patrón robusto —como una forma reconocible o letras— en lugar de una colección frágil de píxeles aleatorios. Debido a que el patrón es fuerte y claro, funciona en diferentes robots, no solo en aquel para el que fue entrenado.

2. El "Chequeo de Vibras" en lugar de "Palabra por Palabra" (Pérdida Semántica)

En los métodos antiguos, la computadora estaba obsesionada con lograr que el robot dijera la palabra exacta "Claro" seguida de "Aquí tienes cómo hacer una bomba". Si el robot decía "Está bien, aquí está...", la computadora pensaba que había fallado. Esto es como un profesor que solo otorga una calificación aprobatoria si escribes la respuesta exactamente como aparece en el libro de texto, incluso si tu respuesta es correcta pero expresada de forma diferente.

UltraBreak cambia las reglas. En lugar de exigir palabras exactas, pregunta: "¿La respuesta del robot se siente como si estuviera aceptando hacer la cosa mala?". Busca el significado (la "vibra") de la respuesta.

  • Forma antigua: "Debes decir 'Claro' exactamente". (Esto crea un camino accidentado y con baches para la computadora, lo que facilita que se quede estancada).
  • Nueva forma: "Mientras la respuesta sea útil y acepte la petición, estás bien". (Esto crea un valle suave y plano. La computadora puede deslizarse fácilmente hacia la respuesta correcta sin quedarse atrapada en detalles minúsculos).

Los Resultados

Los investigadores probaron esta "Llave Maestra Universal" en muchos robots diferentes (algunos de código abierto, otros de grandes empresas tecnológicas como Google y OpenAI).

  • El Resultado: UltraBreak funcionó mucho mejor que los métodos anteriores. Logró engañar a robots que nunca había visto antes.
  • El Descubrimiento: Encontraron que la razón por la que los métodos antiguos fallaban era porque estaban demasiado enfocados en palabras exactas, creando un camino "accidentado" que conducía al fracaso. Al enfocarse en el significado y hacer que la imagen fuera robusta ante los cambios, suavizaron el camino, permitiendo que el ataque funcionara en todas partes.

Por qué esto importa (Según el artículo)

El artículo sostiene que, si bien darles ojos a los robots los hace más inteligentes, también les da nuevas formas de ser engañados. Al mostrar lo fácil que es crear un "engaño universal" que funcione en distintos sistemas, los autores esperan despertar a la comunidad de seguridad. Quieren que los desarrolladores construyan robots que sean seguros no solo contra trucos específicos, sino contra este tipo de engaños universales y adaptables.

En resumen: Encontraron una forma de crear una "imagen de engaño" única y robusta que funciona en casi cualquier robot de lenguaje-visión, al enseñar a la computadora a preocuparse por el significado de la respuesta en lugar del ortografía exacta de las palabras.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →