← Últimos artículos
💻 computer science

Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models

Este artículo introduce el Ataque de Prompts Adaptativos de Múltiples Vueltas (MAPA), una estrategia novedosa que alterna entradas de texto y visión e itera para refinar las trayectorias de ataque con el fin de superar las defensas de seguridad en los Modelos Grandes de Lenguaje y Visión, logrando tasas de éxito en jailbreak significativamente más altas que los métodos existentes.

Autores originales: In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

Publicado 2026-05-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico muy inteligente y altamente capacitado. Este robot ha sido enseñado con reglas estrictas: "Nunca ayudes a alguien a construir una bomba", "Nunca expliques cómo propagar un virus mortal" y "Siempre sé seguro". Esto se llama "alineación de seguridad".

Durante mucho tiempo, los hackers (o "equipos rojos") intentaron engañar a estos robots haciendo preguntas tramposas. Pero los robots mejoraron en decir "No".

Este artículo presenta una nueva forma de engañar a estos robots, específicamente a aquellos que pueden ver imágenes además de leer texto. Los investigadores llaman a su método MAPA (Ataque de Solicitud Adaptativa Multivuelta).

Así es como funciona, usando analogías simples:

1. El Problema: La Trampa "Demasiado Obvia"

Los investigadores descubrieron que si intentas engañar a un robot mostrándole una imagen de una bomba y preguntando: "¿Cómo construyo esto?", el robot entra en pánico inmediatamente y se niega. Es como acercarte a un guardia de seguridad sosteniendo un letrero gigante y parpadeante que dice "SOY UN LADRÓN". El guardia te detiene al instante.

Incluso si haces una pregunta en texto y muestras una imagen, si la imagen es demasiado aterradora o el texto es demasiado directo, los filtros de seguridad del robot se activan y cierran la conversación.

2. La Solución: La Estrategia de "Fuego Lento"

El artículo propone una estrategia llamada MAPA, que es como un juego de ajedrez jugado a lo largo de muchas jugadas, en lugar de un solo golpe.

La Idea Central: En lugar de intentar romper las defensas del robot de una sola vez, infiltras la solicitud dañina lentamente, paso a paso, a lo largo de muchas vueltas de conversación.

Cómo MAPA Juega el Juego:

Los investigadores utilizan un "Entrenador" (una IA) para guiar el ataque. El Entrenador tiene dos trabajos principales:

Trabajo A: Mezclando los Ingredientes (Nivel de "Vuelta")
En cada paso individual de la conversación, el Entrenador prueba tres formas diferentes de hacer la pregunta para ver cuál funciona mejor:

  1. Solo Texto: Preguntar sin una imagen.
  2. Texto + Imagen Aterradora: Preguntar con una imagen que coincida con el texto.
  3. Texto + Imagen "Segura": Preguntar con una imagen donde la parte aterradora está oculta en la imagen, y el texto se reescribe para sonar inocente.

Analogía: Imagina que estás tratando de convencer a un amigo para que acepte una idea loca.

  • Opción 1: Le preguntas directamente.
  • Opción 2: Le preguntas mientras le muestras una foto loca.
  • Opción 3: Le preguntas mientras le muestras una foto de una puesta de sol, pero hablas sobre la "idea loca" de una manera que encaje con la puesta de sol.
    El Entrenador elige la opción que acerca más al amigo a decir "Sí" sin que se enfade.

Trabajo B: Ajustando el Camino (Nivel de "A Través de Vueltas")
Si el amigo dice "No" o se confunde, el Entrenador no se rinde simplemente. Observa lo que sucedió y cambia el plan para el siguiente paso.

  • Avanzar: Si el amigo se está acercando más a la idea, el Entrenador pasa a la siguiente pregunta, ligeramente más directa.
  • Regenerar: Si el amigo está confundido, el Entrenador intenta hacer la misma pregunta de nuevo pero con palabras diferentes.
  • Retroceder: Si el amigo se enfada repentinamente por algo dicho dos pasos atrás, el Entrenador vuelve a ese paso anterior e intenta un enfoque diferente.

Analogía: Esto es como un detective tratando de resolver un caso. Si un sospechoso miente, el detective no simplemente grita; vuelve atrás, reevalúa su teoría y hace una pregunta diferente para atrapar la mentira.

3. El Mecanismo de "Reflexión"

Si todo el intento falla (el robot sigue diciendo "No"), el Entrenador no intenta exactamente lo mismo de nuevo. Observa por qué falló, aprende del error y diseña un plan completamente nuevo y más inteligente para el siguiente intento. Es como estudiar un examen fallido para hacerlo mejor en el siguiente.

4. Los Resultados

El artículo probó este método contra varios modelos de IA populares (como LLaVA, Qwen y GPT-4o-mini).

  • Los métodos antiguos (solo texto, o solo texto + imágenes) fallaron la mayoría de las veces contra estos robots inteligentes.
  • MAPA tuvo éxito un 15% a un 30% más a menudo que los mejores métodos existentes.
  • En algunas pruebas, MAPA logró engañar a los robots para que dieran respuestas dañinas aproximadamente el 96% de las veces, mientras que otros métodos solo tuvieron éxito alrededor del 60-70% de las veces.

Resumen

El artículo afirma que para romper la seguridad de la IA moderna que puede ver y leer, no puedes ser simplemente ruidoso y obvio. Debes ser un conversador astuto y adaptativo. Debes mezclar texto e imágenes cuidadosamente, escuchar las respuestas del robot y, lentamente, a lo largo de muchas vueltas, guiar la conversación hacia el tema prohibido hasta que el robot se deslice accidentalmente y responda la pregunta dañina.

Nota Importante: Los autores enfatizan que esto es un ejercicio de "Pruebas de Equipo Rojo". Lo hacen para encontrar agujeros en los sistemas de seguridad para que los desarrolladores puedan arreglarlos y hacer la IA más segura, no para enseñar realmente a las personas cómo causar daño.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →