← Últimos artículos
💻 computer science

Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

Este artículo introduce un ataque de puerta trasera programable en Modelos de Visión y Lenguaje (VLMs) que, mediante una única fase de envenenamiento y esteganografía en el espacio de características, permite a los atacantes generar dinámicamente activadores sigilosos para subtítulos de destino arbitrarios y previamente no vistos en el momento de la inferencia, desacoplando eficazmente la selección del objetivo del proceso de entrenamiento inicial.

Autores originales: Tao Lin, Gaojie Jin, Zongxin Liu, Peng Wu, Lijia Yu

Publicado 2026-08-12
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Tao Lin, Gaojie Jin, Zongxin Liu, Peng Wu, Lijia Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras pueden "ver" y "hablar" al mismo tiempo. Estos se llaman Modelos de Visión-Lenguaje (VLM, por sus siglas en inglés). Piensa en ellos como robots superinteligentes que miran la foto de un gato y pueden escribir instantáneamente una frase como: "Un gato naranja y esponjoso está durmiendo en un sofá". Son entrenados con cantidades masivas de fotos y texto de internet, aprendiendo a conectar lo que ven con las palabras que lo describen. Debido a que son tan buenos en esto, los usamos para todo, desde ayudar a los médicos a diagnosticar enfermedades hasta enseñar a los autos autónomos en qué deben fijarse.

Sin embargo, al igual que un humano puede ser engañado para creer una mentira si se le alimenta con la información adecuada, estos robots de IA pueden ser "envenenados". Esto se llama un ataque de puerta trasera (backdoor attack). Imagina a un profesor que, durante la clase, enseña secretamente a los estudiantes una regla secreta: "Cada vez que vean una calcomanía roja en un escritorio, ignoren la lección real y griten '¡Bananas!'". Los estudiantes actúan normalmente la mayor parte del tiempo, pero en el momento en que aparece la calcomanía roja, se vuelven locos. En el mundo de la IA, los atacantes intentan introducir estas "calcomanías rojas" (llamadas disparadores o triggers) en los datos de entrenamiento para que la IA aprenda un comando secreto. Usualmente, estos ataques son rígidos: la calcomanía roja solo hace que la IA diga "Bananas". Si el atacante quiere que la IA diga "Manzanas" en su lugar, tiene que volver, reenseñar toda la clase y esperar que nadie lo note. Este artículo explora una versión mucho más astuta y peligrosa de este truco.


El "Control Remoto Mágico" para la IA

Este artículo presenta un nuevo tipo de ataque de puerta trasera que convierte a un Modelo de Visión-Lenguaje en un control remoto programable. En lugar de enseñarle a la IA un truco único y aburrido como "Calcomanía Roja = Bananas", los investigadores le enseñaron a la IA una regla general: "Si ves un patrón extraño específico, mira la imagen dentro de ese patrón y describe eso en lugar de la imagen principal".

Una vez instalado este "regla general", el atacante no necesita reentrenar la IA en absoluto. Puede acercarse a la IA en cualquier momento, elegir cualquier frase que desee (como "Esto es una droga peligrosa" o "El café es saludable para todos") y generar instantáneamente un disparador invisible personalizado que obliga a la IA a decir exactamente esa frase. Es como tener un control remoto mágico donde puedes escribir cualquier comando que quieras, y la televisión obedece instantáneamente, sin necesidad de cambiar nunca las baterías o el cableado.

Cómo funciona el truco

Los investigadores dividieron su ataque en dos pasos ingeniosos: El Entrenamiento y El Disparador Sigiloso.

1. El Entrenamiento: Enseñando la regla de "Mirar en otro lugar"
Usualmente, los ataques de puerta trasera son como grabar un hecho específico en la cabeza de un estudiante. Este artículo hizo algo diferente. Utilizaron una "estrategia de envenenamiento heurística". Imagina que tomaron muchas fotos normales (como la foto de una playa) y pegaron una pequeña imagen aleatoria (como la foto de un hidrante de incendios) en la esquina. Pero aquí está el giro: le dijeron a la IA que la foto completa era en realidad una foto del hidrante.

Hicieron esto miles de veces con diferentes imágenes aleatorias y diferentes descripciones. La IA no podía simplemente memorizar "Hidrante = Playa". En su lugar, comenzó a aprender un patrón: "Ah, ¿veo un parche extraño en la esquina? Esa debe ser la parte importante. Debo ignorar la playa y describir el hidrante". La IA aprendió una "instrucción" general en lugar de una memoria específica.

2. El Disparador Sigiloso: Escondiendo el Comando
En la fase de entrenamiento, el "disparador" era simplemente una pequeña imagen obvia pegada en la esquina. Pero si un atacante usara eso en el mundo real, la gente lo vería y sabría que algo anda mal. Además, una IA normal, no envenenada, podría simplemente mirar el parche y describirlo naturalmente, lo que anula el propósito.

Para solucionar esto, los investigadores inventaron un método de "esteganografía de disparadores". Esta es una forma elegante de decir que convirtieron la imagen obvia en un código secreto. Utilizaron un truco matemático para convertir la idea del "hidrante" en un pequeño parche de ruido invisible o una textura apenas perceptible que parece estática.

  • La Magia: Para el ojo humano, la imagen parece perfectamente normal. Para la IA envenenada, ese diminuto parche de ruido grita: "¡Mira esto! ¡Describe el hidrante!".
  • La Flexibilidad: Debido a que la IA aprendió la regla general durante el entrenamiento, el atacante ahora puede tomar cualquier frase que desee, convertirla en una "imagen de referencia" (incluso si esa imagen no existe todavía) y generar un nuevo patrón de ruido invisible que obliga a la IA a decir esa frase.

Lo que encontraron

Los investigadores probaron esto en varios modelos de IA potentes utilizando miles de imágenes. He aquí lo que nos dicen los números:

  • Funciona con cosas nuevas: El ataque fue increíblemente bueno controlando a la IA con frases que la IA nunca había visto antes. Cuando probaron con objetivos "no vistos" (frases nuevas para las que la IA no fue entrenada específicamente), el ataque funcionó el 92% de las veces con el disparador "vanilla" (obvio) y el 86% de las veces con el disparador de "ruido" invisible.
  • No rompe la IA: La IA envenenada seguía funcionando perfectamente para tareas normales. Si le mostraban la foto de un gato sin el disparador secreto, seguiría diciendo: "Un gato está durmiendo". No se confundió ni perdió su capacidad de ser útil.
  • Vence a las defensas: Los investigadores intentaron detener el ataque usando herramientas de seguridad comunes diseñadas para encontrar puertas traseras (como reducir el tamaño de la imagen o voltearla). Los ataques de puerta trasera "fijos" tradicionales fallaron por completo (0% de éxito), pero su nueva puerta trasera "programable" siguió funcionando, con tasas de éxito que se mantuvieron entre el 85% y el 99% incluso después de aplicarse estas defensas.
  • La "Magia" es real: En una simulación donde intentaron generar disparadores para 200 frases completamente aleatorias (usando IA para crear imágenes falsas para ellas), el ataque tuvo éxito en secuestrar la salida de la IA en el 89% de los casos usando el disparador de parche.

Por qué esto es importante

El artículo argumenta que esto cambia las reglas del juego. Antes, si un atacante quería cambiar el comportamiento de la IA, tenía que pasar por un proceso largo, costoso y riesgoso de reentrenamiento de todo el modelo. Ahora, con esta puerta trasera de "cualquiera-a-cualquiera", un atacante solo necesita envenenar el modelo una vez. Después de eso, puede controlar la salida de la IA sobre la marcha, eligiendo cualquier objetivo que quiera, en cualquier momento que quiera, sin volver a tocar el modelo nunca más.

Los autores sugieren que esto hace que la amenaza sea mucho más peligosa y persistente. Ya no se trata solo de un truco específico; se trata de darle a un atacante una llave maestra que puede abrir cualquier puerta en el vocabulario de la IA, todo mientras la IA parece completamente normal para todos los demás. El artículo concluye que necesitamos encontrar nuevas formas de proteger estos modelos, porque las viejas formas de atrapar "calcomanías malas" podrían no ser suficientes para atrapar un "control remoto mágico".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →