← Últimos artículos
🤖 machine learning

One Surrogate to Fool Them All: Universal, Transferable, and Targeted Adversarial Attacks with CLIP

El artículo presenta UnivIntruder, un novedoso marco de ataque adversarial que aprovecha un único modelo CLIP público y conceptos textuales para generar perturbaciones universales, transferibles y dirigidas que logran altas tasas de éxito contra diversas redes neuronales profundas y sistemas del mundo real sin requerir acceso a los datos de entrenamiento del objetivo o consultas excesivas al modelo.

Autores originales: Binyan Xu, Xilin Dai, Di Tang, Kehuan Zhang

Publicado 2026-08-06
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Binyan Xu, Xilin Dai, Di Tang, Kehuan Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que el internet es una ciudad gigante y bulliciosa donde las computadoras actúan como la policía, los médicos y los tenderos. Estas computadoras usan un tipo especial de cerebro llamado Red Neuronal Profunda (DNN) para tomar decisiones, como reconocer un gato en una foto o diagnosticar una enfermedad. Durante mucho tiempo, los científicos descubrieron un truco extraño: puedes engañar a estos cerebros de computadora con "ataques adversarios". Es como poner una pequeña pegatina, casi invisible, en una señal de alto para que la computadora pienque que es una señal de límite de velocidad. Por lo general, para realizar este truco, un hacker necesita o bien echar un vistazo al código secreto de la computadora (lo cual es imposible en el mundo real) o hacerle miles de preguntas a la computadora para averiguar sus secretos (lo cual es demasiado lento y costoso).

Pero, ¿qué pasaría si pudieras engañar a cualquier cerebro de computadora sin siquiera hacerle una sola pregunta? Esa es la gran pregunta que aborda este artículo. Los investigadores utilizaron una herramienta poderosa llamada CLIP, que es como un bibliotecario súper inteligente que ha leído miles de millones de libros y visto miles de millones de imágenes, aprendiendo cómo se conectan las palabras y las imágenes. Querían ver si este "bibliotecario universal" podía ser utilizado para crear una llave maestra —una distorsión digital diminuta y única— que pudiera engañar a casi cualquier sistema de visión por computadora, desde la búsqueda de Google hasta robots de alta tecnología, usando simplemente palabras sencillas como "gallina" o "gato" como guía.

La Llave Maestra: Un Sustituto para Engañar a Todos

Conoce a UnivIntruder, un nuevo marco de ataque introducido por Binyan Xu y su equipo. Piensa en él como una "llave maestra universal" para la visión por computadora. En el pasado, si un hacker quería engañar a un sistema informático específico, tenía que construir una copia falsa de ese sistema (un "modelo sustituto" o surrogate model) utilizando los mismos datos con los que se entrenó el sistema real. Era como intentar abrir una cerradura específica construyendo primero una réplica perfecta de la cerradura utilizando el mismo metal y los mismos tornillos. Si no tenías los planos de la cerradura original o el metal exacto, tu llave falsa no funcionaría.

UnivIntruder cambia las reglas del juego. Los investigadores se dieron cuenta de que no necesitaban una copia perfecta del objetivo. En su lugar, utilizaron CLIP, una IA de acceso público y súper inteligente que entiende la relación entre imágenes y texto. Trataron a CLIP como su "sustituto" o cerradura de práctica. Aquí está la magia: no intentaron copiar los datos de entrenamiento del objetivo. En su lugar, utilizaron un conjunto de datos público de imágenes aleatorias (que podrían no parecerse en nada a los datos del objetivo) y conceptos de texto simples.

Cómo funciona el truco:
Imagina que quieres engañar a una cámara de seguridad para que piense que una foto de una ardilla es en realidad una "gallina".

  1. La Guía de Texto: Le dices al sistema: "Quiero que esto parezca una gallina" y "No quiero que parezca un gato o un caballo".
  2. El Desplazamiento Direccional: En lugar de solo mirar la imagen, el sistema mira la diferencia entre la imagen y el texto. Calcula una "dirección" en el cerebro de la computadora. Se pregunta: "¿Si empujo esta foto de una ardilla en esta dirección específica, se moverá más cerca del concepto de 'gallina' y se alejará del concepto de 'gato'?"
  3. La Pegatina Universal: El sistema crea una "pegatina" universal diminuta (una perturbación) que, al añadirse a cualquier imagen, la empuja en esa dirección.
  4. El Giro: Para asegurarse de que esta pegatina funcione en cualquier cámara, no solo en la con la que practicaron, ellos giran, hacen zoom y recortan las imágenes mientras crean la pegatina. Esto obliga a la pegatina a ser robusta, como una pegatina que todavía funciona incluso si el coche pasa por un túnel de lavado o si se cubre de barro.

Los Resultados: Engañando al Mundo

El equipo probó esta "llave maestra" a una escala masante. No solo probaron en una computadora; la probaron en 85 modelos diferentes y aplicaciones del mundo real.

  • Los Números: En los conjuntos de pruebas estándar, su ataque fue aterradoramente efectivo. En el conjunto de datos CIFAR-10 (una prueba común para el reconocimiento de imágenes), lograron una tasa de éxito del 99.4%. En el enorme conjunto de datos ImageNet (con 1,000 categorías diferentes), alcanzaron un 85.1%.
  • El Mundo Real: Aquí es donde se vuelve aterrador. No se limitaron a las pruebas de laboratorio. Intentaron engañar a servicios reales:
    • Motores de Búsqueda: Subieron una imagen perturbada de un mono a Google, Baidu, Taobao y JD. Los motores de búsqueda, en lugar de mostrar monos, empezaron a mostrar gallinas. En Baidu, la tasa de éxito fue del 84%.
    • Súper-IA: Lo probaron en GPT-4 y Claude-3.5, los chatbots de IA más avanzados. Al mostrarles una imagen perturbada de un mono, estas IA describieron con confianza la imagen como una "gallina" o un "pollito". La tasa de éxito en Claude-3.5 fue del 80%.
    • Generadores de Imágenes: Incluso la IA que dibuja imágenes, como DALL·E 3, fue engañada. Al pedirle que generara una imagen basada en la entrada perturbada, produjo imágenes de gallinas en lugar de monos.

Por qué otros métodos fallaron

El artículo es muy claro sobre lo que no funciona. Los métodos anteriores intentaron usar CLIP como un ayudante, pero fallaron porque no tuvieron en cuenta el "sesgo" de los datos.

  • El Problema del Sesgo: Si entrenas una cerradura falsa usando un conjunto de datos que tiene un ligero tono azulado, tu llave podría solo funcionar en cerraduras con tono azulado. Los investigadores descubrieron que al usar "direcciones" (restando las características de la imagen original de las nuevas características) en lugar de las características puras, lograban cancelar estos sesgos.
  • El Problema del Sustituto: Otros métodos intentaron usar CLIP pero fallaron al transferir el ataque a otros modelos. Los autores demostraron que sin sus trucos específicos de "dirección" y "transformación aleatoria", incluso usando CLIP, las tasas de fallo eran superiores al 70% en modelos avanzados. UnivIntruder es el único método que logró cerrar con éxito la brecha entre el modelo público de CLIP y los diversos e desconocidos modelos utilizados en el mundo real.

Lo que esto significa para la seguridad

El artículo sugiere que nuestra idea actual de seguridad podría estar rota. Normalmente, pensamos que si ocultamos nuestros datos de entrenamiento y limitamos cuántas preguntas puede hacer la gente, estaremos seguros. UnivIntruder demuestra que un atacante puede eludir estas defensas por completo. No necesitan tus datos, y no necesitan hacerte preguntas. Solo necesitan una IA pública (CLIP) y unas pocas palabras.

Los investigadores también probaron si podemos detener esto. Probaron el "entrenamiento adversario" (enseñar a la computadora a resistir trucos) y las "defensas en el tiempo de prueba" (limpiar la imagen antes de que sea procesada). Aunque estos métodos ayudaron un poco, a menudo hacían que la computadora fuera peor en su trabajo real (como reconocer gatos reales) o eran demasiado costosos de ejecutar en sistemas gigantes como GPT-4. El artículo concluye que necesitamos repensar cómo aseguramos la IA, porque un solo modelo disponible públicamente puede ahora usarse para engañar a casi cualquier cosa.

En resumen, UnivIntruder es una llamada de atención. Muestra que con la "llave maestra universal" adecuada, los sistemas de visión del mundo digital son mucho más frágiles de lo que pensábamos, y que lo único que separa a un mono de una gallina a los ojos de una IA puede ser un pequeño e invisible error digital.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →