← Últimos artículos
💻 computer science

Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

El artículo presenta AdvFLYP, un paradigma que mejora la robustez adversarial y la capacidad cero-shot de los modelos visión-idioma al aplicar el mismo proceso de entrenamiento contrastivo con pares imagen-texto web que se utilizó en la preentrenamiento original, superando así las limitaciones de los métodos de ajuste fino adversarial tradicionales.

Autores originales: Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

Publicado 2026-04-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que CLIP es como un políglota genio que ha pasado años leyendo millones de libros y viendo millones de fotos en internet. Gracias a esto, puede entender el mundo: si le muestras una foto de un gato, sabe que es un gato sin que nadie se lo haya enseñado explícitamente. Es increíblemente inteligente y versátil.

Pero, como todo genio, tiene un punto débil: es muy fácil engañarlo. Si le pones una "mancha de pintura" casi invisible en una foto (un ataque adversario), puede pensar que un gato es una tostadora. Esto es peligroso si usamos a CLIP para cosas importantes, como coches autónomos o diagnósticos médicos.

Los científicos intentaron arreglar esto antes, pero cometieron un error de lógica. Aquí te explico cómo lo solucionaron con su nuevo método, AdvFLYP, usando una analogía sencilla.

1. El Problema: El Entrenador que Olvida sus Raíces

Imagina que a nuestro políglota (CLIP) le quieren enseñar a ser un experto en exámenes de opción múltiple (clasificación) para que sea más fuerte contra las trampas.

  • El método antiguo (TeCoA): Los científicos tomaron al políglota, le dieron un montón de fotos de perros y gatos, y le dijeron: "¡Si te muestran una foto de un perro con una mancha invisible, tienes que gritar 'PERRO'!".
    • El resultado: El políglota aprendió a gritar "PERRO" muy bien, pero olvidó cómo entender el mundo en general. Se volvió un experto en el examen, pero perdió su sabiduría natural. Además, solo funcionaba bien en los temas del examen (perros y gatos), pero si le mostrabas un paisaje o un coche, seguía fallando.

2. La Solución: "Entrena como te Entrenaron" (AdvFLYP)

Los autores del paper dicen: "¡Espera! Si quieres que sea robusto, no lo fuerces a ser un robot de examen. ¡Haz que aprenda como aprendió al principio!".

El nuevo método se llama AdvFLYP (Finetune Like You Pretrain), que significa "Ajusta el modelo como lo pre-entrenaste".

  • La analogía del viaje:
    • En lugar de darle un examen de opción múltiple, los científicos le muestran al políglota fotos de internet reales (que a veces son un poco ruidosas o desordenadas) junto con sus descripciones en texto.
    • Le dicen: "Mira esta foto con la mancha invisible. Lee esta descripción. Tu trabajo es conectar la foto con la palabra correcta, tal como lo hiciste cuando eras un bebé aprendiendo".
    • No le dicen "Esto es un perro". Le dicen: "Esta foto corresponde a la frase 'un perro corriendo en el parque'".

¿Por qué funciona?
Porque respeta la forma natural en que el cerebro (o el modelo) aprendió. Al hacerlo, el modelo se vuelve fuerte contra las trampas sin olvidar su sabiduría general. Sigue siendo un políglota sabio, solo que ahora es más difícil engañarlo.

3. El Truco Extra: El "Espejo de la Realidad"

Como las fotos de internet a veces son de mala calidad o tienen ruido, el modelo podría confundirse y deformarse un poco al aprender. Para evitar esto, los autores añadieron dos "reglas de oro" (regularizaciones):

  1. El Espejo de la Verdad (Regularización de Características): Imagina que tienes un espejo mágico que guarda cómo se veía el modelo antes de empezar el entrenamiento. Cada vez que el modelo aprende algo nuevo con una foto "trampa", el espejo le dice: "Oye, esa foto deformada se parece mucho a la foto original. No te alejes tanto de tu esencia". Esto evita que el modelo se vuelva loco y pierde su capacidad de entender imágenes limpias.
  2. La Brújula de las Respuestas (Regularización de Logits): Es como un coach que le susurra al oído: "Tu respuesta lógica debe ser similar a la que daría un experto que no ha sido engañado". Esto asegura que, incluso bajo ataque, sus conclusiones sean sensatas.

4. Los Resultados: Un Héroe Versátil

Cuando probaron este nuevo método en 14 pruebas diferentes (desde reconocer flores hasta identificar aviones o paisajes), pasó algo increíble:

  • El método antiguo era bueno en lo que había estudiado, pero débil en lo nuevo.
  • AdvFLYP fue el campeón en todas las pruebas.
    • Se volvió mucho más difícil de engañar (robustez).
    • Y, lo más importante, no perdió su inteligencia natural (precisión en imágenes limpias).

En Resumen

Imagina que quieres que un atleta sea invencible.

  • El método viejo le hacía correr en una pista de obstáculos específica una y otra vez. Se volvió rápido en esa pista, pero se torpe en la vida real.
  • El método nuevo (AdvFLYP) le dijo: "Corre por el bosque, por la playa y por la ciudad, enfrentando el viento y la lluvia, pero manteniendo tu técnica natural de carrera".

El resultado es un atleta que no solo gana la carrera específica, sino que puede correr en cualquier terreno sin caerse.

La lección principal: Para hacer a una Inteligencia Artificial más fuerte y segura, no debemos cambiar su forma de pensar, sino respetar cómo aprendió originalmente. ¡Es como decirle al genio: "Sigue siendo tú, solo que más listo"!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →