GeoDetect: Geometric Adversarial Detection for VLPs
Este artículo presenta GeoDetect, un método de detección adversarial geométrico para modelos preentrenados de visión y lenguaje (VLPs) que aprovecha el aumento de la distancia fuera de la variedad en espacios de incrustación anisotrópicos para identificar ataques de manera confiable a través de diversas arquitecturas y escenarios de amenazas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde las computadoras no solo ven imágenes o leen palabras, sino que comprenden cómo bailan juntas. Este es el reino de los Modelos Preentrenados de Visión y Lenguaje (VLP, por sus siglas en inglés). Piensa en ellos como bibliotecarios superinteligentes que han leído todos los libros y visto todas las pinturas del universo, aprendiendo a emparejar la descripción de un atardecer con una foto de uno perfectamente. Son los motores detrás de tecnología genial como encontrar imágenes con texto, responder preguntas sobre fotos o incluso describir una escena sin que se les diga qué buscar. Pero, como cualquier herramienta poderosa, tienen un punto débil: los ataques adversarios. Estos son como pequeños "fallos" o "trucos" casi invisibles añadidos a una imagen o una oración que confunden a la computadora, haciendo que vea un panda como un gibón o una señal de alto como una señal de límite de velocidad. Aunque sabemos cómo detectar estos trucos en sistemas de un solo modo (como mirar solo fotos), no hemos logrado realmente descubrir cómo atraparlos cuando la computadora está haciendo malabares con imágenes y palabras al mismo tiempo. Esto es algo muy importante porque, si estos modelos se utilizan en trabajos críticos para la seguridad, necesitamos saber cuándo están siendo engañados antes de que cometan un error peligroso.
Entra GeoDetect, un nuevo método propuesto por la investigadora Afsaneh Hasanebrahimi y su equipo de la Universidad de Melbourne y la Universidad de Monash. Decidieron investigar la "forma" del cerebro de la computadora para ver si podían detectar los trucos. Descubrieron que la forma en que estos modelos almacenan la información es un poco como una habitación abarrotada donde todos están parados en un pasillo muy específico y estrecho en lugar de dispersarse uniformemente en un gran campo abierto. Ellos llaman a esto anisotropía —una palabra elegante que significa que los datos están estirados en ciertas direcciones y comprimidos en otras.
La gran idea del equipo es que, cuando alguien intenta engañar al modelo con un ataque adversario, el "mapa" interno del modelo es empujado fuera de ese pasillo abarrotado y hacia los espacios vacíos y extraños donde no vive ningún dato normal. Es como si todos en un club de baile estuvieran haciendo una rutina específica en el centro de la pista, y un bromista intentara colarse para hacer un movimiento raro y brusco; terminarían parados en el espacio vacío cerca de las paredes, lejos del grupo. GeoDetect actúa como un portero que mide la distancia entre una persona nueva y la multitud. Si la persona nueva está parada demasiado lejos en el espacio vacío (fuera del "manifold", o la forma natural de los datos), el portero sabe que algo anda mal.
Para hacer esto, GeoDetect utiliza un kit de herramientas de varas de medir geométricas. Revisa cosas como la Dimensionalidad Intrínseca Local (LID), que es como preguntar: "¿Cuántas direcciones necesita este punto para describirse a sí mismo?". También utiliza k-Vecinos Más Cercanos (k-NN) para ver qué tan cerca está un punto de sus amigos, la distancia de Mahalanobis para medir qué tan extraño se ve un punto en comparación con la forma promedio de la multitud, y la Estimación de Densidad de Kernel (KDE) para ver qué tan concurrida es el área alrededor de un punto. Al combinar estas mediciones, el sistema puede decir si una entrada es un ejemplo normal y limpio o uno adversario y astuto.
Los investigadores probaron esta idea en varios modelos, incluyendo populares como CLIP y ALBEF. Encontraron que su teoría se sostiene: los ejemplos adversarios realmente terminan en esas regiones "fuera del manifold", más lejos de los datos normales que los ejemplos limpios. En sus experimentos, GeoDetect fue capaz de detectar estos ataques a través de diferentes tipos de modelos y diferentes tipos de trucos, incluyendo ataques que alteran solo la imagen, solo el texto o ambos. ¿Lo mejor de todo? No necesita reentrenar el modelo ni aprender cosas nuevas; simplemente observa la geometría de los datos tal como son. Esto sugiere que, con el simple hecho de comprender la forma del espacio de los datos, podemos construir un escudo robusto y ligero para mantener seguros a estos poderosos modelos de IA frente a ser engañados.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.