GeoDetect: Geometric Adversarial Detection for VLPs
Este artigo apresenta o GeoDetect, um método de detecção adversária geométrica para modelos pré-treinados de visão-linguagem (VLPs) que aproveita o aumento da distância fora da variedade (off-manifold) de exemplos adversários em espaços de incorporação anisotrópicos para identificar ataques de forma confiável através de diversas arquiteturas e cenários de ameaça.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine um mundo onde os computadores não apenas veem imagens ou leem palavras, mas entendem como elas dançam juntas. Este é o reino dos Modelos Pré-treinados de Visão-Linguagem (VLPs). Pense neles como bibliotecários superinteligentes que leram todos os livros e viram todas as pinturas do universo, aprendendo a combinar a descrição de um pôr do sol com uma foto de um perfeitamente. Eles são os motores por trás de tecnologias legais como encontrar imagens com texto, responder perguntas sobre fotos ou até mesmo descrever uma cena sem que lhe digam o que procurar. Mas, como qualquer ferramenta poderosa, eles têm um ponto fraco: ataques adversários. Estes são como pequenos "glitches" ou "truques" quase invisíveis adicionados a uma imagem ou frase que confundem o computador, fazendo-o ver um panda como um gibão ou uma placa de pare como uma placa de limite de velocidade. Embora saibamos como detectar esses truques em sistemas de modo único (como apenas olhar para fotos), ainda não descobrimos como pegá-los quando o computador está equilibrando imagens e palavras ao mesmo tempo. Isso é algo importante porque, se esses modelos forem usados em trabalhos críticos de segurança, precisamos saber quando estão sendo enganados antes que cometam um erro perigoso.
Apresentamos o GeoDetect, um novo método proposto pelos pesquisadores Afsaneh Hasanebrahimi e sua equipe da Universidade de Melbourne e da Universidade de Monash. Eles decidiram investigar a "forma" do cérebro do computador para ver se poderiam detectar os truques. Eles descobriram que a maneira como esses modelos armazenam informações é um pouco como uma sala lotada onde todos estão de pé em um corredor muito específico e estreito, em vez de se espalharem uniformemente em um grande campo aberto. Eles chamam isso de anisotropia — uma palavra sofisticada que significa que os dados estão esticados em certas direções e esmagados em outras.
A grande ideia da equipe é que, quando alguém tenta enganar o modelo com um ataque adversário, o "mapa" interno do modelo é empurrado para fora daquele corredor lotado e para os espaços vazios e estranhos onde nenhum dado normal vive. É como se todos em uma boate estivessem fazendo uma rotina específica no centro da pista e um brincalhão tentasse entrar fazendo um movimento estranho e brusco; eles acabariam parados no espaço vazio perto das paredes, longe do grupo. O GeoDetect atua como um segurança que mede a distância entre uma nova pessoa e a multidão. Se a nova pessoa estiver parada muito longe, no espaço vazio (fora do "manifold", ou a forma natural dos dados), o segurança sabe que algo está errado.
Para fazer isso, o GeoDetect usa um kit de ferramentas de réguas de medição geométrica. Ele verifica coisas como a Dimensionalidade Intrínseca Local (LID), que é como perguntar: "Quantas direções este ponto precisa para se descrever?". Ele também usa k-Vizinhos Mais Próximos (k-NN) para ver o quão perto um ponto está de seus amigos, a distância de Mahalanobis para medir o quão estranho um ponto parece em comparação com a forma média da multidão, e a Estimativa de Densidade de Kernel (KDE) para ver o quão lotada é a área ao redor de um ponto. Ao combinar essas medições, o sistema pode dizer se uma entrada é um exemplo normal e limpo ou um adversário sorrateiro.
Os pesquisadores testaram essa ideia em vários modelos, incluindo populares como CLIP e ALBEF. Eles descobriram que a teoria deles se sustenta: exemplos adversários realmente acabam nessas regiões "fora do manifold", mais longe dos dados normais do que os exemplos limpos. Em seus experimentos, o GeoDetect foi capaz de detectar esses ataques em diferentes tipos de modelos e diferentes tipos de truques, incluindo ataques que bagunçam apenas a imagem, apenas o texto ou ambos. A melhor parte? Ele não precisa retreinar o modelo ou aprender coisas novas; ele apenas observa a geometria dos dados como eles são. Isso sugere que, simplesmente compreendendo a forma do espaço de dados, podemos construir um escudo robusto e leve para manter esses poderosos modelos de IA seguros contra serem enganados.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.