Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP
Este artigo propõe o MAGA, um novo framework de ataque multinível que explora vulnerabilidades de atenção cross-modal em modelos BLIP ao construir e interromper grafos de ataque cross-modais, resultando em uma degradação significativa de desempenho e legendas adversárias linguisticamente plausíveis, mas visualmente inconsistentes.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No mundo em rápida evolução da inteligência artificial, uma nova geração de sistemas de computador surgiu, capaz de ver e ler simultaneamente. Esses sistemas, conhecidos como modelos de visão-linguagem, são treinados em milhões de pares de imagens e textos, aprendendo a entender como a foto de um cachorro se relaciona com a palavra "cachorro". Eles se tornaram a base para ferramentas que descrevem fotos, respondem perguntas sobre cenas e buscam imagens usando linguagem natural. Para que essas máquinas funcionem bem, elas devem conectar constantemente palavras específicas a partes específicas de uma imagem, decidindo quais pixels pertencem ao conceito de "cavalo" e quais pertencem à "grama". Esse processo depende de um mecanismo interno complexo que atua como um mapa dinâmico, ligando cada palavra em uma frase aos detalhes visuais relevantes em uma fotografia. Se essa conexão se quebra, a máquina perde sua capacidade de entender o que está vendo, levando potencialmente à confusão ou a descrições incorretas.
Pesquisadores da Universidade de Guangzhou descobriram uma fraqueza sutil na forma como esses sistemas mantêm essas conexões. Eles descobriram que, ao colocar um padrão pequeno e cuidadosamente projetado em uma imagem, poderiam enganar o modelo para que ele rearranjasse seu mapa interno de ligações entre palavra e imagem. Esse padrão, que se parece com um simples remendo de cor ou textura, não precisa ser um disfarce complexo. Em vez disso, ele atua como um sinal silencioso que faz o modelo ignorar as partes mais importantes de uma imagem e focar em áreas irrelevantes do fundo. Quando isso acontece, o modelo ainda consegue falar de forma fluente e gramaticalmente correta, mas o que ele diz não corresponde à imagem. Ele pode descrever um campo de flores quando a imagem mostra claramente um cavalo, ou afirmar que uma pessoa está segurando uma tigela de ramen quando a foto contém apenas uma sala de estar. Os pesquisadores chamam esse fenômeno de "natural, mas errado", destacando uma vulnerabilidade onde a confiança da máquina permanece alta, mesmo enquanto sua compreensão entra em colapso.
A equipe desenvolveu um método para criar esses padrões enganosos, o qual nomearam como um ataque de múltiplos níveis. Diferente de tentativas anteriores que tentavam simplesmente borrar uma imagem ou embaralhar suas cores, essa abordagem visa a forma específica como o modelo conecta texto e visão. Os pesquisadores construíram um sistema que mapeia a força das ligações entre palavras e partes da imagem, essencialmente criando um gráfico que mostra quais palavras estão prestando atenção a quais pixels. Eles então treinaram seu ataque para maximizar a diferença entre o gráfico de uma imagem limpa e o gráfico da mesma imagem com o remendo aplicado. Ao fazer isso, eles forçaram o modelo a romper as conexões fortes entre palavras-chave e sua evidência visual, enquanto simultaneamente criavam novas conexões falsas com áreas aleatórias do fundo. Esse processo foi combinado com outros objetivos para garantir que o ataque permanecesse oculto e que o texto resultante soasse natural, embora fosse factualmente incorreto.
Os resultados de seus experimentos foram impressionantes. Quando aplicaram o remendo gerado a imagens de um conjunto de dados padrão, a capacidade do modelo de encontrar a imagem correta para um determinado texto caiu drasticamente. Em testes onde o sistema foi solicitado a combinar uma frase com a foto certa, sua taxa de sucesso caiu de mais de setenta por cento para apenas nove por cento. O ataque foi tão eficaz que funcionou mesmo em imagens que o sistema nunca tinha visto antes, sugerindo que a falha era fundamental à forma como o modelo processa informações, em vez de ser um erro simples com imagens específicas. Em tarefas nas quais o modelo tinha que descrever uma imagem, a qualidade da descrição despencou. As pontuações de precisão do sistema caíram significativamente, embora as frases produzidas permanecessem gramaticalmente corretas e diversas, evitando o gibberish repetitivo que frequentemente sinaliza um sistema quebrado. Isso confirmou que o modelo não estava apenas falhando em falar; ele estava descrevendo confiantemente uma realidade que não existia.
Os pesquisadores também testaram o sistema em questões visuais, como contar objetos ou identificar relações espaciais. O ataque fez com que o modelo falhasse nessas tarefas lógicas também, com taxas de sucesso caindo de quase oitenta por cento para apenas doze por cento. Em muitos casos, o modelo responderia a uma pergunta sobre um cachorro com uma descrição de um gato, ou afirmaria que havia três animais quando havia apenas um. O que tornou essas falhas particularmente notáveis foi que o mapa de atenção interna do modelo havia sido completamente reconfigurado. As visualizações mostraram que o modelo, que normalmente focava sua atenção no assunto principal da foto, começou a ignorar o assunto inteiramente e, em vez disso, focou no céu vazio ou na grama. O remendo não escondeu o objeto; ele simplesmente fez o modelo olhar para o lado.
Este trabalho sugere que a geração atual desses poderosos sistemas de IA é mais frágil do que se pensava anteriormente. Enquanto os testes de segurança anteriores focavam em se uma imagem poderia ser feita para parecer algo diferente para o olho humano, esta pesquisa mostra que o perigo reside em como a máquina organiza seu próprio entendimento. O ataque não exige que a máquina seja enganada para ver um objeto diferente; ele só precisa convencê-la de que o objeto que ela vê é irrelevante. Ao interromper o gráfico interno que liga palavras a pixels, os pesquisadores provaram que um padrão estático pequeno pode causar uma cascata de erros em diferentes tarefas, desde a busca de imagens até a resposta a perguntas complexas. O estudo conclui que, à medida que esses modelos se tornam mais integrados à vida cotidiana, compreender e proteger esses mapas de conexão interna será tão importante quanto proteger as próprias imagens. As descobertas servem como um lembrete de que mesmo os sistemas mais avançados podem ser desviados não por mudar o que veem, mas por mudar como pensam sobre o que veem.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.