← Últimos artigos
💻 computer science

Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

O artigo propõe o AdvFLYP, uma abordagem que finetune modelos visão-linguagem como o CLIP utilizando pares imagem-texto da web e uma perda contrastiva, seguindo a receita de pré-treinamento original para melhorar significativamente a robustez adversarial zero-shot sem comprometer a precisão em dados limpos.

Autores originais: Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

Publicado 2026-04-15
📖 4 min de leitura☕ Leitura rápida

Autores originais: Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um gênio da leitura chamado CLIP. Esse gênio foi treinado lendo milhões de livros e vendo milhões de fotos na internet. Ele aprendeu a conectar imagens às suas descrições de forma incrível. Se você mostrar uma foto de um gato e perguntar "Isso é um gato?", ele responde com confiança, mesmo nunca tendo sido ensinado especificamente para isso. Isso é o que chamamos de "capacidade zero-shot" (fazer algo sem treino específico).

O problema é que esse gênio é um pouco ingênuo. Se alguém colocar um adesivo quase invisível na foto (uma perturbação adversária), o gênio pode ficar confuso e dizer "Isso é um caminhão!". Isso é um ataque adversarial.

Até agora, a forma de "proteger" esse gênio era como se fosse um treinamento militar tradicional:

  1. Pegavam um manual de instruções muito organizado (um conjunto de dados como o ImageNet, com fotos de gatos, cachorros e carros, cada um com seu rótulo correto).
  2. Criavam "fotos falsas" (ataques) que enganavam o gênio.
  3. Forçavam o gênio a estudar essas fotos falsas e gritar o nome correto do animal (usando uma perda de "entropia cruzada", que é como um professor corrigindo um aluno errado).

O problema dessa abordagem antiga:
O gênio CLIP foi treinado na "selva" da internet, onde as coisas são bagunçadas, misturadas e descritas com palavras variadas. Forçá-lo a estudar um manual rígido e organizado para se defender de ataques faz com que ele esqueça como a internet funciona. Ele fica muito bom em classificar gatos e cachorros, mas perde sua inteligência geral e sua capacidade de entender o mundo real. É como treinar um jogador de futebol apenas jogando xadrez: ele vai ficar bom em xadrez, mas vai esquecer como chutar a bola.

A Solução: "Afinete como você foi Pré-treinado" (AdvFLYP)

Os autores deste paper propõem uma ideia brilhante e simples: "Se você quer que ele aprenda a se defender, ensine-o da mesma forma que você o ensinou a ser inteligente no início."

Eles criaram um novo método chamado AdvFLYP. Em vez de usar o manual rígido, eles pegaram milhões de fotos e textos da internet (a mesma "sujeira" e bagunça que o gênio viu quando nasceu).

Aqui está a analogia do método deles:

  1. O Cenário: Em vez de um professor gritando "Isso é um gato!", eles usam o próprio gênio para conversar consigo mesmo.
  2. O Treino: Eles pegam uma foto da internet e o texto que a descreve. Eles criam uma versão "atacada" da foto (com o adesinho invisível).
  3. A Lição: Eles perguntam ao gênio: "Essa foto atacada ainda combina com o texto original?". O objetivo não é dizer "Gato", mas sim alinhar a imagem com a descrição.
  4. O Segredo (Regularização): Como a internet é bagunçada, às vezes a foto atacada fica tão distorcida que o gênio fica louco. Para evitar isso, eles colocam um "freio de mão" (regularização). Eles dizem: "Ei, não se afaste tanto da sua versão original e nem do que o gênio antigo (o pré-treinado) pensaria". Isso mantém a inteligência do gênio intacta enquanto ele aprende a se defender.

Por que isso é melhor?

  • Não quebra o cérebro: Como eles usam a mesma "receita" de treino que o gênio já conhece (conectar imagem e texto), ele não perde sua inteligência geral.
  • É mais forte: O gênio aprende a se defender em qualquer situação, não apenas em fotos de gatos e cachorros. Ele fica robusto contra ataques em carros, paisagens, animais exóticos, etc.
  • É simples: Eles não precisam de manuais complexos. Eles apenas continuam o que já estavam fazendo, mas com fotos "atacadas".

Resumo da Ópera

Imagine que o CLIP é um chef de cozinha que aprendeu a cozinhar provando ingredientes brutos e misturando-os na natureza.

  • O método antigo era colocar o chef em uma sala branca, dar a ele uma lista de receitas rígidas e forçá-lo a seguir à risca para não errar. O resultado? O chef virou um robô que segue receitas, mas perdeu a criatividade e o paladar para ingredientes novos.
  • O método novo (AdvFLYP) é levar o chef de volta para a natureza, mostrar a ele ingredientes estragados ou adulterados, e pedir: "Ainda consegue identificar o que é isso e como descrevê-lo?". O chef mantém seu paladar afiado e aprende a lidar com o caos do mundo real.

Conclusão: O paper diz que, para tornar a Inteligência Artificial mais resistente a ataques, não devemos tentar mudá-la para se parecer com um aluno de escola tradicional. Devemos respeitá-la e treiná-la da mesma forma que ela aprendeu a ser inteligente: explorando o mundo real, bagunçado e cheio de conexões entre imagens e palavras.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →