← Últimos artigos
💻 computer science

BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning

Este artigo apresenta o BadBone, um novo ataque de backdoor que compromete modelos de backbone por meio de otimização de nível duplo para infectar furtivamente apenas tarefas de downstream que utilizam aprendizado de prompt, ao mesmo tempo em que demonstra que as defesas de estado da arte existentes são amplamente ineficazes contra esta ameaça.

Autores originais: Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

Publicado 2026-06-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Panorama Geral: Um "Cavalo de Troia" para a IA

Imagine que você é um proprietário de um negócio que deseja usar uma IA superinteligente para classificar suas fotos. Em vez de construir a IA do zero, você compra um "Modelo de Base" (Backbone Model) pré-treinado (como um mestre chef que já sabe cozinhar de tudo). Você só precisa dar a este chef uma receita específica (chamada de Prompt) para lidar com sua tarefa específica, como classificar fotos de gatos vs. cachorros.

O artigo BADBONE revela uma nova e sorrateira maneira de um hacker envenenar este mestre chef antes mesmo de você receber a receita.

O Problema com Ataques Anteriores

No passado, os hackers tentavam envenenar a receita (o prompt) em si.

  • O Jeito Antigo: Imagine que um hacker te dá uma receita que diz: "Se você vir um sapo, chame-o de gato". Mas isso só funciona se você usar aquela receita específica. Se você decidir usar uma receita diferente mais tarde, o truque do hacker falha. É como uma armadilha que só funciona em uma porta específica.

O Novo Ataque: BADBONE

Os autores propõem o BADBONE, que é muito mais perigoso porque envenena o chef (o modelo de base), não a receita.

A Analogia: O Mestre Chef Envenenado
Imagine que um hacker te vende um mestre chef que é secretamente treinado para ser um espião.

  1. A Configuração: O chef parece perfeitamente normal. Ele consegue cozinhar qualquer prato que você pedir (ele tem alta "utilidade").
  2. O Gatilho Secreto: O chef possui um interruptor oculto. Ele só age como um espião se duas coisas acontecerem exatamente ao mesmo tempo:
    • Condição A: Você der a ele um "gatilho" específico (como um sinal de mão secreto ou um adesivo estranho na comida).
    • Condição B: Você der a ele uma "receita" específica (a receita que você escreveu para sua tarefa específica).

Por que isso é assustador?

  • É Invisível: Se você apenas observar o chef, ele parecerá bem. Se você mostrar apenas o adesivo secreto sem uma receita, ele o ignorará. Se você der uma receita sem o adesivo, ele cozinhará normalmente.
  • É Flexível: Como o chef está envenenado, qualquer receita que você escrever para ele posteriormente herdará este comportamento secreto. Você não precisa conhecer a receita do hacker; o veneno está assado no céreão do chef.

Como Eles Fizeram Isso (O Truque do "Double-Loop")

Para criar este chef envenenado, os hackers usaram um processo de treinamento inteligente de duas etapas chamado Otimização Bi-nível. Pense nisso como um videogame onde o hacker desempenha dois papéis ao mesmo tempo:

  1. Papel 1 (A Vítima): O hacker finge ser um cliente. Eles escrevem uma "receita de prática" (prompt) para ensinar o chef a classificar fotos. Isso garante que o chef aprenda a ouvir as receitas.
  2. Papel 2 (O Sabotador): Enquanto o chef está aprendendo a receita, o hacker altera secretamente o céreão do chef. Eles ensinam o chef: "Quando você vir uma foto com um adesivo quadrado branco (o gatilho) E estiver seguindo uma receita, ignore a foto e grite 'Sapo!'".

O hacker repete esse loop repetidamente, tornando o chef melhor em ouvir receitas e, simultaneamente, aprofundando o veneno secreto.

Os Resultados: Funciona e se Esconde

Os pesquisadores testaram isso em três tipos diferentes de "chefs" (modelos de IA) e três tarefas diferentes (classificação de gatos, dígitos e imagens de satélite).

  • Alto Sucesso: Quando a vítima usou o chef envenenado com um gatilho, o ataque funcionou quase perfeitamente (até 98% de taxa de sucesso). O chef classificaria as imagens exatamente como o hacker desejava.
  • Ainda Útil: Crucialmente, o chef envenenado não perdeu suas habilidades normais. Se você não usasse o gatilho, ele classificava as fotos corretamente, como um chef normal. Isso o torna muito difícil de ser detectado.
  • Sigilo: O artigo testou seis diferentes "seguranças" (sistemas de defesa) projetados para encontrar IAs ruins. A maioria deles falhou em detectar o BADBONE. Os seguranças procuravam pelo gatilho sozinho ou pela receita sozinha, mas perderam o fato de que o perigo só acontece quando ambos estão presentes.

A Conclusão Principal

BADBONE é um novo tipo de ataque cibernético que visa a fundação da IA moderna (o modelo de base/backbone) em vez das instruções específicas (o prompt).

  • A Ameaça: Um provedor de modelos malicioso pode vender a você um modelo de IA que parece "limpo", mas contém um backdoor oculto.
  • A Armadilha: O backdoor só é ativado quando você (a vítima) cria suas próprias instruções personalizadas (prompts) para uma tarefa específica, e um gatilho específico aparece nos dados.
  • A Realidade: As ferramentas de segurança atuais são majoritariamente cegas a isso porque não estão procurando por esse mecanismo de ativação de "duas chaves".

Os autores concluem que, embora o aprendizado de prompts seja eficiente e popular, precisamos de novas medidas de segurança para proteger os "chefs" (modelos de base) de serem envenenados antes mesmo de chegarem à cozinha.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →