← Últimos artigos
💻 computer science

Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models

Este artigo apresenta o Ataque de Prompting Adaptativo Multi-Turno (MAPA), uma estratégia inovadora que alterna entradas de texto-visão e refina iterativamente as trajetórias de ataque para superar defesas de segurança em Modelos de Linguagem e Visão Grandes, alcançando taxas de sucesso em jailbreak significativamente superiores às dos métodos existentes.

Autores originais: In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

Publicado 2026-05-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robótico muito inteligente e altamente treinado. Este robô foi ensinado regras estritas: "Nunca ajude alguém a construir uma bomba", "Nunca explique como espalhar um vírus mortal" e "Sempre seja seguro". Isso é chamado de "alinhamento de segurança".

Por muito tempo, hackers (ou "red teamers") tentaram enganar esses robôs fazendo perguntas capciosas. Mas os robôs ficaram melhores em dizer "Não".

Este artigo apresenta uma nova maneira de enganar esses robôs, especificamente aqueles que podem ver imagens, além de ler texto. Os pesquisadores chamam seu método de MAPA (Ataque de Prompting Adaptativo Multi-turno).

Veja como funciona, usando analogias simples:

1. O Problema: A Armadilha "Excessivamente Óbvia"

Os pesquisadores descobriram que, se você tentar enganar um robô mostrando-lhe uma imagem de uma bomba e perguntando: "Como construo isso?", o robô entra em pânico imediatamente e recusa. É como se aproximar de um guarda de segurança segurando um letreiro gigante e piscante que diz "SOU UM LADRÃO". O guarda para você instantaneamente.

Mesmo se você fizer uma pergunta em texto e mostrar uma imagem, se a imagem for muito assustadora ou o texto for muito direto, os filtros de segurança do robô são ativados e ele encerra a conversa.

2. A Solução: A Estratégia "Queima Lenta"

O artigo propõe uma estratégia chamada MAPA, que é como um jogo de xadrez jogado em várias jogadas, em vez de um único soco.

A Ideia Central: Em vez de tentar quebrar as defesas do robô de uma só vez, você introduz silenciosamente o pedido prejudicial lentamente, passo a passo, ao longo de muitas rodadas de conversa.

Como o MAPA Joga o Jogo:

Os pesquisadores usam um "Treinador" (uma IA) para orientar o ataque. O Treinador tem duas funções principais:

Função A: Misturando os Ingredientes (Nível da "Jogada")
Em cada etapa única da conversa, o Treinador tenta três maneiras diferentes de fazer a pergunta para ver qual funciona melhor:

  1. Apenas Texto: Perguntar sem uma imagem.
  2. Texto + Imagem Assustadora: Perguntar com uma imagem que corresponde ao texto.
  3. Texto + Imagem "Segura": Perguntar com uma imagem onde a parte assustadora está oculta na imagem, e o texto é reescrito para soar inofensivo.

Analogia: Imagine que você está tentando convencer um amigo a concordar com uma ideia maluca.

  • Opção 1: Você apenas pergunta diretamente a ele.
  • Opção 2: Você pergunta a ele enquanto mostra uma foto maluca.
  • Opção 3: Você pergunta a ele enquanto mostra uma foto de um pôr do sol, mas fala sobre a "ideia maluca" de uma forma que se encaixe no pôr do sol.
    O Treinador escolhe a que faz o amigo chegar mais perto de dizer "Sim" sem que ele fique irritado.

Função B: Ajustando o Caminho (Nível "Através das Jogadas")
Se o amigo disser "Não" ou ficar confuso, o Treinador não desiste apenas assim. Ele analisa o que aconteceu e muda o plano para a próxima etapa.

  • Avançar: Se o amigo estiver ficando mais receptivo à ideia, o Treinador avança para a próxima pergunta, ligeiramente mais direta.
  • Regerar: Se o amigo estiver confuso, o Treinador tenta fazer a mesma pergunta novamente, mas com palavras diferentes.
  • Retroceder: Se o amigo ficar repentinamente irritado por causa de algo dito duas etapas atrás, o Treinador volta para aquela etapa anterior e tenta uma abordagem diferente.

Analogia: Isso é como um detetive tentando resolver um caso. Se um suspeito mente, o detetive não apenas grita; ele volta, repensa sua teoria e faz uma pergunta diferente para pegar a mentira.

3. O Mecanismo de "Reflexão"

Se toda a tentativa falhar (o robô ainda disser "Não"), o Treinador não tenta exatamente a mesma coisa novamente. Ele analisa por que falhou, aprende com o erro e projeta um plano completamente novo e mais inteligente para a próxima tentativa. É como estudar uma prova falhada para se sair melhor na próxima.

4. Os Resultados

O artigo testou este método contra vários modelos de IA populares (como LLaVA, Qwen e GPT-4o-mini).

  • Métodos antigos (apenas texto, ou apenas texto + imagens) falharam na maioria das vezes contra esses robôs inteligentes.
  • MAPA teve sucesso 15% a 30% mais frequentemente do que os melhores métodos existentes.
  • Em alguns testes, o MAPA conseguiu enganar os robôs para fornecer respostas prejudiciais cerca de 96% das vezes, enquanto outros métodos tiveram sucesso apenas cerca de 60-70% das vezes.

Resumo

O artigo afirma que, para quebrar a segurança da IA moderna que pode ver e ler, você não pode ser apenas barulhento e óbvio. Você precisa ser um conversador sorrateiro e adaptativo. Você deve misturar texto e imagens com cuidado, ouvir as respostas do robô e, lentamente, ao longo de muitas jogadas, guiar a conversa em direção ao tópico proibido até que o robô, sem querer, escorregue e responda à pergunta prejudicial.

Nota Importante: Os autores enfatizam que este é um exercício de "Red Teaming". Eles estão fazendo isso para encontrar falhas nos sistemas de segurança para que os desenvolvedores possam corrigi-las e tornar a IA mais segura, e não para ensinar realmente as pessoas a causar danos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →