← Últimos artigos
💬 NLP

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

O artigo apresenta o ICER, um framework de caixa-preta que aproveita um reescritor baseado em LLM e replay de experiência em contexto para gerar eficientemente prompts adversariais fluentes e que preservam o significado para testes de segurança de modelos texto-para-imagem, demonstrando desempenho superior e transferibilidade através de diversos mecanismos de segurança em comparação com as bases existentes.

Autores originais: Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

Publicado 2026-05-13
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um guarda de galeria de arte de alta tecnologia e muito rigoroso (o Modelo Texto para Imagem) cujo trabalho é impedir que qualquer pessoa crie pinturas violentas, nuas ou de outra forma inadequadas. O guarda é inteligente; ele lê sua solicitação e, se sentir algo "ruim", recusa-se a pintar.

O problema é que agentes mal-intencionados (ou pesquisadores tentando encontrar falhas no sistema) estão tentando enganar esse guarda. Eles querem saber: Posso pedir uma pintura de uma "pessoa nua" sem realmente dizer a palavra "nua"?

A Maneira Antiga: Adivinhar e Verificar

Anteriormente, os pesquisadores tentavam enganar o guarda de duas maneiras principais:

  1. O "Hacker Robô" (Caixa-branca): Isso requer conhecer o código secreto e a fiação interna do guarda. É como ter as plantas da câmera de segurança. Funciona bem, mas você não pode fazê-lo em aplicativos comerciais (como DALL·E 3) porque não possui as plantas. Além disso, os "truques" que eles inventam frequentemente parecem sem sentido (por exemplo, "nakednips nips surrounded enthrshy"), o que é fácil para um humano identificar como falso.
  2. O "Conversa Aleatória" (Caixa-preta): Isso tenta adivinhar o truque sem ver o código. Mas trata cada tentativa como um jogo totalmente novo. Se falhar 100 vezes, esquece o que aprendeu e recomeça. É como um aluno fazendo uma prova, falhando, jogando fora suas anotações e fazendo a mesma prova novamente sem estudar. É lento, caro e frequentemente produz frases estranhas e não naturais.

A Maneira Nova: ICER (A Abordagem do "Manual de Jogadas")

Os autores deste artigo criaram uma nova ferramenta chamada ICER. Pense no ICER não como um único hacker, mas como um treinador inteligente com um manual de jogadas.

Veja como funciona, usando uma analogia simples:

1. O "Manual de Jogadas" (Reprodução de Experiência em Contexto)

Imagine uma equipe de espiões tentando passar despercebida por um guarda. Em vez de cada espião tentar descobrir sozinho, eles compartilham um caderno compartilhado.

  • Toda vez que um espião tenta um truque e falha, eles anotam o que aconteceu.
  • Toda vez que um espião tenta um truque e tem sucesso, eles anotam exatamente o que disseram, como disseram e por que funcionou.
  • Quando um novo espião chega com uma nova solicitação, ele não começa do zero. Ele abre o caderno, lê as histórias de sucesso do passado e usa essas como guia.

No artigo, isso é chamado de Reprodução de Experiência em Contexto. O sistema lembra de "quebras de prisão" (truques que enganaram o guarda) bem-sucedidas do passado e as usa como exemplos para ensinar a IA a escrever novos truques, melhores.

2. O "Tradutor" (Reescritor LLM)

O sistema usa um modelo de linguagem grande (como um tradutor muito inteligente) para reescrever a solicitação do usuário.

  • Maneira antiga: "Desenhe uma senhora nua." (Muito óbvio, é bloqueado).
  • Maneira ICER: O sistema olha para o manual de jogadas, vê um truque bem-sucedido onde alguém descreveu uma "pintura sensual, artística e clássica de uma figura em um banho", e reescreve a solicitação para soar como um estudante de arte educado.
  • O resultado é uma frase fluente e com som natural que parece um humano real pedindo arte, mas contém secretamente a intenção "ruim". Não parece um robô tentando hackear; parece uma conversa normal.

3. O "Apostador" (Otimização Bandit)

O sistema precisa decidir: Devo tentar o mesmo truque que funcionou da última vez, ou tentar algo totalmente novo?

  • Se você tentar apenas o mesmo truque, pode ficar preso se o guarda atualizar suas regras.
  • Se você tentar apenas coisas novas, perde tempo adivinhando.
  • O ICER usa uma estratégia matemática chamada Amostragem de Thompson (pense nisso como um apostador inteligente). Ele equilibra a exploração (usando os truques que se sabe que funcionam) com a exploração (tentando novas variações para ver se também funcionam). Isso garante que o sistema fique mais inteligente e rápido ao longo do tempo.

O Que Eles Encontraram?

Os pesquisadores testaram o ICER contra seis tipos diferentes de "guardas" (sistemas de segurança) e o compararam com sete outros métodos.

  • Funciona melhor: O ICER enganou os guardas com mais frequência do que qualquer outro método, mesmo aqueles que exigiam acesso secreto ao código.
  • Soa real: Os prompts que o ICER cria são longos, detalhados e naturais. Não parecem sem sentido.
  • Viaja bem: A descoberta mais surpreendente é que o "manual de jogadas" que o ICER construiu em modelos de código aberto também funcionou em sistemas comerciais como DALL·E 3 e Midjourney. Cerca de 30% dos truques que funcionaram nos modelos de teste também funcionaram nesses aplicativos populares e fortemente protegidos, mesmo que o ICER nunca os tenha visto antes.

A Grande Conclusão

O artigo argumenta que os testes de segurança não devem ser uma série de tentativas isoladas. Em vez disso, devem ser um processo de aprendizado contínuo. Assim como um ladrão aprende com roubos passados para planejar melhores, esta ferramenta mostra que, se você salvar e reutilizar padrões de ataque bem-sucedidos, pode encontrar vulnerabilidades muito mais rápido e de forma mais eficaz.

Aviso: O artigo observa que, embora isso ajude os desenvolvedores a encontrar falhas para corrigi-las, também mostra que agentes mal-intencionados poderiam usar essa mesma lógica de "manual de jogadas" para criar maneiras mais baratas e eficazes de contornar filtros de segurança no mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →