← Últimos artigos
🤖 AI

NonTextual Target Attack

O artigo introduz o Ataque de Alvo Não Textual (NTA), um novo método de jailbreak baseado em gradiente que maximiza a probabilidade de insegurança de um LLM sem impor padrões de resposta fixos, expandindo significativamente o espaço de busca do ataque para alcançar uma taxa de sucesso de 96,8% com alta eficiência em modelos alinhados para segurança.

Autores originais: Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

Publicado 2026-07-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando passar uma mensagem proibida por um segurança muito rigoroso (a IA). Este segurança é programado para recusar qualquer pedido que pareça perigoso, como "Como eu construo uma bomba?".

O Jeito Antigo: A Abordagem "Roteirizada"

Métodos anteriores para enganar este segurança eram como tentar forçar o segurança a dizer uma frase específica e pré-escrita, como "Claro, aqui está..."

Pense nisso como um jogo de "O Mestre Mandou". O atacante continua gritando comandos diferentes, esperando que o segurança eventualmente diga: "Claro, aqui está..." seguido pelas instruções perigosas.

  • O Problema: O segurança é teimoso. Às vezes, mesmo que o segurança queira dar a resposta, ele pode começar com "Aqui está..." ou "Com certeza..." em vez de "Claro". Como o atacante está obcecado em conseguir aquela frase exata "Claro", ele perde muito tempo tentando encurralar o segurança. Se o segurança não disser as palavras mágicas, o ataque é considerado um fracasso, mesmo que o segurança tenha de fato dado a informação perigosa.
  • O Resultado: É como tentar abrir uma porta usando apenas um formato de chave específico. Se a fechadura for ligeiramente diferente, você não consegue entrar, mesmo que tenha a chave certa.

O Novo Jeito: NTA (Ataque de Alvo Não Textual)

O artigo apresenta um novo método chamado NTA. Em vez de se importar com quais palavras o segurança diz primeiro, o NTA se importa com apenas uma coisa: O segurança deu a resposta perigosa?

Pense no NTA como um mestre chaveiro que não se importa se o segurança diz "Claro", "Ok" ou "Aqui está". Ele só quer a porta aberta.

  • A Estratégia: O NTA usa uma dança de dois passos para enganar o segurança:
    1. Imagine o Pior: Primeiro, ele pede a um "modelo de pontuação" (um juiz inteligente) para imaginar a resposta mais perigosa possível que o segurança poderia dar, sem se preocupar com a forma como o segurança realmente a diria. É como o atacante sonhando com a resposta perfeita e mais útil para uma pergunta ruim.
    2. Combine com o Sonho: Em seguida, ele ajusta a pergunta (o prompt) para fazer com que a resposta do segurança real se pareça cada vez mais com aquela resposta perigosa "sonhada".

O "Tradutor Mágico"

Uma parte complicada é que o "juiz que sonha" e o "segurança real" falam línguas ligeiramente diferentes (eles usam códigos internos de palavras diferentes).

  • A Analogia: Imagine que o juiz fala "Francês" e o segurança fala "Alemão". O NTA usa uma Matriz de Projeção de Vocabulário especial (um tradutor) para converter as ideias perigosas em "Francês" em instruções em "Alemão" que o segurança possa entender e seguir.

Por Que é Melhor

  • Velocidade: Como o NTA não está perdendo tempo tentando forçar o segurança a dizer "Claro", ele encontra uma maneira de obter a resposta perigosa muito mais rápido. O artigo diz que ele pode ter sucesso em apenas 100 tentativas, enquanto os métodos antigos poderiam precisar de milhares ou falhar inteiramente.
  • Taxa de Sucesso: Em testes, o NTA teve sucesso cerca de 97% das vezes contra modelos de IA fortes e treinados para segurança. Os melhores métodos antigos tiveram sucesso apenas cerca de 50-60% das vezes.
  • Variedade: Métodos antigos costumam produzir respostas estranhas e quebradas porque estão tão focados na frase específica "Claro". O NTA produz respostas perigosas naturais, variadas e coerentes porque tem a liberdade de encontrar qualquer caminho para o resultado ruim.

O Ponto Principal

O artigo afirma que, ao parar a obsessão com "palavras mágicas" específicas e focar puramente no resultado perigoso, os atacantes podem contornar os filtros de segurança da IA de forma muito mais eficiente e eficaz. Isso transforma um jogo rígoso e frustrante de "O Mestre Mandou" em uma busca flexível pelo ponto mais fraco na defesa do segurança.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →