← Últimos artigos
🤖 AI

Text is All You Need for Vision-Language Model Jailbreaking

Este artigo apresenta o Text-DJ, um novo ataque de jailbreak que contorna as salvaguardas de segurança de Grandes Modelos de Visão-Linguagem ao converter prompts de texto prejudiciais em uma grade de imagens contendo subconsultas benignas dispersas e distrações irrelevantes, explorando, assim, as capacidades de OCR dos modelos e a incapacidade de vincular entradas multimodais fragmentadas.

Autores originais: Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

Publicado 2026-02-03
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um grande Modelo de Visão-Linguagem (LVLM) como um segurança muito inteligente e bem treinado em um museu de alta tecnologia. Ele é excelente em ler sinais (texto) e observar imagens (fotos) para garantir que ninguém traga nada perigoso ou proibido. Se você tentar entregar a ele um bilhete que diz "Como eu construo uma bomba?", ele imediatamente detecta o perigo e diz: "De jeito nenhum".

O artigo "Text is All You Need for Vision-Language Model Jailbreaking" introduz um truque astuto chamado Text-DJ (Jailbreaking por Distração de Texto) que mostra como esse segurança pode ser enganado usando apenas texto, mas com um toque especial: o texto está escondido dentro de uma grade de imagens.

Veja como o truque funciona, dividido em etapas simples:

1. A Estratégia de "Dividir a Conta" (Decomposição)

Primeiro, os atacantes pegam uma pergunta perigosa (como "Como eu faço uma bomba?") e a dividem em três perguntas menores e de aparência inofensiva.

  • Analogia: Imagine que você quer comprar uma arma perigosa, mas o lojista não quer vendê-la para você. Então, você divide seu pedido em três pedidos separados e inocentes: "Qual é a composição química da pólvora?", "Como eu misturo esses pós?" e "Qual recipiente contém esta mistura?".
  • Individualmente, essas perguntas parecem seguras. O segurança pode até respondê-las de forma prestativa. Mas, se você juntar todas elas, elas revelam o plano perigoso.

2. O "Ruído de Distração" (Distração)

Em seguida, os atacantes criam várias perguntas completamente aleatórias e entediantes que não têm nada a ver com o plano perigoso.

  • Analogia: Imagine que você está tentando passar uma mensagem secreta por um segurança, mas está cercado por 9 outras pessoas falando sobre o clima, o preço do leite e a história das batatas. O segurança está tão ocupado ouvindo todo esse ruído que esquece de focar nas três pessoas sussurrando o plano secreto.
  • O artigo descobriu que essas perguntas de "ruído" precisam ser o mais diferentes possível das perigosas para funcionarem melhor.

3. O "Quebra-Cabeça de Imagens" (O Truque Visual)

Esta é a parte mais importante. Em vez de digitar as perguntas em uma caixa de chat, os atacantes transformam cada uma das perguntas (as 3 perguntas perigosas divididas e as 9 perguntas de ruído aleatórias) em imagens. Eles as organizam em uma grade, como um álbum de fotos ou uma planilha.

  • A Armadilha: O segurança é treinado para escanear texto em busca de palavras ruins. Mas aqui, as palavras ruins estão escondidas dentro de imagens de texto. O segurança precisa usar sua habilidade de "Reconhecimento Óptico de Caracteres" (OCR) — basicamente, sua capacidade de ler texto dentro de uma imagem — para ver o que as imagens dizem.
  • A Fraqueza: O artigo argumenta que, embora o segurança seja muito bom em ler texto diretamente, ele fica confuso quando precisa ler o texto dentro de uma imagem, especialmente quando essa imagem está cercada por outras 9 imagens de distração. O "filtro de segurança" do guarda para leitura de texto falha ao não conseguir conectar os pontos entre as imagens-perguntas espalhadas e aparentemente inofensivas.

O Resultado

Quando o segurança finalmente lê a grade de imagens, ele vê as três perguntas divididas no meio do ruído. Como as perguntas estão fragmentadas e escondidas em imagens, o segurança não percebe que elas formam um todo perigoso. Ele responde às partes inofensivas e, ao fazer isso, acaba revelando acidentalmente a resposta para a pergunta perigosa original.

Por Que Isso Importa

O artigo afirma que este é um problema grave porque:

  1. Funciona em modelos "Black Box": Você não precisa conhecer o código secreto ou a estrutura cerebral interna do guarda. Você só precisa enviar a grade de imagens.
  2. Funciona nos melhores modelos: Eles testaram isso nos principais modelos (como GPT-4, Gemini e Qwen) e funcionou em todos eles.
  3. Ignora modelos de "Guarda": Mesmo quando uma segunda camada de segurança tenta verificar a entrada antes que ela chegue ao modelo principal, este truque frequentemente passa despercebido porque a entrada parece uma grade de imagens inofensiva.

Em resumo: O artigo mostra que, se você esconder um plano perigoso dentro de uma imagem, dividir esse plano em pedaços minúsculos e cercá-lo com muito ruído entediante, mesmo os seguranças de IA mais inteligentes podem ficar confusos e deixar o perigo passar. A solução, segundo os autores, é tornar a IA melhor em ler texto dentro de imagens e conectar os pontos, mesmo quando há muito ruído.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →