← Últimos artigos
💬 NLP

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

Este estudo revela que as vulnerabilidades de jailbreak em modelos de linguagem grandes multimodais de ponta não são uniformes entre idiomas, demonstrando que a mudança do inglês para o espanhol altera fundamentalmente a superfície de ataque ao enfraquecer os ataques de enquadramento linguístico enquanto fortalece os visuais, invalidando assim as classificações de segurança derivadas de avaliações em idioma único.

Autores originais: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

Publicado 2026-05-25
📖 4 min de leitura☕ Leitura rápida

Autores originais: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um guarda de segurança muito inteligente e altamente treinado para um edifício digital. O trabalho desse guarda é impedir que as pessoas solicitem coisas perigosas, como como construir uma bomba ou espalhar mentiras. Por muito tempo, acreditamos que esse guarda era igualmente eficaz em impedir solicitações ruins, fossem elas sussurradas em inglês ou em espanhol.

Este artigo é como uma história de detetive que prova que essa suposição está errada. Os pesquisadores descobriram que os "ouvidos" do guarda estão sintonizados de forma muito específica para o inglês, mas seus "olhos" funcionam de maneira diferente.

Aqui está a explicação detalhada de suas descobertas usando analogias simples:

1. O "Filtro de Idioma" vs. a "Lente Visual"

Pense no modelo de IA como um guarda de segurança que aprendeu suas regras assistindo a milhares de filmes em inglês e lendo livros em inglês.

  • A Fraqueza Linguística: Se um ator mal-intencionado tentar enganar o guarda usando uma história engenhosa em inglês (como fingir ser um personagem de uma peça ou usar argumentos persuasivos), o guarda reconhece o padrão imediatamente e diz: "Não, já vi esse truque antes."
  • O Twist em Espanhol: Quando os pesquisadores mudaram o idioma para o espanhol mexicano, o "filtro de idioma" do guarda ficou confuso. Os truques engenhosos no estilo inglês (como interpretação de papéis) deixaram de funcionar porque o guarda não foi treinado para reconhecer esses padrões retóricos específicos em espanhol. É como tentar abrir uma fechadura com uma chave que se encaixa em uma porta diferente; o truque simplesmente não funciona mais.
  • A Surpresa Visual: No entanto, quando os atores mal-intencionados usaram imagens para enganar o guarda, aconteceu o oposto. Em espanhol, os truques visuais tornaram-se mais eficazes. É como se os olhos do guarda estivessem menos conectados ao seu treinamento linguístico. Quando ele vê uma imagem, ele a processa por meio de um caminho diferente que não se importa tanto se o texto está em inglês ou em espanhol.

2. A "Reversão de Classificação" (A Grande Surpresa)

Geralmente, ao testar sistemas de segurança, espera-se que o "melhor" guarda permaneça o melhor e o "pior" guarda permaneça o pior, independentemente do idioma que você fala.

  • Em Inglês: Um modelo (vamos chamá-lo de "Pixtral") foi o pior guarda, sendo enganado facilmente. Outro modelo ("Qwen") ficou no meio.
  • Em Espanhol: As classificações inverteram! "Qwen" tornou-se repentinamente o pior guarda, enquanto "Pixtral" tornou-se muito mais difícil de enganar.
  • A Conclusão: Você não pode simplesmente pegar as pontuações de segurança em inglês e fazer uma pequena conta matemática para adivinhar o quão seguro um modelo é em espanhol. A ordem de quem é seguro e quem é perigoso realmente muda dependendo do idioma.

3. Por Que Isso Acontece (A Analogia da "Dieta de Treinamento")

O artigo sugere que isso acontece devido à forma como esses modelos de IA são treinados.

  • Imagine que o modelo é um aluno que só fez aulas de segurança em inglês. Ele aprendeu a identificar "comportamento ruim" com base em palavras e estruturas de frases em inglês.
  • Quando lhe é feita uma pergunta em espanhol, ele ainda está usando seu cérebro treinado em inglês para analisar as palavras. Ele perde os truques porque o "vocabulário do truque" é diferente.
  • No entanto, as imagens são universais. Uma imagem de uma bomba parece uma bomba em qualquer idioma. Como o processamento visual do modelo não está tão rigidamente ligado ao seu treinamento de segurança em inglês, às vezes ele falha em conectar a imagem ao perigo, especialmente quando o texto ao redor está em um idioma em que o modelo não foi tão "treinado em segurança".

4. A Conclusão

Os pesquisadores testaram quatro modelos de IA de ponta diferentes com 363 tentativas diferentes de "jailbreak" (truques para contornar regras de segurança) tanto em inglês quanto em espanhol. Eles descobriram:

  • A segurança não é um número fixo. Um modelo não é apenas "seguro" ou "inseguro". Ele é seguro em alguns idiomas e inseguro em outros.
  • O teste "tamanho único" está quebrado. Se você testar esses modelos apenas em inglês, estará obtendo uma imagem falsa de quão seguros eles são para o resto do mundo.
  • As gerações estão melhorando, mas as lacunas permanecem. Os modelos mais novos são ligeiramente mais difíceis de enganar do que os mais antigos, mas a estranha diferença entre os níveis de segurança em inglês e espanhol ainda está lá.

Em resumo: Se você quiser saber se uma IA é segura para um usuário de língua espanhola, não pode apenas olhar para seu relatório de segurança em inglês. Você precisa testá-la em espanhol, porque os "pontos fracos" na armadura estão em lugares completamente diferentes dependendo do idioma.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →