← Últimos artigos
💬 NLP

Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance

Este artigo apresenta um quadro formal e um conjunto de dados para analisar o compromisso entre a detetabilidade e a compreensibilidade nas estratégias de evasão "Algospeak", definindo um limiar de "Modulação Majoritariamente Compreensível" para quantificar como alterações linguísticas impactam tanto a compreensão humana quanto a deteção por IA.

Autores originais: Jan Fillies, Ronald E. Robertson, Jeffrey Hancock

Publicado 2026-05-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jan Fillies, Ronald E. Robertson, Jeffrey Hancock

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine a internet como uma grande e movimentada praça da cidade. Nessa praça, existem dois grupos principais: os Avisadores da Cidade (pessoas ou bots tentando espalhar mensagens) e os Guardas da Cidade (algoritmos projetados para impedir mentiras prejudiciais, golpes ou discurso tóxico).

Durante muito tempo, os Avisadores apenas gritavam suas mensagens. Mas os Guardas ficaram inteligentes; aprenderam a identificar palavras e padrões específicos que significavam "perigo". Assim, os Avisadores começaram a jogar um jogo de "esconde-esconde" com as palavras. Eles começaram a trocar "vacina" por "vaxx", "matar" por "k!ll" ou usar emojis para substituir palavras. Essa nova e modificada forma de falar é chamada de Algospeak.

Este artigo é como um estudo científico desse jogo. Os pesquisadores queriam entender a "Zona de Cachinhos Dourados" desse jogo de esconder: Quanto você pode mudar suas palavras para enganar os guardas sem confundir as pessoas que você está tentando alcançar?

Aqui está uma análise de suas descobertas usando analogias simples:

1. O Problema "Demais, Muito Rápido" (A Troca)

Os pesquisadores descobriram um equilíbrio delicado.

  • Se você mudar suas palavras muito pouco: Os Guardas da Cidade te pegam imediatamente.
  • Se você mudar suas palavras demais: Os Guardas podem não te pegar, mas agora seus amigos (o público humano) também não conseguem te entender. Você transformou sua mensagem em um código secreto que apenas algumas pessoas conhecem, derrotando o propósito de espalhar uma mensagem para uma multidão.

Eles chamam o ponto perfeito do meio de "Modulação Compreensível pela Maioria" (MUM). Pense nisso como aumentar o volume em um rádio. Se você aumentar um pouco, o ruído estático (os guardas) abafa a música. Se você aumentar demais, a música fica tão distorcida que até seus amigos não conseguem dizer qual é a música. O MUM é o ajuste exato do botão de volume onde a música está clara o suficiente para seus amigos ouvirem, mas o ruído estático é alto o suficiente para confundir a máquina.

2. O Experimento: Um Laboratório de "Fake News"

Para testar isso, os pesquisadores não usaram pessoas reais. Em vez disso, eles construíram um laboratório digital usando robôs de IA (Modelos de Linguagem de Grande Escala) para interpretar os papéis tanto dos Avisadores quanto dos Guardas da Cidade.

  • A Configuração: Eles pegaram 20 frases comuns sobre desinformação sobre COVID-19 (como "Beber água sanitária cura o vírus").
  • A Distorção: Eles criaram 700 versões dessas frases. Algumas tinham apenas algumas letras alteradas (como "c0vid"), outras usavam abreviações, outras usavam emojis e algumas usavam palavras completamente inventadas.
  • O Teste: Eles perguntaram a diferentes modelos de IA duas questões:
    1. O Teste do Guarda: "Isso é uma mentira?" (A IA consegue detectar a desinformação?)
    2. O Teste do Amigo: "O que essa frase significava originalmente?" (A IA consegue reconstruir o significado original?)

3. O Que Eles Encontraram

Os resultados mostraram um padrão claro, como um escorregador descendo:

  • À medida que as palavras ficavam mais "embaralhadas" (mais modulação): Os "Guardas" de IA ficaram piores em detectar as mentiras.
  • Ao mesmo tempo: Os "Amigos" de IA ficaram piores em entender o que as palavras embaralhadas significavam.

A Reviravolta Surpreendente:
Os pesquisadores descobriram que diferentes tipos de embaralhamento funcionam de maneiras diferentes.

  • A Estratégia da "Palavra-Código": Substituir uma palavra por um código secreto (como usar "limão" para significar "vírus") foi muito bom para enganar os guardas, mas tornou a mensagem difícil de entender muito rapidamente.
  • A Estratégia da "Mudança de Ortografia": Apenas mudar uma letra para um número (como "v1rus") foi fácil para os guardas pegarem porque é um truque comum que eles já conhecem.
  • A Estratégia "Fonética": Escrever palavras como soam (como "Kovit") foi surpreendentemente difícil para a IA entender, embora parecesse simples para humanos.

4. O Alerta da "Red Team"

Os autores têm muito cuidado em dizer que não estão ensinando os bandidos a vencer. Em vez disso, eles estão atuando como "Red Teamers" (como testadores de segurança que tentam quebrar um cofre bancário para que o banco possa consertar a fechadura).

Eles estão dizendo: "Descobrimos exatamente onde a fechadura está fraca. Se você está construindo um sistema de segurança (um moderador de conteúdo), precisa saber que, se as pessoas começarem a usar 'Palavras-Código', seu sistema atual falhará. Mas se você tornar o sistema muito rigoroso, pode acabar bloqueando pessoas normais que estão apenas tentando conversar."

Resumo

Este artigo é um mapa do jogo de "Esconder-se à Vista". Ele prova que há um limite específico para o quanto você pode distorcer a linguagem para enganar um computador antes de perder seu público humano. Ele nos dá uma maneira de medir esse limite para que possamos construir melhores ferramentas para identificar agentes mal-intencionados sem silenciar conversas normais.

Nota Importante: O estudo foi uma "prova de conceito" usando IA e exemplos sintéticos (falsos). Ele não testou humanos reais ou plataformas reais de mídia social, portanto, estes são os primeiros passos para entender o problema, não a solução final.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →