← Últimos artigos
💻 computer science

An Evaluation of Chat Safety Moderations in Roblox

Este estudo avalia a moderação automatizada de chats do Roblox analisando um corpus de 2 milhões de mensagens, revelando que o sistema atual falha em bloquear efetivamente uma ampla gama de conteúdos prejudiciais — incluindo aliciamento, assédio e violência — e que os usuários empregam ativamente várias técnicas para evadir a detecção.

Autores originais: Priya Kaushik, Sonja Brown, Rakibul Hasan, Sazzadur Rahaman

Publicado 2026-05-07
📖 4 min de leitura☕ Leitura rápida

Autores originais: Priya Kaushik, Sonja Brown, Rakibul Hasan, Sazzadur Rahaman

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine o Roblox como um enorme e movimentado playground digital onde milhões de crianças se reúnem todos os dias. É como um grande shopping virtual com milhares de salas de jogos diferentes. Embora seja um lugar para se divertir, o artigo sobre o qual você está perguntando funciona como uma auditoria de segurança das "regras de conduta" desse playground.

Os pesquisadores queriam saber: O guarda de segurança (o sistema de moderação de chat) está realmente fazendo seu trabalho?

Aqui está a explicação simplificada de suas descobertas:

1. A Missão: Pegar os "Vilões"

Os pesquisadores sabiam que o Roblox possui um sistema para bloquear automaticamente palavras ofensivas e mensagens perigosas. Mas suspeitavam que alguns "vilões" (pessoas tentando intimidar, assediar ou aliciar crianças) estavam passando pelo guarda.

Para descobrir, eles não podiam simplesmente pedir ao Roblox uma lista de mensagens ruins (o Roblox não compartilha isso). Em vez disso, agiram como repórteres disfarçados. Configuraram câmeras para gravar a tela do jogo durante semanas, capturando mais de 2 milhões de mensagens de chat de quatro jogos populares. Em seguida, usaram software especial (como um scanner de alta tecnologia) para transformar essas gravações de vídeo em texto, para que pudessem lê-las.

2. O Problema: O Guarda Está Dormindo no Volante

Uma vez que tiveram o texto, descobriram uma realidade preocupante. O guarda de segurança é bom em pegar coisas óbvias, como alguém gritando um palavrão em letras maiúsculas. Mas o guarda é péssimo em detectar perigos de desenvolvimento lento.

Pense nisso como um porteiro de boate que impede a entrada de pessoas usando camisas vermelhas, mas deixa entrar pessoas usando uma camisa vermelha por baixo de uma jaqueta azul, ou alguém que sussurra uma ameaça em vez de gritá-la.

Os pesquisadores descobriram que o sistema perdeu grandes quantidades de conteúdo prejudicial, incluindo:

  • Aliciamento: Predadores construindo lentamente a confiança com crianças para levá-las a se encontrarem na vida real ou a compartilhar fotos privadas.
  • Intimidação e Ódio: Insultos racistas e ofensas cruéis.
  • Conteúdo Sexual: Conversas explícitas e interpretação de papéis.
  • Autolesão: Crianças falando sobre se machucar.
  • Vazamento de PII: Crianças compartilhando acidentalmente seus endereços reais ou números de telefone.

A Analogia: O guarda te impede de entrar se você tentar entrar carregando uma espada, mas ele te deixa entrar se você esconder a espada dentro de uma caixa de pizza e só a puxar depois de estar dentro do prédio.

3. O Jogo de "Gato e Rato": Como Crianças (e Vilões) Enganam o Guarda

Os pesquisadores também analisaram o que acontece quando o guarda realmente bloqueia uma mensagem. Eles descobriram que as pessoas enviando mensagens ruins não desistem; elas se tornam criativas. Elas tratam o sistema de moderação como um chefe de videogame que precisam derrotar.

Usam truques inteligentes para enganar o computador:

  • O Truque da "Frase Dividida": Se o guarda bloquear a palavra "morre", o usuário digita "Eu só quero..." em uma mensagem e "morre" na próxima. O guarda vê duas mensagens seguras, mas o leitor vê a frase assustadora inteira.
  • O Truque da "Palavra-Código": Em vez de dizer "vadia", eles digitam "b" ou "btc". Para o computador, parece sem sentido, mas os outros jogadores sabem exatamente o que significa.
  • O Truque da "Leet Speak": Eles trocam letras por números ou símbolos, como escrever "h4ck3r" em vez de "hacker".
  • O Truque da "Sondagem": Eles testam as águas. Perguntam: "Você tem um [palavra bloqueada]?". Quando é bloqueado, tentam: "Você tem um aplicativo que começa com 'D' e termina com 'rd'?". Eles estão literalmente testando os pontos cegos do guarda para ver o que conseguem escapar.

4. A Grande Conclusão

O artigo conclui que o sistema atual é reativo, não proativo. Ele espera que uma palavra ruim específica apareça, mas não entende a história ou a intenção por trás de uma conversa.

  • O Guarda vê: "Olá" (Seguro) + "Quantos anos você tem?" (Seguro) + "Onde você mora?" (Seguro).
  • A Realidade: Isso é um predador tentando encontrar o endereço de uma criança.

Os pesquisadores sugerem que, para corrigir isso, o sistema precisa parar de olhar para as mensagens uma por uma (como verificar tijolos individuais) e começar a olhar para a conversa inteira (como olhar para o muro inteiro). Eles também sugerem que, se um usuário continuar tentando quebrar as regras, o sistema deve sinalizar especificamente essa pessoa, em vez de apenas bloquear suas palavras individuais repetidamente.

Em resumo: O playground digital tem um guarda de segurança, mas os vilões são muito espertos e o guarda está focado demais nas coisas erradas. As crianças ficam vulneráveis a predadores que sabem exatamente como passar pelas frestas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →