← Últimos artigos
💬 NLP

Comparative Analysis of AutoML and BiLSTM Models for Cyberbullying Detection on Indonesian Instagram Comments

Este estudo avalia e compara modelos de aprendizado de máquina e aprendizado profundo para detectar cyberbullying em comentários do Instagram indonésio, constatando que, embora o BiLSTM com mecanismos de atenção alcance o melhor desempenho geral, a Regressão Logística permanece uma alternativa competitiva e eficiente em termos de recursos.

Autores originais: Raihana Adelia Putri, Aisyah Musfirah, Anggi Puspita Ningrum, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

Publicado 2026-04-30
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Raihana Adelia Putri, Aisyah Musfirah, Anggi Puspita Ningrum, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine o Instagram como uma vasta e movimentada praça digital. Embora seja um lugar para compartilhar fotos e conectar pessoas, ele tem um lado sombrio: o ciberbullying. Isso ocorre quando as pessoas usam a internet para assediar, ameaçar ou humilhar outras. Na Indonésia, esse é um problema grave que afeta muitos jovens.

Este artigo é como um relatório de detetive tentando descobrir a melhor maneira de construir um "guarda de segurança digital" capaz de identificar automaticamente esses comentários maldosos em língua indonésia antes que machuquem alguém.

Aqui está a história de sua investigação, explicada de forma simples:

1. Os Suspeitos (Os Dados)

Os pesquisadores reuniram uma "lista de procurados" com 650 comentários do Instagram.

  • A Fonte: Eles vieram das seções de comentários de artistas e influenciadores indonésios famosos.
  • A Mistura: A lista estava perfeitamente equilibrada: 325 comentários eram maldosos (Bullying) e 325 eram amigáveis (Não-Bullying).
  • O Desafio: Estes não eram ensaios formais. Eram bagunçados, curtos e cheios de gírias, abreviações e emojis — exatamente como adolescentes reais conversam.

2. A Equipe de Limpeza (Pré-processamento)

Antes que os computadores pudessem ler esses comentários, eles precisavam ser limpos. Imagine tentar ler um livro escrito em uma língua onde as pessoas constantemente erram a grafia das palavras ou as esticam (como "baaaanget" em vez de "banget").

Os pesquisadores construíram uma máquina de limpeza especial com seis etapas:

  1. Case Folding: Transformar tudo para letras minúsculas (para que "Olá" e "olá" sejam iguais).
  2. Limpeza: Remover hashtags, links e @menções.
  3. Normalização de Gírias: Corrigir as gírias (transformar "bgt" de volta em "banget").
  4. Remoção de Stopwords: Descartar palavras comuns como "e" ou "o" que não ajudam a identificar bullying.
  5. Stemming: Cortar as palavras até sua raiz (transformar "correndo" em "correr").
  6. Tokenização: Cortar a frase em pedaços de palavras individuais.

Sem esta etapa, os computadores ficariam confusos com a gíria bagunçada da internet.

3. Os Concorrentes (Os Modelos)

Os pesquisadores colocaram dois tipos diferentes de "detetives" um contra o outro para ver quem conseguiria pegar os valentões melhor.

Equipe A: Os Detetives Clássicos (Aprendizado de Máquina)

Estes são os métodos antigos e confiáveis. Eles olham para as palavras e contam com que frequência certas palavras "ruins" aparecem.

  • Naive Bayes: Um adivinhador rápido baseado em probabilidade.
  • Regressão Logística: Uma calculadora estável que desenha uma linha entre o bom e o ruim.
  • SVM (Máquina de Vetor de Suporte): Um classificador de olhos afiados que tenta encontrar o limite perfeito entre os dois grupos.
  • Ferramenta: Eles usaram um método chamado TF-IDF, que é como um marcador que destaca palavras que são únicas e importantes para a frase.

Equipe B: Os Pensadores Profundos (Aprendizado Profundo)

Estes são os detetives de IA avançados que tentam entender o contexto e o fluxo da frase, não apenas as palavras.

  • Bi-LSTM: Um modelo que lê a frase da esquerda para a direita E da direita para a esquerda ao mesmo tempo, como ler um livro enquanto também lembra do que acabou de ler.
  • Bi-LSTM + Atenção: O mesmo modelo, mas com um "holofote" (mecanismo de Atenção). Este holofote diz ao modelo para prestar atenção extra às palavras mais emocionais ou importantes da frase.

4. Os Resultados: Quem Venceu?

Os pesquisadores realizaram uma corrida para ver qual modelo conseguia identificar corretamente os comentários de bullying.

  • O Vencedor Clássico: Entre os detetives antigos, a Regressão Logística foi a campeã. Ela acertou cerca de 85,25% das vezes. Foi rápida, eficiente e não precisou de um supercomputador para rodar.
  • O Vencedor de Aprendizado Profundo: O Bi-LSTM com o "Holofote" (Atenção) levou a coroa geral. Ele acertou cerca de 84,62% das vezes.
    • Espera, isso não é menor? Na verdade, é muito próximo! O "Holofote" ajudou o modelo a entender a nuance do bullying melhor do que os outros, mesmo que a porcentagem bruta fosse ligeiramente inferior à do melhor modelo clássico.
    • O Bi-LSTM padrão (sem o holofote) teve desempenho pior (78,46%), provando que o "holofote" foi crucial.

5. O Veredito

O artigo conclui com algumas conclusões principais:

  • Aprendizado Profundo é o "Mais Inteligente": O modelo com o "holofote" (Bi-LSTM + Atenção) é o melhor em entender o contexto complexo e bagunçado das gírias indonésias e ataques emocionais.
  • Aprendizado de Máquina é o "Mais Eficiente": Se você não tem um computador poderoso ou precisa de algo que rode muito rápido, a clássica Regressão Logística é uma escolha muito forte e prática. Ela teve desempenho quase tão bom quanto a IA complexa, mas é muito mais leve.
  • Limpeza é Fundamental: O estudo enfatiza que, se você não limpar as gírias e corrigir os erros de digitação primeiro, mesmo a IA mais inteligente falhará.

As Limitações (A Letra Miúda)

Os autores são honestos sobre os limites de seu estudo:

  • Amostra Pequena: Eles usaram apenas 650 comentários. É como julgar o gosto musical de todo um país com base em uma pesquisa de 650 pessoas. Um conjunto de dados maior tornaria os resultados mais confiáveis.
  • Fonte Específica: Todos os comentários vieram de páginas de artistas famosos. O bullying pode parecer diferente na página de uma pessoa comum.
  • Rótulos Simples: Eles apenas rotularam os comentários como "Bullying" ou "Não-Bullying". Eles não os dividiram mais (por exemplo, "Xenofobia Corporal" vs. "Discurso de Ódio").

Em resumo: Para pegar os cibervalentões em comentários do Instagram indonésio, você precisa primeiro de uma boa equipe de limpeza. Depois, você pode escolher entre um detetive clássico, rápido e confiável (Regressão Logística) ou uma IA altamente inteligente e consciente do contexto com um holofote (Bi-LSTM + Atenção), dependendo de quanto poder de computação você tem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →