← Últimos artículos
💬 NLP

Comparative Analysis of AutoML and BiLSTM Models for Cyberbullying Detection on Indonesian Instagram Comments

Este estudio evalúa y compara modelos de aprendizaje automático y aprendizaje profundo para detectar ciberacoso en comentarios de Instagram en Indonesia, encontrando que, si bien BiLSTM con mecanismos de atención logra el mejor rendimiento general, la regresión logística sigue siendo una alternativa competitiva y eficiente en cuanto a recursos.

Autores originales: Raihana Adelia Putri, Aisyah Musfirah, Anggi Puspita Ningrum, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

Publicado 2026-04-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Raihana Adelia Putri, Aisyah Musfirah, Anggi Puspita Ningrum, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina Instagram como una enorme y bulliciosa plaza digital. Aunque es un lugar para compartir fotos y conectar, tiene un lado oscuro: ciberacoso. Esto ocurre cuando las personas usan internet para acosar, amenazar o humillar a otros. En Indonesia, este es un problema grave que afecta a muchos jóvenes.

Este trabajo es como un informe de detective que intenta averiguar la mejor manera de construir un "guardia de seguridad digital" que pueda detectar automáticamente estos comentarios maliciosos en idioma indonesio antes de que lastimen a alguien.

Aquí está la historia de su investigación, desglosada de forma sencilla:

1. Los Sospechosos (Los Datos)

Los investigadores reunieron una "lista de buscados" de 650 comentarios de Instagram.

  • La Fuente: Provenían de las secciones de comentarios de artistas e influencers indonesios famosos.
  • La Mezcla: La lista estaba perfectamente equilibrada: 325 comentarios eran maliciosos (Acoso) y 325 eran amables (No Acoso).
  • El Desafío: Estos no eran ensayos formales. Eran desordenados, cortos y llenos de jerga, abreviaturas y emojis, tal como hablan realmente los adolescentes.

2. El Equipo de Limpieza (Preprocesamiento)

Antes de que las computadoras pudieran leer estos comentarios, tenían que ser limpiados. Imagina intentar leer un libro escrito en un idioma donde la gente constantemente escribe mal las palabras o las estira (como "bgt" en lugar de "banget").

Los investigadores construyeron una máquina de limpieza especial con seis pasos:

  1. Normalización de Mayúsculas/Minúsculas (Case Folding): Convertir todo a minúsculas (para que "Hola" y "hola" sean lo mismo).
  2. Limpieza: Eliminar hashtags, enlaces y menciones @.
  3. Normalización de Jerga: Corregir la jerga (volver a convertir "bgt" en "banget").
  4. Eliminación de Palabras Vacías (Stopwords): Tirar palabras comunes como "y" o "el" que no ayudan a identificar el acoso.
  5. Lematización/Stemming: Recortar las palabras hasta su raíz (convertir "corriendo" en "correr").
  6. Tokenización: Cortar la oración en piezas de palabras individuales.

Sin este paso, las computadoras se confundirían con la jerga desordenada de internet.

3. Los Competidores (Los Modelos)

Los investigadores enfrentaron a dos tipos diferentes de "detectives" para ver quién podía atrapar a los acosadores mejor.

Equipo A: Los Detectives Clásicos (Aprendizaje Automático)

Estos son los métodos antiguos y confiables. Observan las palabras y cuentan con qué frecuencia aparecen ciertas palabras "malas".

  • Naive Bayes: Un adivino rápido basado en probabilidad.
  • Regresión Logística: Una calculadora constante que dibuja una línea entre lo bueno y lo malo.
  • SVM (Máquina de Vectores de Soporte): Un clasificador de ojos agudos que intenta encontrar el límite perfecto entre los dos grupos.
  • Herramienta: Utilizaron un método llamado TF-IDF, que es como un resaltador que marca las palabras que son únicas e importantes para la oración.

Equipo B: Los Pensadores Profundos (Aprendizaje Profundo)

Estos son los detectives avanzados de IA que intentan entender el contexto y el flujo de la oración, no solo las palabras.

  • Bi-LSTM: Un modelo que lee la oración de izquierda a derecha Y de derecha a izquierda al mismo tiempo, como leer un libro mientras también recuerdas lo que acabas de leer.
  • Bi-LSTM + Atención: El mismo modelo, pero con un "foco" (mecanismo de Atención). Este foco le dice al modelo que preste atención extra a las palabras más emocionales o importantes de la oración.

4. Los Resultados: ¿Quién Ganó?

Los investigadores organizaron una carrera para ver qué modelo podía identificar correctamente los comentarios de acoso.

  • El Ganador Clásico: Entre los detectives antiguos, la Regresión Logística fue la campeona. Lo acertó aproximadamente el 85.25% de las veces. Fue rápida, eficiente y no necesitaba una supercomputadora para ejecutarse.
  • El Ganador de Aprendizaje Profundo: El Bi-LSTM con el "Foco" (Atención) se llevó la corona general. Lo acertó aproximadamente el 84.62% de las veces.
    • ¿Espera, eso no es más bajo? ¡En realidad, está muy cerca! El "Foco" ayudó al modelo a entender el matiz del acoso mejor que los demás, incluso si el porcentaje bruto fue ligeramente inferior al del mejor modelo clásico.
    • El Bi-LSTM estándar (sin el foco) lo hizo peor (78.46%), demostrando que el "foco" fue crucial.

5. El Veredicto

El trabajo concluye con algunas conclusiones clave:

  • El Aprendizaje Profundo es el "Más Inteligente": El modelo con el "foco" (Bi-LSTM + Atención) es el mejor para entender el contexto complejo y desordenado de la jerga indonesia y los ataques emocionales.
  • El Aprendizaje Automático es el "Más Eficiente": Si no tienes una computadora potente o necesitas algo que funcione muy rápido, la clásica Regresión Logística es una opción muy sólida y práctica. Rindió casi tan bien como la IA compleja, pero es mucho más ligera.
  • La Limpieza es Clave: El estudio enfatiza que si no limpias la jerga y corriges los errores tipográficos primero, incluso la IA más inteligente fallará.

Las Limitaciones (La Letra Pequeña)

Los autores son honestos sobre los límites de su estudio:

  • Muestra Pequeña: Solo usaron 650 comentarios. Es como juzgar el gusto musical de todo un país basándose en una encuesta de 650 personas. Un conjunto de datos más grande haría los resultados más confiables.
  • Fuente Específica: Todos los comentarios provenían de las páginas de artistas famosos. El acoso podría verse diferente en la página de una persona común.
  • Etiquetas Simples: Solo etiquetaron los comentarios como "Acoso" o "No Acoso". No lo desglosaron más (por ejemplo, "Acoso Corporal" vs. "Discurso de Odio").

En resumen: Para atrapar a los ciberacosadores en los comentarios de Instagram en indonesio, primero necesitas un buen equipo de limpieza. Luego, puedes elegir entre un detective clásico rápido y confiable (Regresión Logística) o una IA altamente inteligente y consciente del contexto con un foco (Bi-LSTM + Atención), dependiendo de cuánta potencia de computación tengas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →