← Últimos artículos
💬 NLP

Benchmarking PyCaret AutoML Against IndoBERT Fine-Tuning for Sentiment Analysis on Indonesian IKN Twitter Data

Este documento demuestra que el ajuste fino del modelo IndoBERT supera significativamente a los enfoques clásicos de AutoML de PyCaret, alcanzando una precisión del 89,59% frente al 77,57% para el análisis de sentimiento binario de comentarios informales en Twitter en indonesio sobre la Ciudad Capital Nusantara (IKN).

Autores originales: Mutia Alfi Mayzaroh, Dwi Fitria Ningsih, Nindi Destriani, Martin C. T. Manullang

Publicado 2026-04-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Mutia Alfi Mayzaroh, Dwi Fitria Ningsih, Nindi Destriani, Martin C. T. Manullang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de entender el estado de ánimo de una multitud masiva y ruidosa en una plaza pública. Esta multitud está hablando de un gran nuevo proyecto: la nueva capital de Indonesia, IKN. La gente está gritando sus opiniones en Twitter; algunos están celebrando, otros se quejan. Tu trabajo es determinar si la multitud está generalmente feliz o infeliz.

Este artículo es como un boletín de calificaciones para dos "detectives" diferentes contratados para resolver este misterio de cambios de humor.

Los Dos Detectives

Detective 1: El "Auto-Organizador" (PyCaret y Aprendizaje Automático)
Este detective es como un asistente muy eficiente y que sigue las reglas. Utiliza una herramienta llamada PyCaret, que es como una "caja de herramientas inteligente" que clasifica automáticamente los tuits.

  • Cómo trabajan: Observan los tuits y cuentan con qué frecuencia aparecen palabras específicas (como un contador de frecuencia de palabras). Prueban tres estrategias diferentes:
    1. Regresión Logística: Un adivino de línea recta.
    2. Naive Bayes: Un adivino basado en probabilidades según patrones de palabras.
    3. SVM: Un trazador de límites que intenta separar los tuits felices de los tristes.
  • El Resultado: El "adivino de línea recta" (Regresión Logística) fue el mejor del grupo. Aciertó aproximadamente el 77.5% de los tuits. Es un trabajador sólido y confiable, pero a veces pierde los matices del argot o la ironía.

Detective 2: El "Super-Lector" (IndoBERT y Aprendizaje Profundo)
Este detective es un genio que ha leído millones de libros y artículos en indonesio antes de ver un solo tuit. Este es IndoBERT, un modelo "Transformer".

  • Cómo trabajan: En lugar de solo contar palabras, este detective entiende el contexto. Sabe que la palabra "sakit" (enfermo) puede significar "estoy físicamente enfermo" o "este proyecto es terrible", dependiendo de la oración. Está entrenado específicamente en el idioma indonesio, por lo que entiende el argot local, las abreviaturas y la forma desordenada en que la gente escribe en las redes sociales.
  • El Resultado: Este detective acertó aproximadamente el 89.6% de los tuits. Fue significativamente más agudo, captando las sutiles diferencias que el primer detective pasó por alto.

El Enfrentamiento: El Marcador

Los investigadores organizaron una carrera justa utilizando 1,472 tuits reales sobre la nueva capital. Dividieron los tuits en conjuntos de entrenamiento (aprendizaje) y prueba (examen).

  • El Equipo de Aprendizaje Automático (PyCaret): Lo mejor que pudieron lograr fue una precisión del 77.57%.
  • El Equipo de Aprendizaje Profundo (IndoBERT): Obtuvieron una precisión del 89.59%.

La Brecha: El "Super-Lector" superó al "Auto-Organizador" por más de 12 puntos porcentuales. En el mundo de adivinar emociones, esa es una gran victoria.

¿Por Qué Ganó el "Super-Lector"?

El artículo explica esto usando una analogía simple:

  • El Auto-Organizador es como alguien que solo conoce la definición de diccionario de las palabras. Si dices: "Este proyecto está sick (enfermo)", podría pensar que te refieres a que está literalmente enfermo, o podría confundirse porque "sick" también puede significar "genial" en el argot.
  • El Super-Lector es como un hablante nativo que creció en internet. Sabe que "sick" en un tuit generalmente significa "increíble" o "terrible", dependiendo del tono. Entiende el ambiente de la oración, no solo las palabras.

El Problema: El Costo de Ser Inteligente

Hay un intercambio.

  • El Auto-Organizador es ligero. Funciona rápido en una computadora portátil estándar y no necesita una supercomputadora. Es ideal si tienes recursos limitados.
  • El Super-Lector es pesado. Requiere mucha potencia de cálculo y tarda más en entrenarse. Es como conducir un Ferrari: es más rápido y preciso, pero consume más gasolina y necesita un garaje más grande.

La Conclusión

El artículo concluye que si quieres la comprensión más precisa de cómo se sienten los indonesios sobre su nueva capital en las redes sociales, debes utilizar el modelo IndoBERT. Maneja la naturaleza desordenada, informal y llena de argot de Twitter mucho mejor que los métodos tradicionales.

Sin embargo, si no tienes una computadora potente o necesitas una respuesta rápida y sencilla, el modelo de Regresión Logística (el mejor de las herramientas tradicionales) sigue siendo una opción decente, aunque ligeramente menos precisa.

En resumen: Para entender el internet indonesio, complejo, conversacional y lleno de argot, el "Super-Lector" (Aprendizaje Profundo) es el ganador claro, dejando al "Auto-Organizador" (Aprendizaje Automático) en el polvo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →