← Últimos artículos
💻 computer science

How Annotator Agreement Affects Sentiment Classification Performance for Indonesian Coastal Tourism Reviews

Este estudio demuestra que el entrenamiento de clasificadores de sentimiento en un conjunto de datos más amplio de reseñas de turismo costero indonesio basado en el voto de la mayoría produce un mayor rendimiento que un conjunto de datos de consenso estrictamente unánime, aunque los resultados sugieren que el aumento del volumen de datos y el equilibrio de clases, en lugar de la retención de instancias ambiguas por sí sola, pueden ser los principales impulsores de la mejora, mientras que IndoBERT reduce eficazmente la clasificación errónea sistemática de las reseñas neutrales.

Autores originales: Sandy Kurniawan, Henri Tantyoko, Khadijah Khadijah, Helmie Arif Wibawa

Publicado 2026-08-31
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sandy Kurniawan, Henri Tantyoko, Khadijah Khadijah, Helmie Arif Wibawa

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En la era digital, la voz del viajero se ha convertido en una biblioteca masiva y no estructurada de opinión humana. Millones de personas escriben reseñas sobre playas, hoteles y restaurantes, vertiendo sus esperanzas, decepciones y observaciones en textos que a menudo son informales, llenos de jerga y profundamente matizados. Para las empresas y los investigadores, el desafío es dar sentido a este aluvión. Necesitan saber no solo si una reseña es buena o mala, sino exactamente cómo se siente el autor. Este es el dominio del análisis de sentimiento, una rama de la informática que enseña a las máquinas a leer emociones. Durante años, el enfoque estándar ha sido que los humanos etiqueten estas reseñas con categorías simples como "positivo", "negativo" o "neutro", y luego entrenar a las computadoras para que reconozcan esos patrones. Sin embargo, el juicio humano rara vez es perfecto. Cuando tres personas leen la misma reseña, pueden discrepar sobre si es verdaderamente neutral o ligeramente negativa. Esta discrepancia crea un rompecabezas para los científicos: ¿deberían desechar las reseñas confusas para quedarse solo con aquellas en las que todos están de acuerdo, o deberían conservar las complicadas y disputadas para darle a la computadora más ejemplos de los cuales aprender?

Un equipo de investigadores de la Universidad Diponegoro en Indonesia se propuso resolver este rompecabezas específico utilizando reseñas de destinos turísticos costeros. Se centraron en el idioma indonesio, que es rico en expresiones informales y variaciones regionales, lo que lo convierte en un caso de prueba particularmente difícil para las computadoras. Los investigadores recopilaron cientos de miles de reseñas públicas de Google Maps que cubrían playas de todo el archipiélago. Tras limpiar los datos y filtrar los duplicados o el texto que no fuera indonesio, seleccionaron una muestra equilibrada de aproximadamente 22,000 reseñas para ser leídas por tres anotadores humanos. Cada persona decidió de forma independiente si una reseña era positiva, negativa o neutra. Este proceso reveló una realidad natural: los humanos no siempre estaban de acuerdo. Algunas reseñas eran tan claras que los tres anotadores eligieron la misma etiqueta, mientras que otras eran lo suficientemente ambiguas como para que dos estuvieran de acuerdo y uno no, o donde los tres eligieron etiquetas diferentes.

Los investigadores dividieron entonces sus datos en dos grupos distintos para ver cómo afectaba esta discrepancia al aprendizaje de la computadora. El primer grupo, al que llamaron el conjunto "unánime", contenía únicamente las reseñas donde los tres humanos estaban de acuerdo. Esta era una colección más pequeña y limpia de 15,527 reseñas, pero carecía de los casos complicados y ambiguos. El segundo grupo, el conjunto de "mayoría", conservaba las reseñas unánimes pero también añadía aquellas donde dos de los tres humanos estaban de acuerdo. Este conjunto más grande contenía 21,235 reseñas e incluía muchos más ejemplos de texto neutral, de sentimiento mixto o confuso que suelen confundir a las computadoras. Luego, entrenaron tres tipos diferentes de programas informáticos con estos dos grupos. Dos de los programas utilizaron métodos tradicionales más antiguos que analizan las frecuencias de palabras, mientras que el tercero utilizó un sistema moderno y avanzado llamado IndoBERT, diseñado para comprender el contexto y las relaciones entre las palabras en el idioma indonesio, de forma muy similar a como lo hace un lector humano.

Los resultados fueron claros y algo sorprendentes. Contrario a la idea de que una computadora aprende mejor solo con ejemplos de acuerdo perfecto, todos los programas funcionaron mejor cuando fueron entrenados con el grupo más grande y desordenado que incluía las reseñas disputadas. El sistema más avanzado, IndoBERT, logró una puntuación más alta cuando aprendió del grupo de voto por mayoría en comparación con el grupo unánime. Esto sugiere que, al desechar las reseñas ambiguas para asegurar un acuerdo perfecto, los investigadores en realidad estaban desechando lecciones valiosas. Las reseñas disputadas a menudo contenían los sentimientos complejos y mixtos que expresan los viajeros reales, y tener más de estos ejemplos ayudó a la computadora a comprender toda la gama de la emoción humana. El estudio encontró que la mayor mejora se produjo en la capacidad de identificar correctamente las reseñas "neutrales". Cuando la computadora fue entrenada solo con los datos limpios y unánimes, tuvo dificultades para distinguir entre una reseña verdaderamente neutral y una ligeramente positiva o negativa. Pero cuando se le permitió estudiar los datos de la mayoría, que tenían muchos más ejemplos de estos casos neutrales, mejoró mucho en su capacidad de reconocimiento.

Sin embargo, los investigadores fueron cuidadosos al señalar que esta mejora podría no deberse únicamente a la discrepancia en sí misma. El grupo más grande simplemente tenía más datos y un mejor equilibrio de ejemplos neutrales, que son naturalmente más difíciles de encontrar que los ejemplos claramente positivos o negativos. El estudio no demostró que la discrepancia sea buena en sí misma, sino que filtrarla elimina demasiada información útil. La computadora todavía tuvo dificultades con ciertos tipos de escritura compleja, como las reseñas que elogiaban una parte de una playa mientras criticaban otra, o aquellas que utilizaban un lenguaje sutil e indirecto para expresar decepción. Estos casos difíciles siguieron siendo un desafío incluso para el modelo más avanzado. En última instancia, el trabajo sugiere que en el desordenado mundo del lenguaje humano, un poco de desacuerdo en los datos de entrenamiento puede ser necesario para enseñar a una computadora a comprender verdaderamente la sutileza de la voz de un viajero.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →