← Últimos artigos
💬 NLP

Multiclass Sentiment Analysis for Identifying Political Viewpoints

Este artigo investiga a análise de sentimento multiclasse de pontos de vista políticos em redes sociais através do design e avaliação de modelos XGBoost e BERT, que alcançaram F1-scores comparáveis de aproximadamente 0,28, destacando, assim, os desafios inerentes à classificação do discurso político complexo e estabelecendo uma linha de base para pesquisas futuras.

Autores originais: Girma Yohannis Bade, Olga Kolesnikova, Jose Luis Oropeza, Grigori Sidorov

Publicado 2026-08-12
📖 4 min de leitura☕ Leitura rápida

Autores originais: Girma Yohannis Bade, Olga Kolesnikova, Jose Luis Oropeza, Grigori Sidorov

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine a internet como uma praça de uma cidade gigante e caótica, onde milhões de pessoas gritam seus pensamentos, piadas e reclamações ao mesmo tempo. Nessa multidão barulhenta, há um canto especial dedicado à política, onde as pessoas discutem sobre líderes, políticas e o futuro de seus países. Por muito tempo, cientistas quiseram construir um "superouvinte" que pudesse entrar nessa praça, entender o que todos estão dizendo e separar esses gritos em pilhas organizadas: "Esta pessoa está brava", "Aquela pessoa está brincando" ou "Este aqui está apenas declarando um fato". Este campo de estudo é chamado de Análise de Sentimento. É como ensinar um computador a ler a temperatura emocional de uma sala apenas olhando para as palavras que as pessoas digitam. Embora possamos dizer facilmente se uma crítica de filme é feliz ou triste, a política é muito mais complicada. Uma frase pode parecer brava, mas ser na verdade uma piada, ou parecer positiva, mas ser sarcástica. Compreender essas diferenças sutis é crucial porque nos ajuda a ver o que o público realmente pensa, em vez de apenas adivinhar.

Neste artigo, uma equipe de pesquisadores decidiu enfrentar esse problema complicado usando um idioma específico chamado tâmil, falado por milhões de pessoas no sul da Índia e no Sri Lanka. Eles trataram a tarefa como um jogo de separar uma pilha bagunçada de postagens de redes sociais em sete baldes diferentes: Opinativo (alguém dando sua opinião), Sarcástico (alguém dizendo o oposto do que quer dizer), Substanciado (alguém apoiando afirmações com fatos), Positivo, Negativo, Neutro e Nenhum dos anteriores (postagens que não se encaixam em nenhuma categoria). Para jogar esse jogo, eles treinaram dois "cérebros digitais" diferentes em um conjunto de dados de 4.352 postagens reais. O primeiro cérebro era um modelo clássico de aprendizado de máquina chamado XGBoost, que é como um detetive muito rápido e seguidor de regras. O segundo era um modelo BERT, uma IA moderna de aprendizado profundo que tenta entender o contexto e a nuance das palavras, de forma semelhante a como um humano lê nas entrelinhas.

Os resultados de seu experimento foram um pouco surpreendentes e humildes. Apesar da tecnologia avançada, a tarefa revelou-se incrivelmente difícil. O detetive XGBoost conseguiu obter uma pontuação de 0,2835 (especificamente, um macro F1-score), enquanto o modelo de alta tecnologia BERT pontuou 0,2806. Para colocar em perspectiva, se você estivesse jogando um jogo onde tivesse que adivinhar a categoria correta para cada postagem, ambos os modelos estavam fazendo pouco mais do que um adivinhador aleatório que estava tentando muito. Os pesquisadores descobriram que os modelos tinham dificuldade em distinguir entre argumentos políticos complexos e piadas simples. Por exemplo, os modelos frequentemente confundiam postagens "Sarcásticas" com "Positivas", ou fatos "Substanciados" com sentimentos "Positivos". Eles também notaram que os modelos tendiam a prever "Opinativo" com muita frequência, prevendo-o para 305 postagens quando havia apenas 46 exemplos reais, enquanto perdiam muitas postagens "Positivas" inteiramente.

Os autores concluem que, embora tenham construído com sucesso um sistema que pode tentar essa classificação, o estado atual da tecnologia ainda não está pronto para entender perfeitamente o mundo confuso e cheio de nuances do discurso político em tâmil. Eles sugerem que o tamanho pequeno de seu conjunto de dados (apenas cerca de 500 postagens para teste) e a complexidade da língua tornaram difícil para os modelos aprenderem as regras sutis da fala política. Eles não alegaram ter resolvido o problema; em vez disso, forneceram uma linha de base — um ponto de partida — para mostrar o quão difícil é esse desafio específico. Eles esperam que, no futuro, com mais dados e talvez algoritmos diferentes, possamos construir melhores "superouvintes" que possam realmente compreender as diversas vozes do mundo político.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →