← Últimos artigos
💻 computer science

Exploring Functional Shifts in Pos Tagging Across Various NLP Libraries: A Study of NLTK, spaCy and Textblob

Este estudo compara o desempenho do NLTK, TextBlob e spaCy no tratamento de sentenças de caminho de jardim causadas por mudanças funcionais, constatando que o spaCy supera significativamente as outras duas bibliotecas em precisão sintática e oferecendo insights para melhorar ferramentas de PLN, incluindo aquelas para línguas africanas.

Autores originais: Kayode Victor Amusan

Publicado 2026-07-28
📖 4 min de leitura☕ Leitura rápida

Autores originais: Kayode Victor Amusan

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a ler um livro de histórias. Você quer que ele entenda não apenas as palavras, mas como essas palavras se comportam em uma frase. "Run" é um comando para correr rápido ou é um substantivo que descreve um longo período de tempo? No mundo da ciência da computação, esse trabalho é chamado de Part-of-Speech (POS) tagging (etiquetagem de classe gramatical). É como um marca-texto digital que colore cada palavra em uma frase para mostrar se ela é um substantivo, um verbo, um adjetivo ou algo mais. Isso parece fácil para nós, humanos, mas para os computadores, torna-se complicado quando as palavras mudam de fantasia no meio da frase. Isso é chamado de functional shift (mudança funcional). Pense nisso como um ator que começa uma peça como um rei e, de repente, coloca um chapéu de chef e começa a cozinhar, tudo sem mudar seu nome. O computador tem que adivinhar o novo papel com base nas outras palavras ao redor.

Ainda mais complicadas são as garden path sentences (frases de caminho de jardim). Estas são frases que levam você por um "caminho de jardim" de pensamento, apenas para fazer você tropeçar no final. Por exemplo, "The old man the boat". Seu cérebro quer ler "old man" como uma pessoa, mas a frase na verdade significa "Os idosos operam o barco". Aqui, "man" é um verbo, não um substantivo! Se um computador se confundir com esses desvios, ele pode entender mal toda a história, o que é um grande problema para coisas como aplicativos de tradução ou mecanismos de busca. Por isso, cientistas estão sempre testando diferentes programas de computador para ver qual é o melhor em detectar essas mudanças de palavras sorrateiras.


Neste estudo, um pesquisador chamado Kayode Victor Amusan decidiu colocar três programas de computador populares — NLTK, TextBlob e SpaCy — à prova. Imagine estes três como diferentes alunos em uma aula de idiomas. O professor (o pesquisador) entregou a eles uma pilha de 56 frases complicadas projetadas para confundi-los. Essas frases incluíam enigmas de "caminho de jardim", palavras que haviam sido transformadas em substantivos (como "singing" tornando-se uma coisa que você faz) e palavras que mudaram sua posição para mudar seu significado. O objetivo era simples: ver qual aluno conseguia identificar corretamente qual papel cada palavra estava desempenhando na frase.

Os resultados foram um pouco como uma corrida onde um corredor claramente se destacou. Das 56 frases complicadas, o SpaCy acertou 32 delas. O NLTK e o TextBlob empataram em segundo lugar, mas acertaram apenas 21 frases cada. Isso significa que o SpaCy foi significativamente melhor em entender as "mudanças de fantasia" das palavras em frases complexas.

O estudo analisou de perto exemplos específicos para ver onde os programas tropeçavam. Por exemplo, considere a palavra "round". Pode ser um círculo (substantivo), uma forma (adjetivo), um verbo que significa girar, ou um advérbio que significa mover-se em círculos. Em frases como "The earth turns round once", o SpaCy identificou corretamente "round" como um advérbio. No entanto, o NLTK e o TextBlob se confundiram e o rotularam como um substantivo. Da mesma forma, para a palavra "that", que pode ser um pronome, uma conjunção ou um adjetivo, o SpaCy mostrou que conseguia distinguir a diferença em quase todos os contextos, enquanto as outras duas bibliotecas frequentemente perdiam o alvo.

O pesquisador descobriu que, embora todos os três programas tivessem dificuldades com as frases de "caminho de jardim" mais confusas (como "The complex houses married and single students"), o SpaCy ainda conseguiu acertar mais delas do que os outros. Por exemplo, em uma frase onde "houses" é na verdade um verbo (significando "fornecer abrigo"), o SpaCy tinha mais probabilidade de perceber que não era um edifício. O estudo sugere que, embora o NLTK e o TextBlob sejam bons para tarefas gerais, o SpaCy é a ferramenta mais forte quando a linguagem se torna complicada e as palavras começam a mudar de papéis.

O artigo não afirma que o SpaCy é perfeito ou que o problema foi resolvido. Na verdade, ele aponta que até mesmo o SpaCy errou 24 frases de 56. Ele simplesmente sugere que, se você precisa que um computador lide com frases complicadas e sinuosas, o SpaCy é atualmente a escolha mais confiável entre os três. O pesquisador espera que esta informação ajude professores, estudantes e outros cientistas a construir melhores ferramentas para entender a linguagem humana e, talvez, ajude futuros programas a aprender a falar línguas africanas com a mesma facilidade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →