← Últimos artículos
💻 computer science

Exploring Functional Shifts in Pos Tagging Across Various NLP Libraries: A Study of NLTK, spaCy and Textblob

Este estudio compara el rendimiento de NLTK, TextBlob y spaCy al manejar oraciones de camino de jardín causadas por cambios funcionales, encontrando que spaCy supera significativamente a las otras dos bibliotecas en precisión sintáctica y ofreciendo perspectivas para mejorar las herramientas de PLN, incluyendo aquellas para lenguas africanas.

Autores originales: Kayode Victor Amusan

Publicado 2026-07-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Kayode Victor Amusan

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a leer un libro de cuentos. Quieres que entienda no solo las palabras, sino cómo se comportan esas palabras en una oración. ¿Es "correr" un comando para moverse rápido, o es un sustantivo que describe un largo periodo de tiempo? En el mundo de la informática, este trabajo se llama Etiquetado de Partes de la Oración (POS, por sus siglas en inglés). Es como un resaltador digital que colorea cada palabra en una oración para mostrar si es un sustantivo, un verbo, un adjetivo o algo más. Esto parece fácil para nosotros los humanos, pero para las computadoras se vuelve complicado cuando las palabras cambian de disfraz a mitad de una oración. Esto se llama cambio funcional. Piensa en ello como un actor que comienza una obra como un rey y luego, de repente, se pone un gorro de chef y comienza a cocinar, todo sin cambiar su nombre. La computadora tiene que adivinar el nuevo papel basándose en las otras palabras que las rodean.

Aún más difícil son las oraciones de camino de jardín (garden path sentences). Estas son oraciones que te llevan por un "camino de jardín" de pensamiento, haciendo que creas una cosa, solo para hacerte tropezar al final. Por ejemplo, "El viejo maneja el bote" (en inglés: "The old man the boat"). Tu cerebro quiere leer "viejo hombre" como una persona, pero la oración en realidad significa "Los ancianos operan el bote". ¡Aquí, "man" es un verbo, no un sustantivo! Si una computadora se confunde con estos giros, podría malinterpretar toda la historia, lo cual es un gran problema para cosas como las aplicaciones de traducción o los motores de búsqueda. Por eso, los científicos siempre están probando diferentes programas de computadora para ver cuál es el mejor para detectar estos cambios de palabras sigilosos.


En este estudio, un investigador llamado Kayode Victor Amusan decidió poner a prueba tres programas de computadora populares: NLTK, TextBlob y SpaCy. Imagina a estos tres como diferentes estudiantes en una clase de idiomas. El profesor (el investigador) les entregó una pila de 56 oraciones complicadas diseñadas para confundirlos. Estas oraciones incluían acertijos de camino de jardín, palabras que habían sido convertidas en sustantivos (como "cantando" convirtiéndose en una cosa que haces) y palabras que cambiaron su posición para cambiar su significado. El objetivo era simple: ver qué estudiante podía identificar correctamente qué papel jugaba cada palabra en la oración.

Los resultados fueron un poco como una carrera donde un corredor claramente tomó la delantera. De las 56 oraciones complicadas, SpaCy acertó 32 de ellas. NLTK y TextBlob empataron en el segundo lugar, pero solo lograron 21 oraciones correctas cada uno. Esto significa que SpaCy fue significativamente mejor para descifrar los "cambios de disfraz" de las palabras en oraciones complejas.

El estudio analizó de cerca ejemplos específicos para ver dónde tropezaban los programas. Por ejemplo, toma la palabra "round" (redondo/alrededor). Puede ser un círculo (sustantivo), una forma (adjetivo), un verbo que significa girar, o un adverbio que significa moverse en círculo. En oraciones como "La tierra gira alrededor una vez" (en inglés: "The earth turns round once"), SpaCy identificó correctamente "round" como un adverbio. Sin embargo, NLTK y TextBlob se confundieron y lo etiquetaron como un sustantivo. Del mismo modo, para la palabra "that" (que/eso), que puede ser un pronombre, una conjunción o un adjetivo, SpaCy demostró que podía notar la diferencia en casi todos los contextos, mientras que las otras dos librerías a menudo fallaban el tiro.

El investigador encontró que, aunque los tres programas tenían dificultades con las oraciones de camino de jardín más confusas (como "El complejo alberga estudiantes casados y solteros"), SpaCy aun así logró acertar más de ellas que los otros. Por ejemplo, en una oración donde "houses" es en realidad un verbo (significando "proporcionar refugio"), SpaCy tenía más probabilidades de captar que no era un edificio. El estudio sugiere que, si bien NLTK y TextBlob son buenos para tareas generales, SpaCy es la herramienta más fuerte cuando el lenguaje se vuelve complicado y las palabras comienzan a cambiar de roles.

El artículo no afirma que SpaCy sea perfecto o que el problema esté resuelto. De hecho, señala que incluso SpaCy se equivocó en 24 oraciones de 56. Simplemente sugiere que, si necesitas que una computadora maneje oraciones complicadas y sinuosas, SpaCy es actualmente la opción más confiable entre los tres. El investigador espera que esta información ayude a maestros, estudiantes y otros científicos a construir mejores herramientas para entender el lenguaje humano, y tal vez incluso ayude a futuros programas a hablar lenguas africanas con la misma facilidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →