← Últimos artículos
📊 statistics

From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages

Este artículo presenta un estudio empírico sistemático que demuestra que los modelos de lenguaje grandes, especialmente cuando se ajustan finamente o se aprovechan mediante aprendizaje por transferencia cruzada, superan significativamente a los métodos tradicionales en el etiquetado de la categoría gramatical de lenguas romances medievales con recursos limitados como el occitano, el catalán y el francés.

Autores originales: Matthias Schöffel, Esteban Garces Arias

Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Matthias Schöffel, Esteban Garces Arias

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando leer una biblioteca de libros antiguos escritos en tres lenguas medievales diferentes: occitano medieval, catalán medieval y francés medieval. Estas no son simplemente versiones antiguas de lenguas modernas; son como primos salvajes e indómitos. La ortografía cambia de página en página (a veces "fuego" se escribe como fuoc, a veces foc), la gramática es compleja y hay muy pocos diccionarios o maestros disponibles para ayudarte a entenderlos.

El objetivo de este artículo es enseñar a las computadoras a etiquetar cada palabra de estos libros con su "trabajo" (como sustantivo, verbo o adjetivo). Este proceso se llama etiquetado gramatical (POS tagging). Es el primer paso esencial antes de que una computadora pueda comprender realmente la historia, traducirla o analizar su historia.

Los investigadores se preguntaron: ¿Pueden las "superinteligentes" IA modernas (Modelos de Lenguaje Grandes o LLM) hacer un mejor trabajo en esto que las herramientas tradicionales antiguas que hemos estado utilizando?

Aquí está el desglose de su experimento, explicado mediante analogías simples:

1. Los concursantes

El estudio estableció una carrera entre dos tipos de "etiquetadores":

  • La Vieja Guardia (Etiquetadores Tradicionales): Piensa en ellos como bibliotecarios que siguen reglas. Tienen un libro de reglas estricto basado en lenguas modernas. Intentan adivinar el trabajo de una palabra observando su forma y comparándola con patrones conocidos. Son rápidos y baratos, pero se confunden fácilmente cuando la ortografía es extraña o la palabra es rara.
  • Los Nuevos Competidores (LLM): Estos son como políglotas genios que han leído casi todo lo que alguna vez se escribió. No solo siguen reglas; entienden el contexto. Pueden mirar una oración y "sentir" lo que es probable que sea una palabra, incluso si la ortografía es extraña.

2. Los métodos de entrenamiento (Cómo enseñaron a la IA)

Los investigadores no solo dejaron que la IA adivinara; probaron diferentes formas de enseñarle:

  • Zero-Shot (La "Lectura en Frío"): Le dieron a la IA un prompt diciendo: "Eres un experto. Aquí hay una palabra, dime su trabajo", sin mostrarle ningún ejemplo. Es como pedirle a un turista que traduzca un menú sin darle un libro de frases.
  • Few-Shot (La "Chuleta"): Le dieron a la IA una pequeña lista de ejemplos primero (por ejemplo, "esta palabra es un sustantivo, esta otra es un verbo"). Es como darle al turista algunas frases clave antes de que comience.
  • Fine-Tuning (El "Aprendizaje"): Tomaron la IA y la entrenaron específicamente en los textos medievales. Es como contratar al turista como becario durante un mes para estudiar solo estos libros específicos.
  • Transferencia Cruzada de Idiomas (La "Reunión de la Familia Lingüística"): Esta es la parte más interesante. Entrenaron a la IA con una mezcla de lenguas. Por ejemplo, la enseñaron con catalán y occitano juntos, luego la probaron en occitano. Es como enseñarle a alguien español e italiano, y luego ver si puede entender mejor el portugués porque las lenguas están relacionadas.

3. Los resultados: ¿Quién ganó?

Los resultados fueron claros, pero con algunos giros interesantes:

  • La IA gana: En casi todos los casos, la IA moderna (LLM) superó a las herramientas antiguas basadas en reglas. Los "políglotas genios" manejaron las ortografías desordenadas y extrañas mucho mejor que los "bibliotecarios que siguen reglas".
  • El entrenamiento importa: La IA funcionó mejor cuando realmente fue entrenada con los datos (Fine-tuning) en lugar de simplemente adivinar.
  • El "Ricitos de Oro" de mezclar lenguas:
    • Para el conjunto de datos más pequeño y difícil (occitano medieval): La IA aprendió mejor cuando estudió las tres lenguas juntas (trilingüe). Era como el estudiante que necesitaba escuchar todos los dialectos relacionados para finalmente entender el complicado.
    • Para el texto médico (francés medieval): La IA funcionó mejor cuando se emparejó solo con catalán (bilingüe). Añadir la tercera lengua en realidad la hizo ligeramente peor. Es como un estudiante aprendiendo francés; a veces añadir una tercera lengua (como el español) ayuda, pero a veces enfocarse solo en el pariente más cercano (italiano/catalán) es más efectivo para una tarea específica y pequeña.

4. El "por qué" detrás de la victoria

Los investigadores descubrieron que la IA era particularmente buena para identificar palabras que tienen significado y contexto, como adjetivos, adverbios y pronombres. Las herramientas antiguas luchaban con estas porque dependen de reglas rígidas. La IA, sin embargo, podía mirar toda la oración y decir: "Ah, esta palabra describe al sustantivo, así que debe ser un adjetivo", incluso si la ortografía era extraña.

5. La trampa (Limitaciones)

El artículo es honesto sobre lo que no hizo:

  • Costo: Los "políglotas genios" (los grandes modelos de IA) son costosos de ejecutar y requieren computadoras potentes. Las herramientas antiguas son gratuitas y rápidas.
  • Tamaño de los datos: Los conjuntos de datos eran muy diferentes en tamaño (uno tenía 2.000 palabras, otro tenía 59.000). Los investigadores no pudieron separar perfectamente si la IA lo hizo bien debido a la lengua o simplemente porque tenía más datos para aprender.
  • Especificidad: Solo probaron estas tres lenguas. Aún no sabemos si esto funciona para otras lenguas antiguas que no están relacionadas con las lenguas romances.

La conclusión

Este artículo demuestra que para leer textos medievales antiguos y desordenados, la IA moderna es una nueva herramienta poderosa. No solo reemplaza los métodos antiguos; los mejora significativamente, especialmente cuando se le enseña mezclando lenguas relacionadas. Sin embargo, no existe una estrategia "válida para todos". A veces necesitas mezclar todas las lenguas juntas, y a veces necesitas enfocarte solo en dos, dependiendo del texto específico que estés intentando leer.

Para historiadores y humanistas digitales, esto significa que ahora podemos construir mejores herramientas para organizar y comprender automáticamente miles de años de literatura que anteriormente eran demasiado desordenadas para que las computadoras las manejaran.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →