← Últimos artículos
💬 NLP

Automatic Annotation of Ancient Greek Vowel Length

Este artículo presenta el primer macronizador de propósito general basado en reglas para el griego antiguo que anota automáticamente la longitud vocálica en las letras dícronas utilizando el contexto morfológico, y demuestra que su producción entrena eficazmente a un transformador de nivel de carácter para lograr una alta precisión tanto en verso como en prosa, mejorando al mismo tiempo las tareas prosódicas derivadas.

Autores originales: Albin Thörn Cleland, Eric Cullhed

Publicado 2026-08-04
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Albin Thörn Cleland, Eric Cullhed

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando resolver un misterio escrito en un código que se ha perdido hace dos mil años. Este código es el griego antiguo, una lengua que una vez nos dio la filosofía, el drama y los mismos cimientos de la ciencia occidental. Pero aquí está el giro: los antiguos escribas que redactaron estos textos no usaban un alfabeto completo de sonidos; tenían una versión "corta" y una "larga" de tres letras específicas —alfa, iota y úpsilon— pero no las escribían de forma distinta en el papel. Es como si el inglés tuviera dos versiones de la letra "a" (una corta como en "cat" y una larga como en "father"), pero escribiéramos "a" para ambas. Para dar sentido a la poesía, la gramática y el significado, tienes que averiguar cuál de las "a" era la pretendida. Esto no es solo un concurso de ortografía; en el griego antiguo, errar en la longitud puede cambiar una palabra de un verbo a un sustantivo, o convertir una pregunta en un mandato. Durante décadas, las computadoras que intentaban leer estos textos se quedaron estancadas porque no pueden distinguir la diferencia. Sin conocer la longitud, la computadora es como un músico intentando tocar una canción sin saber qué notas se mantienen largas y cuáles son cortas.

Aquí es donde comienza la historia de "Annotación Automática de la Longitud de las Vocales del Griego Antiguo". Los autores, Albin Thörn Cleland y Eric Cullhed, están abordando un problema llamado "macronización". Piensa en la macronización como añadir pequeñas marcas musicales (como un guion largo o un pequeño sombrero) sobre las letras para decirle a la computadora: "Mantén este sonido" o "Dilo rápidamente". El desafío es masivo: hay millones de formas de palabras, y la regla de qué letra es larga o corta depende de una mezcla vertiginosa de factores: qué significa la palabra, cómo está construida, el dialecto, el período de tiempo e incluso el ritmo del poema en el que se encuentra. Es un "problema de cola larga" (long-tail problem), lo que significa que hay tantos casos raros y extraños que una simple lista de reglas no puede cubrirlos todos. Los investigadores querían saber: ¿Podemos construir un programa de computadora que haga esto automáticamente? Y si lo hacemos, ¿realmente ayuda a las computadoras a entender mejor el griego?

La caja de herramientas del detective: Reglas y recursión

El equipo comenzó construyendo un "macronizador basado en reglas". Imagina esto como un bibliotecario muy estricto y muy culto que se ha memorizado miles de libros de gramática y diccionarios. Este bibliotecario sigue un conjunto específico de instrucciones: "Si la palabra se ve así y termina en aquello, la vocal debe ser larga". Si el bibliotecario no está 100% seguro, deja la letra en blanco en lugar de adivinar.

Alimentaron a este bibliotecario con una biblioteca masiva de textos en griego antiguo que contenía 40 millones de palabras. El bibliotecario fue sorprendentemente bueno, logrando descifrar la longitud de aproximadamente el 69% de las letras complicadas. Pero el bibliotecario tenía una debilidad: era demasiado cauteloso. Si una palabra era rara o no encajaba en su libro de reglas perfecto, simplemente se rendía y la dejaba en blanco. No podía "adivinar" de la manera en que lo haría un humano, usando pistas de contexto para llenar los huecos.

El estudiante que aprende a adivinar

Para solucionar la vacilación del bibliotecario, los autores intentaron algo ingenioso. Tomaron el trabajo del bibliotecario —el 6s de las palabras de las que el bibliotecario estaba seguro— y lo usaron como un "libro de texto" para entrenar a un nuevo estudiante: una pequeña inteligencia artificial llamada "transformer a nivel de carácter".

Piensa en el estudiante de IA como un brillante aprendiz que observa al bibliotecario trabajar. El aprendiz aprende de las respuestas correctas del bibliotecario, pero también se entrena para observar las letras en sí mismas, una por una, para detectar patrones que el bibliotecario pasó por alto. El truco clave aquí es que se le dijo al aprendiz que ignorara las partes donde el bibliotecario no estaba seguro. Esto evitó que el aprendiz aprendiera las dudas del bibliotecario; en su lugar, el aprendiz aprendió a generalizar, a mirar la forma de una palabra y decir: "Apuesto a que esta es larga", incluso si el bibliotecario no tenía una regla para ella.

Los resultados fueron impresionantes. Mientras que el estricto bibliotecario cubría aproximadamente el 70% de las letras, el aprendiz de IA cubrió casi el 99.7%. Más importante aún, el aprendiz no solo adivinaba de forma errática; obtuvo la respuesta correcta con más frecuencia que el bibliotecario en los casos más difíciles. Al ser probado en un estándar de oro de textos revisados manualmente, la IA alcanzó una precisión de más del 92%, demostrando que podía aprender el "sentir" del lenguaje más allá de simplemente seguir reglas rígidas.

Por qué es importante: Escaneando el ritmo

Los investigadores no se detuvieron solo en etiquetar letras; querían ver si esta nueva habilidad realmente ayudaba a las computadoras en otras tareas. Probaron esto en la "escansión", que es el arte de descifrar el ritmo de un poema. En la poesía griega antigua, el ritmo depende enteramente de si una sílaba es "pesada" (larga) o "ligera" (corta).

Tomaron un programa de computadora diseñado para leer poesía y le dieron dos versiones del mismo texto: una con las nuevas marcas de longitud de vocal y otra sin ellas. ¿El resultado? El programa que recibió el texto "macronizado" fue aproximadamente un 5.8% mejor a la hora de descifrar el ritmo correcto. Este es un salto significativo en el mundo de la informática. Demuestra que enseñar a una computadora la musicalidad oculta del lenguaje ayuda a comprender mucho mejor la estructura de la poesía.

La letra pequeña

Por supuesto, esto no es una varita mágica que lo soluciona todo. Los autores son muy claros sobre las limitaciones. Su sistema está actualmente ajustado al griego "ático", el dialecto de Atenas. Si le introduces poesía de otras regiones o de períodos de tiempo posteriores, podría equivocarse en las longitudes porque está aplicando las "reglas áticas" a palabras no áticas. Es como un guía de acento neoyorquino tratando de enseñar a alguien cómo hablar con un acento sureño; puede que funcione para algunas palabras, pero fallará en otras.

Además, el estudiante de IA aprendió del libro de texto del bibliotecario. Si el bibliotecario cometió un error en las reglas, el estudiante también aprendió ese error. El sistema es tan bueno como las reglas y los datos sobre los que fue construido. Sin embargo, los autores han puesto sus herramientas, sus datos y su estándar de evaluación a disposición de todos. Esto significa que otros investigadores pueden ahora tomar este "aprendiz", enseñarle con mejores libros de texto y, tal vez algún día, descifrar el código de cada dialecto y era del griego antiguo, convirtiendo un guion silencioso y ambiguo en un lenguaje plenamente audible y rítmico una vez más.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →