← Últimos artículos
💻 computer science

Optical Character Recognition of Historical Moroccan Arabic Calligraphy Using Transformer-Based TrOCR

Este artículo propone un marco de trabajo TrOCR basado en Transformer que evita la difícil segmentación de caracteres al reconocer directamente líneas de texto preprocesadas de manuscritos históricos en árabe marroquí, logrando así una transcripción efectiva de caligrafía compleja y degradada para la preservación del patrimonio digital.

Autores originales: Adnane Mehdaoui, Khadija El Maaroufi

Publicado 2026-09-15
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Adnane Mehdaoui, Khadija El Maaroufi

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Durante siglos, la palabra escrita ha sido el principal vehículo de la memoria humana, transportando las leyes, las historias y los descubrimientos científicos de las civilizaciones a través del tiempo. Sin embargo, a medida que el papel envejece y la tinta se desvanece, estos documentos a menudo se vuelven ilegibles para el ojo moderno, quedando bloqueados tras capas de deterioro físico y estilos de escritura manual desconocidos. En el campo de la informática, una disciplina conocida como reconocimiento óptico de caracteres, los investigadores han enseñado durante mucho tiempo a las máquinas a leer texto impreso con una precisión casi perfecta. No obstante, cuando esas máquinas se encuentran con las páginas desordenadas, fluidas y a menudo dañadas de los manuscritos históricos, suelen tropezar. El desafío es particularmente agudo con la caligrafía árabe, donde las letras dentro de una sola palabra suelen estar unidas en cadenas cursivas complejas que varían enormemente de un escritor a otro. Para la tradición específica y culturalmente rica de los manuscritos árabes marroquíes, escritos en un estilo distintivo conocido como escritura Maghribi, la tarea ha sido especialmente difícil porque las letras se tocan, se superponen y se desplazan de formas que confunden al software de lectura estándar.

Dos investigadores independientes, Adnane Mehdaoui y Khadija El Maaroufi, han abordado este problema desarrollando un nuevo enfoque que evita la necesidad tradicional de separar las letras individuales. En lugar de intentar cortar una palabra en sus partes componentes —una tarea que a menudo falla cuando la tinta se corre o las letras se fusionan—, entrenaron un sistema de inteligencia artificial moderno para que observe una línea completa de texto como una historia única y conectada. Al utilizar un tipo de modelo informático avanzado llamado Transformer, que está diseñado para comprender el contexto de una oración completa a la vez, crearon un sistema capaz de descifrar estas difíciles páginas históricas. Su trabajo demuestra que, al combinar una limpieza cuidadosa de la imagen con un modelo que aprende del flujo de la escritura en lugar de formas aisladas, es posible desbloquear los secretos del patrimonio marroquí que antes permanecían ocultos a plena vista.

Los investigadores comenzaron con una colección de doscientas páginas de archivos de código abierto, que representan la escritura Maghribi única que se encuentra en Marruecos. Estas páginas distaban mucho de ser prístinas; sufrían los males típicos de los documentos antiguos, como una iluminación desigual, tinta desvanecida y papel que se había deformado con el tiempo. Para hacer que estas imágenes fueran legibles para una computadora, el equipo construyó primero un flujo de trabajo especializado para limpiar y organizar los datos. Ajustaron el contraste para que la tinta oscura resaltara contra el papel envejecido y luego utilizaron un sistema de detección inteligente para encontrar dónde comenzaba y terminaba cada línea de texto. Este paso fue crucial porque la escritura manual histórica a menudo se inclina o se desplaza, lo que dificulta que las herramientas estándar distingan dónde termina una oración y comienza la siguiente. El sistema analizó automáticamente el espaciado y la densidad de la tinta para segmentar las páginas en líneas individuales, creando un conjunto limpio de imágenes listas para la siguiente etapa de aprendizaje.

Una vez aisladas las líneas, los investigadores recurrieron a una poderosa herramienta conocida como TrOCR, que significa Reconocimiento Óptico de Caracteres basado en Transformers. A diferencia de los sistemas más antiguos que intentaban identificar una letra a la vez, este modelo trabaja observando la línea completa de texto simultáneamente. Utiliza un mecanismo llamado autoatención, que permite a la computadora sopesar la importancia de las diferentes partes de la imagen mientras lee. Por ejemplo, si una letra está ligeramente distorsionada o le falta un punto, el modelo puede observar las letras circundantes y la forma general de la palabra para adivinar qué pieza faltante es probable que sea. Esta capacidad de comprender el contexto es vital para el árabe, donde la forma de una letra cambia dependiendo de si está al principio, en medio o al final de una palabra, y donde los pequeños puntos sobre o debajo de una letra pueden cambiar completamente su significado.

Para enseñar a este modelo a leer el árabe marroquí, los investigadores no partieron de cero. Utilizaron una técnica llamada aprendizaje por transferencia, tomando un modelo que ya había sido entrenado con miles de documentos manuscritos en inglés y adaptándolo a la escritura árabe. Esto es similar a cómo una persona que ya ha aprendido a tocar el piano puede aprender un nuevo instrumento más rápidamente que un principiante absoluto, porque ya comprende los fundamentos del ritmo y la melodía. Luego, el modelo fue ajustado mediante un proceso de ajuste fino (fine-tuning) con el conjunto de datos marroquíes, aprendiendo a reconocer las curvas, conexiones y estilos específicos de la escritura Maghribi. El equipo entrenó el sistema con aproximadamente ocho mil pares de imágenes y sus transcripciones de texto correctas, mientras reservaba otros dos mil pares para probar qué tan bien se desempeñaba el modelo con material que nunca había visto antes.

Los resultados de este entrenamiento se midieron utilizando una métrica estándar llamada Tasa de Error de Caracteres, que cuenta cuántas letras erró la computadora en comparación con el texto correcto. En el conjunto de prueba, el modelo logró una tasa de error de apenas un cinco por ciento. Esto significa que, por cada cien caracteres en una línea de texto, el sistema identificó correctamente más de noventa y cinco de ellos. Los investigadores señalaron que el rendimiento se mantuvo constante a través de las fases de entrenamiento, validación y prueba, lo que sugiere que el modelo realmente había aprendido los patrones de la escritura en lugar de simplemente memorizar las páginas específicas que se le mostraron. Este nivel de precisión es significativo para los documentos históricos, donde la variabilidad en la escritura a mano y la presencia de daños hacen que un reconocimiento perfecto sea una meta extremadamente alta.

A pesar de estos éxitos, los autores advierten cuidadosamente que el trabajo no es una solución completa para todos los problemas de la lectura de manuscritos antiguos. El sistema todavía tiene dificultades con los signos diacríticos, los pequeños puntos y líneas que se sitúan arriba o abajo de las letras para indicar la pronunciación o el significado, los cuales suelen estar tenues o ausentes en documentos viejos. Si estos signos se leen incorrectamente, el significado de una palabra puede cambiar por completo. Además, el modelo fue entrenado con líneas de texto que habían sido extraídas cuidadosamente; aún no maneja páginas completas con diseños complejos, como notas marginales escritas en los márgenes o texto que corre en múltiples columnas. Los investigadores también destacaron que la escasez de datos anotados sigue siendo un obstáculo importante, ya que la creación de los conjuntos de entrenamiento requiere que expertos transcriban el texto manualmente, un proceso lento y difícil.

El estudio concluye que, si bien el aprendizaje profundo ha realizado grandes avances, aún no puede reemplazar la necesidad de la experiencia humana ni superar cada limitación física del papel envejecido. Sin embargo, el enfoque adoptado por Mehdaoui y El Maaroufi ofrece un camino sólido hacia adelante. Al combinar el preprocesamiento inteligente de imágenes con un modelo que comprende el contexto de la línea completa, han creado una herramienta que puede acelerar significativamente la digitalización del patrimonio histórico marroquí. Este trabajo no solo produce una lista de números; proporciona un marco práctico que permite a los investigadores acceder y preservar siglos de conocimiento lingüístico y cultural que antes era demasiado difícil de leer. A medida que el campo avance, la integración de modelos de lenguaje para corregir errores y el desarrollo de mejores técnicas de aumento de datos podrían refinar aún más estos sistemas, acercando la historia escrita del Magreb al mundo moderno.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →