← Derniers articles
💻 computer science

Optical Character Recognition of Historical Moroccan Arabic Calligraphy Using Transformer-Based TrOCR

Ce document propose un cadre TrOCR basé sur les Transformers qui contourne la segmentation difficile des caractères en reconnaissant directement les lignes de texte prétraitées de manuscrits historiques en arabe marocain, atteignant ainsi une transcription efficace de la calligraphie complexe et dégradée pour la préservation du patrimoine numérique.

Auteurs originaux : Adnane Mehdaoui, Khadija El Maaroufi

Publié 2026-09-15
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Adnane Mehdaoui, Khadija El Maaroufi

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Depuis des siècles, la parole écrite est le principal vecteur de la mémoire humaine, transportant les lois, les récits et les découvertes scientifiques des civilisations à travers le temps. Pourtant, à mesure que le papier vieillit et que l'encre s'estompe, ces documents deviennent souvent illisibles pour l'œil moderne, enfermés derrière des couches de décomposition physique et de styles d'écriture méconnus. Dans le domaine de l'informatique, un champ connu sous le nom de reconnaissance optique de caractères, les chercheurs ont longtemps appris aux machines à lire le texte imprimé avec une précision quasi parfaite. Cependant, lorsque ces machines rencontrent les pages désordonnées, fluides et souvent endommagées des manuscrits historiques, elles trébuchent fréquemment. Le défi est particulièrement aigu avec la calligraphie arabe, où les lettres au sein d'un même mot sont souvent jointes en chaînes cursives complexes qui varient considérablement d'un écrivain à l'autre. Pour la tradition spécifique et culturellement riche des manuscrits arabes marocains, écrits dans un style distinctif connu sous le nom de script Maghribi, la tâche s'est avérée particulièrement difficile car les lettres se touchent, se chevauchent et se déplacent de manières qui déroutent les logiciels de lecture standards.

Deux chercheurs indépendants, Adnane Mehdaoui et Khadija El Maaroufi, ont abordé ce problème en développant une nouvelle approche qui contourne le besoin traditionnel de séparer les lettres individuelles. Au lieu d'essayer de découper un mot en ses composants — une tâche qui échoue souvent lorsque l'encre bave ou que les lettres fusionnent — ils ont entraîné un système d'intelligence artificielle moderne à considérer une ligne entière de texte comme une histoire unique et connectée. En utilisant un type de modèle informatique avancé appelé Transformer, conçu pour comprendre le contexte d'une phrase entière à la fois, ils ont créé un système capable de déchiffrer ces pages historiques difficiles. Leur travail démontre qu'en combinant un nettoyage minutieux des images avec un modèle qui apprend du flux de l'écriture plutôt que de formes isolées, il est possible de déverrouiller les secrets du patrimoine marocain qui étaient auparavant cachés à la vue de tous.

Les chercheurs ont commencé avec une collection de deux cents pages provenant d'archives en libre accès, représentant le script Maghribi unique que l'on trouve au Maroc. Ces pages étaient loin d'être immaculées ; elles souffraient des maux typiques des documents anciens, tels qu'un éclairage inégal, une encre délavée et un papier qui s'était gondolé avec le temps. Pour rendre ces images lisibles pour un ordinateur, l'équipe a d'abord construit un pipeline spécialisé pour nettoyer et organiser les données. Ils ont ajusté le contraste pour faire ressortir l'encre sombre sur le papier vieilli, puis ont utilisé un système de détection intelligent pour trouver où chaque ligne de texte commençait et finissait. Cette étape était cruciale car l'écriture manuscrite historique penche ou se déplace souvent, ce qui rend difficile pour les outils standards de déterminer où une phrase s'arrête et la suivante commence. Le système a analysé automatiquement l'espacement et la densité de l'encre pour découper les pages en lignes individuelles, créant ainsi un ensemble d'images propres, prêtes pour l'étape suivante de l'apprentissage.

Une fois les lignes isolées, les chercheurs se sont tournés vers un outil puissant connu sous le nom de TrOCR, qui signifie Reconnaissance Optique de Caractères basée sur les Transformers. Contra_irement aux systèmes plus anciens qui tentaient d'identifier une lettre à la fois, ce modèle fonctionne en observant l'intégralité de la ligne de texte simultanément. Il utilise un mécanisme appelé auto-attention, qui permet à l'ordinateur de pondérer l'importance de différentes parties de l'image lorsqu'il lit. Par exemple, si une lettre est légèrement déformée ou s'il lui manque un point, le modèle peut observer les lettres environnantes et la forme globale du mot pour deviner quelle est la pièce manquante probable. Cette capacité à comprendre le contexte est vitale pour l'arabe, où la forme d'une lettre change selon qu'elle est au début, au milieu ou à la fin d'un mot, et où de petits points au-dessus ou en dessous d'une lettre peuvent changer complètement sa signification.

Pour apprendre à ce modèle à lire l'arabe marocain, les chercheurs n'ont pas commencé à partir de zéro. Ils ont utilisé une technique appelée apprentissage par transfert (transfer learning), prenant un modèle qui avait déjà été entraîné sur des milliers de documents manuscrits anglais et l'adaptant à l'écriture arabe. C'est similaire à la façon dont une personne ayant déjà appris à jouer du piano pourrait apprendre un nouvel instrument plus rapidement qu'un débutant complet, car elle comprend déjà les fondamentaux du rythme et de la mélodie. Le modèle a ensuite été affiné sur l'ensemble de données marocain, apprenant à reconnaître les courbes, les connexions et les styles spécifiques du script Maghribi. L'équipe a entraîné le système sur environ huit mille paires d'images et leurs transcriptions textuelles correctes, tout en mettant de côté deux mille autres paires pour tester la performance du modèle sur du matériel qu'il n'avait jamais vu auparavant.

Les résultats de cet entraînement ont été mesurés à l'aide d'une métrique standard appelée Taux d'Erreur de Caractère (Character Error Rate), qui compte combien de lettres l'ordinateur a erronées par rapport au texte correct. Sur l'ensemble de test, le modèle a atteint un taux d'erreur d'à peine plus de cinq pour cent. Cela signifie que pour cent caractères dans une ligne de texte, le système a identifié correctement plus de quatre-vingt-quinze d'entre eux. Les chercheurs ont noté que la performance est restée constante à travers les phases d'entraînement, de validation et de test, suggérant que le modèle avait véritablement appris les motifs du script plutôt que de simplement mémoriser les pages spécifiques qui lui ont été présentées. Ce niveau de précision est significatif pour les documents historiques, où la variabilité de l'écriture manuscrite et la présence de dommages rendent une reconnaissance parfaite un objectif extrêmement élevé.

Malgré ces succès, les auteurs précisent prudemment que ce travail n'est pas une solution complète à tous les problèmes de lecture des manuscrits anciens. Le système éprouve encore des difficultés avec les signes diacritiques, ces petits points et traits qui se trouvent au-dessus ou en dessous des lettres pour indiquer la prononciation ou le sens, lesquels sont souvent ténus ou manquants dans les documents anciens. Si ces marques sont mal lues, le sens d'un mot peut changer entièrement. De plus, le modèle a été entraîné sur des lignes de texte qui ont été soigneusement extraites ; il ne gère pas encore les pages entières avec des mises en page complexes, telles que les notes marginales écrites dans les marges ou le texte s'étendant sur plusieurs colonnes. Les chercheurs ont également souligné que la rareté des données annotées reste un obstacle majeur, car la création des ensembles d'entraînement nécessite que des experts transcrivent manuellement le texte, un processus lent et difficile.

L'étude conclut que bien que l'apprentissage profond ait fait des progrès considérables, il ne peut pas encore remplacer le besoin d'expertise humaine ni surmonter chaque limitation physique du papier vieillissant. Cependant, l'approche adoptée par Mehdaoui et El Maaroufi offre une voie robuste vers l'avenir. En combinant un prétraitement intelligent des images avec un modèle qui comprend le contexte de la ligne entière, ils ont créé un outil capable d'accélérer considérablement la numérisation du patrimoine historique marocain. Ce travail ne produit pas seulement une liste de chiffres ; il fournit un cadre pratique qui permet aux chercheurs d'accéder et de préserver des siècles de connaissances linguistiques et culturelles qui étaient auparavant trop difficiles à lire. À mesure que le domaine progresse, l'intégration de modèles de langage pour corriger les erreurs et le développement de meilleures techniques d'augmentation de données pourraient affiner davantage ces systèmes, rapprochant l'histoire écrite du Maghreb du monde moderne.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →