TRIDIS: A Comprehensive Medieval and Early Modern Corpus for Handwritten Text Recognition and Named Entity Recognition
Cet article présente TRIDIS, un corpus ouvert et harmonisé de documents manuscrits médiévaux et de l'époque moderne conçu pour soutenir la reconnaissance de texte manuscrit et la reconnaissance d'entités nommées, tout en proposant une stratégie d'évaluation innovante basée sur les valeurs aberrantes afin de remédier aux limites des divisions aléatoires conventionnelles dans l'évaluation des documents patrimoniaux.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédez une immense bibliothèque poussiéreuse remplie de milliers de lettres manuscrites, de contrats juridiques et de décrets royaux datant du Moyen Âge et de la Renaissance. Ces documents sont écrits dans différentes langues (comme le latin, le français et l'allemand), par différents scribes ayant des styles d'écriture très variés, et certains sont même tachés ou déchirés.
TRIDIS est le nom d'une nouvelle collection numérique super organisée de ces documents. Voyez cela comme une « salle d'entraînement pour traducteur universel » destinée aux ordinateurs. L'objectif est d'apprendre aux ordinateurs à lire ces vieilles notes manuscrites avec précision.
Voici une décomposition de ce que fait l'article, en utilisant des analogies simples :
1. Le Problème : Le test « Trop Facile »
Pendant longtemps, les chercheurs essayant d'apprendre aux ordinateurs à lire l'écriture manuscrite ancienne ont été confrontés à un problème. Ils entraînaient l'ordinateur sur un groupe de documents, puis le testaient sur quelques autres choisis au hasard.
L'analogie : Imaginez un élève étudiant pour un examen de mathématiques. Il s'entraîne sur des problèmes faciles du Chapitre 1. Lorsqu'un professeur choisit une question de test au hasard dans le Chapitre 1, l'élève obtient un A. Mais dans la vraie vie, le test pourrait comporter une question difficile du Chapitre 5 qui ne ressemble en rien à ce qu'il a pratiqué. Le test aléatoire a donné un faux sentiment de sécurité.
Dans le monde des manuscrits anciens, cela signifie que les ordinateurs ont souvent l'air plus intelligents qu'ils ne le sont réellement parce qu'ils se contentent de mémoriser les styles d'écriture spécifiques qu'ils ont vus pendant l'entraînement, plutôt que d'apprendre comment gérer n'importe quel style.
2. La Solution : Le défi de l'« Outlier » (l'anomalie)
L'auteur, Sergio Torres Aguilar, a créé TRIDIS pour corriger cela. Mais la véritable innovation n'est pas seulement la collection de documents ; c'est la façon dont ils testent les ordinateurs.
Au lieu de choisir des questions de test de manière aléatoire, ils utilisent une stratégie appelée « Outlier-Based Splitting » (division basée sur les anomalies).
L'analogie : Imaginez que vous entraînez un chien à rapporter un objet.
- Test Aléatoire : Vous lancez une balle dans le jardin. Le chien l'attrape.
- Test d'Anomalie : Vous lancez un frisbee, un bâton, un jouet qui couine et un caillou boueux. Vous les lancez aussi sous la pluie, dans l'obscurité et selon un angle bizarre.
La stratégie de l'« Outlier » recherche toutes les lignes manuscrites et identifie celles qui sont les plus étranges, endommagées ou inhabituelles. Il peut s'agir de lignes présentant :
- Des styles d'écriture très particuliers.
- Des mots à peine visibles (encre décolorée).
- Des lignes incroyablement longues ou avec des mises en page bizarres.
- Des noms ou des mots très rares.
Ces lignes « bizarres » sont mises de côté pour constituer le Jeu de Test. L'ordinateur est entraîné sur les éléments « normaux », mais il est uniquement évalué sur sa capacité à gérer les éléments « bizarres ». Cela donne un score beaucoup plus honnête de l'intelligence réelle de l'ordinateur.
3. Qu'y a-t-il dans la boîte ? (Le Corpus)
TRIDIS est une boîte à outils géante contenant presque 200 000 lignes de texte provenant de diverses collections historiques.
- Voyage dans le temps : Il couvre des documents allant des années 1100 jusqu'aux années 1700.
- Langues : Il comprend le latin, le vieux français, le moyen haut allemand et l'espagnol.
- Styles : Il possède différents types d'écriture, de lettres nettes et massives à une cursive désordonnée et fluide.
- Nettoyage : Le texte a été « nettoyé » par des éditeurs humains. Ils ont développé les abréviations (comme transformer « dms » en « dominus ») et corrigé la ponctuation pour que les ordinateurs puissent mieux comprendre le sens.
4. Les Résultats : L'écart entre « Bon » et « Excellent »
L'auteur a testé deux modèles informatiques populaires (TrOCR et MiniCPM) en utilisant cette nouvelle méthode.
- Le Test Aléatoire : Lorsqu'ils étaient testés sur des lignes aléatoires, les ordinateurs réussissaient plutôt bien (environ 9 % de taux d'erreur). C'est comme si l'élève obtenait un A au test facile du Chapitre 1.
- Le Test d'Anomalie : Lorsqu'ils ont été testés sur les lignes « bizarres », le taux d'erreur a considérablement augmenté (atteignant 12 à 13 %).
La conclusion : Cet écart prouve que les ordinateurs actuels ne sont pas aussi robustes qu'on le pensait. Ils éprouvent des difficultés lorsqu'ils sont confrontés à la réalité désordonnée et imprévisible des documents historiques. En utilisant ce test d'« Outlier », les chercheurs peuvent désormais voir exactement où les ordinateurs échouent et savoir ce qu'ils doivent apprendre ensuite.
Résumé
TRIDIS est une immense bibliothèque ouverte de documents manuscrits anciens conçue pour aider les ordinateurs à apprendre à lire l'histoire. Sa caractéristique la plus importante est une nouvelle façon de tester : au lieu de donner aux ordinateurs un quiz aléatoire et facile, elle leur lance les exemples les plus difficiles et les plus inhabituels. Cela garantit que lorsqu'on dit qu'un ordinateur peut lire des manuscrits anciens, il peut réellement gérer le monde réel, complexe et désordonné de l'histoire, et non pas seulement les exemples parfaits.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.