← Derniers articles
💬 NLP

A Reproducible Universal Dependencies-Style Pipeline for Katharevousa Greek Parliamentary Text

Cet article présente un pipeline reproductible et en libre accès pour créer une ressource d'analyse syntaxique de style Universal Dependencies pour les textes parlementaires grecs en katharévousa de la période post-junte précoce, démontrant qu'un modèle XLM-R personnalisé surpasse nettement les analyseurs prêts à l'emploi dans l'analyse syntaxique tout en fournissant une méthodologie auditable pour le traitement de données OCR historiques.

Auteurs originaux : George Mikros, Fotios Fitsilis

Publié 2026-05-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : George Mikros, Fotios Fitsilis

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédiez une immense bibliothèque poussiéreuse de vieux documents gouvernementaux grecs des années 1970. Ce ne sont pas de simples documents ; ils sont rédigés dans un style grec très spécifique et formel appelé katharévousa. Considérez la katharévousa comme une « capsule temporelle linguistique » : ce n'est ni la langue ancienne des philosophes, ni le grec décontracté parlé aujourd'hui. C'est un mélange rigide et officiel des deux, utilisé par les politiciens et les avocats.

Le problème ? Les programmes informatiques modernes qui comprennent le langage (TALN) sont comme des étudiants qui n'ont étudié que le grec moderne ou le grec ancien. Lorsqu'ils tentent de lire ces registres parlementaires des années 1970, ils se perdent. Ils trébuchent sur ce mélange étrange d'anciennes grammaires et de nouveaux mots, et ne parviennent pas à donner du sens aux phrases.

Ce papier traite de la création d'un traducteur spécialisé pour ces documents spécifiques et, plus important encore, de la démonstration à tous exactement comment il a été construit afin que d'autres puissent vérifier le travail.

Voici le déroulement de leur parcours :

1. Le point de départ chaotique (Le problème de la reconnaissance optique de caractères)

Les documents étaient à l'origine sur papier physique, numérisés par des machines (reconnaissance optique de caractères ou ROC) et convertis en texte numérique. Mais les scanners sont comme des yeux fatigués ; ils commettent des erreurs. Ils peuvent omettre une lettre, couper un mot en deux ou se tromper face à une ancienne ponctuation.

  • La solution : Les auteurs n'ont pas simplement pris le scan brut. Ils ont construit une « équipe de nettoyage » (un ensemble de scripts) pour reconstruire le texte, corriger les mots brisés et organiser les phrases. C'est comme restaurer une peinture endommagée avant d'essayer d'analyser les coups de pinceau.

2. La « référence absolue » (L'ensemble de référence)

Pour enseigner à un ordinateur, vous avez besoin d'un manuel avec les bonnes réponses. Les auteurs ont créé un ensemble « figé » de 1 697 phrases soigneusement annotées (étiquetées) pour montrer la structure grammaticale correcte.

  • L'analogie : Imaginez un enseignant corrigeant un examen. Ils ont créé une « Corrigé » (l'ensemble de référence) verrouillé dans un coffre-fort. Personne ne peut le modifier par la suite. Cela garantit que lorsqu'ils testent différents modèles informatiques, ils sont tous notés selon exactement la même norme.
  • La surprise : Ils ont utilisé l'IA (les grands modèles de langage) pour aider à rédiger les réponses, mais ils ont soumis ces réponses de l'IA à une machine de « contrôle qualité » stricte pour s'assurer qu'elles respectaient les règles. Si l'IA était paresseuse ou faisait une erreur, le système la repérait.

3. La course (Test des modèles)

Les auteurs ont aligné plusieurs « concurrents » différents pour voir qui pouvait analyser (comprendre la grammaire de) ces phrases pièges le mieux :

  • Les coureurs du commerce : Ce sont des outils préfabriqués conçus pour le grec moderne ou le grec ancien.
    • Résultat : Ils ont lutté. L'outil grec moderne était comme un touriste essayant de lire un contrat juridique dans un dialecte étranger ; il a correctement compris environ 42 % de la grammaire complexe. L'outil grec ancien s'en est encore mieux tiré, car ces documents ne sont pas vraiment anciens ; ce sont des documents modernes avec une touche désuète.
  • Les coureurs sur mesure : Les auteurs ont entraîné leurs propres modèles à partir de zéro en utilisant le « Corrigé » qu'ils avaient créé.
    • Le modèle basé sur les caractéristiques : C'est comme un détective qui cherche des indices spécifiques (motifs de mots, types de mots particuliers). Il était étonnamment bon pour identifier le type de mot d'un mot (comme « nom » ou « verbe »).
    • Le modèle Transformer (XLM-R) : C'est un modèle d'IA lourd qui lit toute la phrase d'un coup pour comprendre le contexte. C'est le gagnant. Il a compris comment les mots étaient connectés entre eux mieux que quiconque.

4. Les résultats

Le modèle XLM-R sur mesure n'a pas seulement gagné ; il a battu le meilleur outil préfabriqué avec une marge significative (améliorant le score d'environ 10 points de pourcentage).

  • L'essentiel : Vous ne pouvez pas simplement prendre un outil générique du commerce pour ce travail spécifique. Vous avez besoin d'un modèle entraîné spécifiquement sur ce « dialecte » de langue officielle. Cependant, le modèle « détective » (basé sur les caractéristiques) restait très compétitif, prouvant que des règles simples et claires comptent encore à l'ère de l'IA sophistiquée.

5. La vraie contribution : « Open Source »

La partie la plus importante de ce papier n'est pas seulement le score ; c'est la transparence.

  • L'analogie : Habituellement, un scientifique pourrait dire : « J'ai construit un robot qui gagne la course, et voici le trophée. » Mais ils pourraient cacher les plans.
  • Ce papier : Les auteurs ont dit : « Voici le trophée, mais voici aussi les plans, les outils que nous avons utilisés, les notes en vrac sur ce qui a échoué, le code exact et le Corrigé verrouillé. »
  • Ils ont tout publié sous forme de projet open source appelé kathnlp. Cela signifie que n'importe qui peut le télécharger, exécuter les mêmes tests et voir exactement comment ils ont obtenu les résultats. Ils ont même inclus un guide sur la façon de reconstruire tout le système à partir de zéro.

Résumé

Les auteurs ont pris un problème linguistique historique difficile et chaotique (texte parlementaire grec des années 1970), l'ont nettoyé, créé un « Corrigé » strict et construit un traducteur IA sur mesure qui fonctionne bien mieux que les outils existants. Plus important encore, ils ont remis toute la recette, les ingrédients et les instructions de cuisson au public afin que n'importe qui puisse préparer le même plat et vérifier le goût.

Ce qu'ils n'ont PAS fait :

  • Ils n'ont pas prétendu que cela résout tous les problèmes de textes historiques.
  • Ils n'ont pas appliqué cela à des conseils médicaux ou juridiques (le texte concerne des archives historiques, pas des lois actuelles).
  • Ils n'ont pas affirmé que c'est la solution finale et parfaite ; ils admettent que l'ensemble de données est petit et nécessite plus de révision humaine à l'avenir.

Le papier est un plan pour transformer une archive historique « difficile à lire » en un outil utilisable par les ordinateurs, tout en étant complètement honnête sur le processus.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →