← Derniers articles
🤖 AI

Lost in Translation? Exploring the Shift in Grammatical Gender from Latin to Occitan

Cet article présente un cadre d'apprentissage profond interprétable doté d'un tokenizer amélioré pour analyser le changement diachronique du système de genre grammatical latin à trois genres vers le système occitan à deux genres, en quantifiant les contributions relatives des caractéristiques morphologiques et du contexte phrastique à la prédiction du genre.

Auteurs originaux : Ahan Chatterjee, Matthias Schöffel, Matthias Aßenmacher, Esteban Garces Arias

Publié 2026-05-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ahan Chatterjee, Matthias Schöffel, Matthias Aßenmacher, Esteban Garces Arias

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective tentant de résoudre un mystère survenu il y a 800 ans. Le mystère concerne le genre.

En latin ancien, les noms (comme « table » ou « soleil ») portaient trois « uniformes » de genre : Masculin, Féminin et Neutre (une sorte de catégorie « ni l'un ni l'autre »). Mais alors que le latin évoluait vers l'occitan médiéval (une langue parlée dans le sud de la France), l'uniforme « Neutre » disparut. Tous les noms neutres durent choisir un nouvel uniforme : soit Masculin, soit Féminin.

La grande question pour nos détectives (les chercheurs) était : Comment ces mots ont-ils décidé quel nouvel uniforme porter ? Ont-ils choisi en fonction de leur son (leur orthographe et leur forme), ou ont-ils observé leurs voisins dans la phrase pour décider ?

Voici comment l'article résout ce mystère, décomposé en étapes simples :

1. Le Problème : La Langue est « Désordonnée »

L'occitan médiéval ressemble à un tas de vieilles lettres manuscrites où le même mot est orthographié dix façons différentes (par exemple, « secretament » vs « secretamen »). Les outils informatiques standards (les tokeniseurs) sont généralement perdus par ce désordre et abandonnent.

  • La Solution : Les chercheurs ont construit un « traducteur » personnalisé (un tokeniseur hybride) suffisamment flexible pour gérer ces variations orthographiques sans se perdre. C'est comme un détective qui sait que « thru » et « through » sont le même mot, même s'ils s'écrivent différemment.

2. L'Enquête : Deux Sources d'Indices

L'équipe a utilisé un modèle informatique intelligent (basé sur mBERT, une intelligence artificielle linguistique) pour tester deux méthodes différentes de deviner le genre d'un mot.

Ensemble d'Indices A : Le Mot Lui-même (Niveau Lexical)

Ils se sont demandé : « Si nous regardons simplement le mot isolément, pouvons-nous deviner son genre ? »

  • Les Constats : La terminaison du mot est l'indice le plus fort.
    • Analogie : Imaginez la terminaison d'un mot comme un chapeau. Si un mot se termine par « -a », il porte presque toujours un « Chapeau Féminin ». S'il se termine par une consonne, il porte généralement un « Chapeau Masculin ».
    • Le Résultat : L'ordinateur était assez bon pour deviner en observant simplement la forme du mot et son histoire latine. Cependant, il n'était pas parfait. Certains mots étaient piégeux (comme psalmista), et l'ordinateur s'est trompé.

Ensemble d'Indices B : Le Contexte de la Phrase (Niveau Contextuel)

Ils se sont demandé : « Et si nous regardions la phrase entière ? Les mots autour du nom aident-ils ? »

  • Les Constats : Oui ! En occitan, d'autres mots (comme « le » ou « grand ») changent de forme pour s'accorder avec le genre du nom.
    • Analogie : Imaginez qu'un mot est une personne timide à une fête. Si vous ne pouvez pas dire si cette personne est de genre « Masculin » ou « Féminin » rien qu'en la regardant, vous regardez avec qui elle se tient. Si elle se tient à côté d'un article « Féminin » (comme la), la personne timide est presque certainement Féminine aussi.
    • Le Résultat : Lorsque l'ordinateur a examiné la phrase entière, sa précision a grimpé en flèche. Il a pu corriger ses erreurs du test « Mot Seul » en écoutant les voisins.

3. La Grande Révélation : Comment s'est Opéré le Changement

L'article ne se contente pas de dire « le contexte aide ». Il décompose exactement comment l'information est partagée :

  • Le Mot (Lemme) : Fournit l'indice structurel principal. La terminaison du mot est le signal primaire.
  • La Phrase (Contexte) : Agit comme le départageur. Lorsque le mot lui-même est ambigu (comme un mot qui pourrait être de l'un ou l'autre genre), les mots environnants (articles, adjectifs) interviennent pour confirmer le genre.

4. Pourquoi Cela Compte (Pour les Linguistes)

Les chercheurs ont découvert que le genre « Neutre » n'a pas simplement disparu ; il a été absorbé principalement dans la catégorie Masculine, mais certains mots sont passés au Féminin.

  • La Surprise : Ils ont découvert que si la terminaison « -um » (une terminaison neutre latine classique) est devenue généralement Masculine, c'était aussi la terminaison la plus courante pour les mots devenus Féminins. Cela prouve que l'on ne peut pas simplement compter combien de fois une terminaison apparaît ; il faut comprendre les règles complexes de l'évolution de la langue au fil du temps.

Résumé en Bref

L'article est comme une analyse médico-légale de l'ADN d'une langue. Il montre que lorsque l'occitan médiéval a perdu son genre « Neutre », les mots n'ont pas simplement choisi un nouveau genre au hasard.

  1. Pour la plupart, ils ont choisi un nouveau genre basé sur leur propre forme (orthographe/terminaison).
  2. Parfois, lorsque leur propre forme était confuse, ils se sont fiés à leurs voisins de phrase pour leur dire quoi être.

Les chercheurs ont également prouvé que pour étudier les langues anciennes et désordonnées, on ne peut pas utiliser les outils informatiques standards ; il faut des outils personnalisés qui comprennent le « bruit » de l'histoire. Ils ont rendu leur code et leurs données publics afin que d'autres détectives puissent vérifier leur travail.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →