← Derniers articles
💬 NLP

Entropy of Ukrainian

Cet article présente la première étude visant à estimer l'entropie de la langue ukrainienne en reproduisant l'expérience de prédiction de caractères de Claude Shannon de 1951 avec 184 volontaires, aboutissant à une borne supérieure d'environ 1,201 bit par caractère et en comparant ce résultat aux modèles de langage actuels de grande taille.

Auteurs originaux : Anton Lavreniuk, Mykyta Mudryi, Markiian Chaklosh

Publié 2026-05-01
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Anton Lavreniuk, Mykyta Mudryi, Markiian Chaklosh

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous jouez à un jeu de « Devinez la lettre suivante » avec un ami. Vous lui montrez une phrase coupée en son milieu, comme : « Le chat était assis sur le... »

Votre ami doit deviner la lettre suivante.

  • S'il devine « m » (pour tapis), il a raison. C'était facile.
  • S'il devine « z », il a tort. Il doit recommencer.
  • S'il devine « p » (pour oreiller), il a raison.

Ce jeu mesure quelque chose appelé Entropie. Dans le monde du langage, l'entropie ne concerne pas la chaleur ni le désordre ; c'est une mesure de la surprise.

  • Entropie élevée : La lettre suivante est une surprise totale. Vous devez faire de nombreux essais avant de trouver la bonne. Le langage semble chaotique et imprévisible.
  • Entropie faible : La lettre suivante est évidente. Vous la devinez immédiatement. Le langage semble prévisible et répétitif.

L'expérience : Deviner l'ukrainien

Pendant des décennies, les scientifiques ont joué à ce jeu de devinettes avec l'anglais. En 1951, un homme nommé Claude Shannon a demandé à des gens de deviner la lettre suivante dans des phrases anglaises. Il a constaté que l'anglais est assez prévisible ; il faut en moyenne environ 1,2 essai pour trouver la bonne lettre suivante.

Mais personne n'avait jamais joué à ce jeu avec l'ukrainien jusqu'à présent.

Trois chercheurs d'Ukraine (Anton, Mykyta et Markiian) ont décidé de mener cette expérience pour la première fois. Voici comment ils l'ont fait, traduit en termes simples :

1. Les joueurs (les bénévoles)

Au lieu d'embaucher des travailleurs professionnels, ils ont demandé à des gens ordinaires sur les réseaux sociaux (principalement sur Telegram) de jouer.

  • Le dispositif : Ils ont fourni aux bénévoles des phrases tirées d'articles de presse.
  • La particularité : Pour maintenir l'intérêt des participants, ils n'ont pas commencé au tout début de la phrase. Ils ont affiché les 70 premiers caractères (environ la longueur d'une courte phrase) et ont demandé : « Qu'est-ce qui vient ensuite ? »
  • Le jeu : Le bénévole tape une lettre. Si elle est fausse, elle devient rouge et il réessaie. Si elle est juste, il passe à la lettre suivante.
  • L'objectif : Ils voulaient voir combien de « mauvaises devinettes » il fallait avant que les gens trouvent la bonne lettre.

2. Les résultats : À quel point l'ukrainien est-il prévisible ?

Après avoir collecté des données auprès de 184 bénévoles ayant fait plus de 17 000 devinettes, les chercheurs ont analysé les chiffres.

  • Le score : Ils ont constaté que le « niveau de surprise » (entropie) de l'ukrainien est d'environ 1,201 bit par caractère.
  • Que signifie cela ? Cela signifie que l'ukrainien est extrêmement similaire à l'anglais en termes de prévisibilité. Tout comme en anglais, si vous connaissez les lettres précédentes, la lettre suivante en ukrainien est généralement assez évidente.
  • Redondance : Parce que la langue est si prévisible, environ 76 % des lettres d'une phrase ukrainienne sont « redondantes ». Vous pourriez en fait supprimer une grande partie du texte, et un locuteur natif pourrait toujours deviner parfaitement les parties manquantes.

3. Le problème de la « triche »

Les chercheurs devaient faire preuve de prudence. Puisqu'il s'agissait d'un jeu en ligne, certaines personnes auraient pu :

  • Chercher la phrase complète en ligne.
  • Deviner au hasard et avoir de la chance.
  • Perdre intérêt et arrêter de jouer en cours de route.

Pour corriger cela, ils ont agi comme un arbitre strict. Ils ont écarté les résultats des personnes qui ont mal joué (ceux qui n'auraient peut-être pas essayé) et ceux qui ont joué trop parfaitement (ceux qui auraient pu tricher). Même après avoir été très stricts et supprimé beaucoup de données, le résultat est resté autour de 1,20.

4. La comparaison avec l'IA : Humains contre robots

Les chercheurs ont également demandé à des modèles d'IA modernes (Grands Modèles de Langage) de jouer au même jeu.

  • L'avantage de l'IA : Les modèles d'IA étaient bien meilleurs que les humains. Certains des meilleurs modèles d'IA pouvaient deviner la lettre suivante avec un score d'environ 0,7.
  • Le hic : Les chercheurs mettent en garde contre le fait que l'IA pourrait « tricher » différemment. Parce que l'IA a été entraînée sur d'énormes quantités de données d'actualités (similaires aux phrases utilisées dans le jeu), elle pourrait avoir mémorisé les phrases spécifiques plutôt que de vraiment comprendre la langue. C'est comme un élève qui a mémorisé la clé des réponses au lieu d'apprendre les mathématiques.
  • La conclusion : L'IA est très bonne, mais parce qu'elle est si proche du score « parfait », il est difficile de dire si elle comprend vraiment l'ukrainien ou si elle fait simplement du surapprentissage par rapport aux articles d'actualités spécifiques utilisés.

La grande conclusion

Cet article est la première fois que nous avons un chiffre solide sur la prévisibilité de l'ukrainien.

  • L'ukrainien n'est pas chaotique. Il est hautement structuré et prévisible, tout comme l'anglais.
  • Les humains sont bons dans ce domaine. Des gens ordinaires peuvent deviner la lettre suivante avec environ 1,2 essais.
  • L'IA est meilleure, mais peut-être trop bonne. Les modèles d'IA peuvent deviner encore plus vite, mais nous devons faire attention à ne pas confondre « mémorisation » et « intelligence ».

Les chercheurs admettent que leur étude n'était pas parfaite (ils n'avaient pas assez de joueurs et les phrases provenaient toutes d'articles de presse), mais cela nous offre un point de départ bien meilleur que celui que nous avions auparavant. Ils ont même partagé leur code et leurs données afin que d'autres puissent essayer d'améliorer le jeu à l'avenir.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →