← Derniers articles
💬 NLP

Loanword or Switch? The Annotation Boundary, Not the Model, Drives Kazakh-Russian Code-Switching Identification

Cet article soutient que le principal défi de l'identification du changement de code kazakh-russe ne réside pas dans le choix du modèle d'identification de la langue, mais plutôt dans la délimitation de l'annotation distinguant les emprunts intégrés du véritable changement de code, une distinction clarifiée par un nouvel ensemble de données de référence au niveau du document et une approche en cascade privilégiant d'abord le filtrage.

Auteurs originaux : Bogdan Savelyev

Publié 2026-08-04
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bogdan Savelyev

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le grand méli-mélo linguistique : pourquoi les ordinateurs sont confus par les mots empruntés

Imaginez que vous essayiez d'apprendre à un robot à comprendre deux langues différentes qui utilisent par hasard le même alphabet, comme deux voisins qui parlent des dialectes différents mais écrivent avec le même ensemble de lettres. C'est le monde du Traitement du Langage Naturel (NLP), une branche de l'informatique où les machines tentent de lire, d'écrire et de comprendre le langage humain. L'un des premiers travaux du robot est l'Identification de la Langue (LID) : simplement déterminer si « Cette phrase est-elle en français ou en espagnol ? » ou « Est-ce du kazakh ou du russe ? ».

D'habitude, c'est facile. Si une phrase est pleine de mots français, le robot dit « Français ». Mais les choses deviennent compliquées lorsque les gens mélangent les langues dans un seul message, un phénomène appelé alternance codique (code-switching). Cela se produit quand quelqu'un commence une phrase dans une langue et la termine dans une autre, comme dire : « Je suis allé à la bakery pour acheter du khleb ». Dans ce scénario, le robot doit décider : s'agit-il d'un mélange désordonné de deux langues, ou est-ce simplement une seule langue qui a emprunté quelques mots à l'autre ? Si le robot se trompe, il pourrait penser qu'un message pur est un mélange désordonné, ou passer à côté d'un véritable mélange. Cela importe car si un ordinateur pense qu'un message est « mixte » alors qu'il s'agit en fait d'une seule langue, il pourrait essayer de le traduire ou d'analyser son humeur incorrectement, ce qui mène à la confusion dans tout, de la modération des réseaux sociaux à la gestion des robots de service client.

L'histoire de l'article : ce n'est pas la faute du robot, c'est la faute du manuel de règles

Dans cet article, le chercheur Bogdan Savelyev s'attaque à un casse-tête spécifique impliquant le kazakh et le russe, deux langues parlées par des millions de personnes au Kazakhstan qui utilisent toutes deux l'alphabet cyrillique. Le problème ? Les ordinateurs criaient « MIXTE ! » devant presque chaque phrase kazakhe qu'ils voyaient. Pourquoi ? Parce que le kazakh a emprunté des milliers de mots au russe au fil des ans (comme « qualité » devenant kachestvo). Pour un ordinateur qui ne regarde que les lettres, une phrase kazakhe contenant un mot emprunté au russe ressemble exactement à une phrase qui a changé de langue.

L'article soutient que l'erreur ne venait pas du fait que les modèles informatiques étaient trop stupides ; l'erreur résidait dans les règles que nous leur avons données. Les chercheurs ont réalisé que la définition de « mixte » était trop lâche. Ils ont proposé une nouvelle règle plus stricte : Les mots empruntés intégrés appartiennent toujours à la langue d'origine. Si une phrase kazakhe utilise un mot russe mais conserve la grammaire et la structure de la phrase en kazakh, elle est kazakhe, et non mixte. Un texte réellement « mixte » ne se produit que lorsque l'interlocuteur change réellement de structure grammaticale, comme terminer une proposition entière en russe pour ensuite commencer une nouvelle proposition en kazakh.

Pour prouver cela, l'équipe a construit un ensemble de données de référence (« gold standard ») de plus de 3 000 messages, soigneusement étiquetés par des humains suivant cette nouvelle règle stricte. Ils ont ensuite testé un certain nombre de modèles informatiques par rapport à ce nouveau manuel de règles.

Voici ce qu'ils ont trouvé :

  • L'erreur du « comptage de lettres » : Les outils simples qui vérifient simplement la présence de lettres russes à l'intérieur du texte kazakh étaient terribles. Ils étiquetaient presque tout comme « mixte » car ils ne pouvaient pas faire la différence entre un mot emprunté et un véritable changement de langue.
  • L'astuce de la « fenêtre » : Ils ont testé une méthode non neuronale ingénieuse appelée HeLI qui examine de petites « fenêtres » de mots (comme regarder 2 ou 3 mots à la fois) au lieu de la phrase entière d'un coup. En supprimant d'abord les mots empruntés connus, puis en vérifiant ces petites fenêtres, cette méthode s'est beaucoup mieux débrouillée pour repérer les vrais changements. Elle est passée d'environ 70 % de bonnes réponses à près de 87 %.
  • Le pouvoir du contexte : Le meilleur performeur était un modèle d'IA moderne et de grande taille appelé XLM-R. Comme ce modèle lit l'intégralité du message d'un coup et comprend le contexte, il peut naturellement faire la distinction entre un mot emprunté et un véritable changement de langue. Il a atteint un score de 0,966 (sur 1,0), ce qui est incroyablement élevé.
  • L'impact dans le monde réel : Lorsqu'ils ont appliqué ce filtre intelligent à une pile massive de plus de 331 468 publications réelles sur les réseaux sociaux, les résultats ont été frappants. Les anciennes règles simples ont signalé près de 28 000 publications comme étant « mixtes », mais lorsqu'un humain a vérifié un échantillon, seulement environ 1,66 % étaient réellement mixtes. Le nouveau filtre intelligent n'a correctement identifié que 4,9 % du total des publications comme étant mixtes. Cela signifie que les anciennes règles gonflaient énormément le nombre de messages mixtes, faisant croire que les gens changeaient de langue constamment alors qu'ils parlaient principalement le kazakh avec quelques mots empruntés.

L'article conclut que le goulot d'étranglement n'est pas le modèle informatique lui-même, mais la frontière d'annotation — la ligne que nous traçons entre « mot emprunté » et « changement de langue ». Une fois que nous traçons cette ligne clairement, même des modèles plus simples peuvent faire un travail décent, et les modèles avancés peuvent atteindre une précision quasi parfaite. L'auteur a également publié ses données et ses outils afin que d'autres ne commettent pas la même erreur. Il admet toutefois que ses étiquettes humaines ont été réalisées par une seule personne (et non une équipe), il y a donc une petite chance d'erreur humaine, et les résultats finaux sur le grand ensemble de données sont des prédictions, et non une seconde vérification humaine. Mais la preuve est solide : si vous voulez comprendre l'alternance codique, vous devez apprendre à votre ordinateur la différence entre un mot emprunté et un changement de langue, et pas seulement compter les lettres.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →