PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing
Cet article présente PERCEPT, le premier corpus de grande envergure de mélange de codes persan-anglais annoté avec les étiquettes POS des Dépendances Universelles, ainsi qu'un cadre d'annotation assisté par LLM et une analyse linguistique complète révélant des modèles spécifiques aux plateformes dans le mélange de codes à travers les médias sociaux.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez l'internet comme un immense terrain de jeu chaotique où des gens du monde entier crient, chuchotent et discutent tous en même temps. Dans ce terrain de jeu, beaucoup de gens ne parlent pas seulement une seule langue ; ils les mélangent comme les ingrédients d'un smoothie. C'est ce qu'on appelle le « code-mixing » (mélange de codes). C'est lorsqu'une personne commence une phrase dans sa langue maternelle et insère soudainement un mot anglais parce que cela semble plus naturel, ou parce que c'est le seul mot qu'elle connaît pour un nouvel appareil. Pour les ordinateurs, c'est un cauchemar. Si un ordinateur essaie de comprendre une phrase, il attend que les mots suivent des règles strictes. Mais quand les langues se mélangent, l'ordinateur est confus, comme un chef essayant de suivre une recette qui passe soudainement des tasses métriques aux onces impériales au milieu de la préparation d'un gâteau. Pour apprendre aux ordinateurs comment gérer cette réalité désordonnée et amusante, les scientifiques ont besoin d'un dictionnaire spécial et d'un ensemble de règles — un « corpus » — qui leur montre exactement comment ces mots mélangés fonctionnent.
Entrez dans PERCEPT, un nouveau projet qui agit comme une immense bibliothèque organisée pour les locuteurs persans qui aiment mélanger l'anglais dans leurs publications. Les chercheurs, une équipe de linguistes et de spécialistes en informatique de l'Iran, ont remarqué que si nous avons des cartes pour d'autres paires de langues mixtes, le mélange persan-anglais était une forêt sombre et inexplorée. Ils voulaient construire une lampe de poche pour voir ce qui s'y passait. Ainsi, ils ont collecté 6 800 publications provenant de trois lieux de rencontre numériques populaires : X (anciennement Twitter), Instagram et Digikala (un site de vente en ligne massif). Ils n'ont pas seulement collecté les mots ; ils ont utilisé un assistant IA super intelligent nommé Gemini pour agir comme un détective, étiquetant chaque mot anglais (ou mot anglais écrit en lettres persanes) avec sa « fonction » dans la phrase. En grammaire, cette fonction est appelée « catégorie grammaticale » (Part-of-Speech ou POS). Le mot est-il un nom (une chose) ? Un verbe (une action) ? Un adjectif (une description) ? L'équipe a également demandé à l'IA de deviner de quoi parlait la publication, comme « shopping », « politique » ou « mèmes drôles ».
Voici la partie passionnante : l'équipe n'a pas seulement construit la bibliothèque ; elle est entrée à l'intérieur et a commencé à lire les livres pour voir quels motifs elle pouvait trouver. Ils ont découvert que lorsque les locuteurs persans mélangent l'anglais, ils l'utilisent principalement pour les noms (les choses). C'est comme s'ils empruntaient les « objets » à l'anglais mais gardaient les « actions » et les « descriptions » en persan. Par exemple, ils pourraient dire : « J'ai acheté un nouveau laptop », où « laptop » est le nom emprunté, mais le reste de la phrase reste en persan. Cependant, la « saveur » du mélange change selon l'endroit où vous vous trouvez. Sur le site de shopping, Digikala, les gens mélangeaient beaucoup de noms de marques et de modèles de produits (qui sont des noms spéciaux, ou « noms propres »). Sur X, ils mélangeaient plus de verbes (actions), et sur Instagram, ils penchaient vers les adjectifs (descriptions).
Les chercheurs ont également observé où ces mots mélangés se cachent dans une phrase. Ils ont découvert une cohérence surprenante : quel que soit le réseau social utilisé, les mots mélangés ont tendance à apparaître au début ou au milieu d'une phrase, et rarement à la toute fin. C'est comme si les locuteurs inséraient le mot anglais tôt pour planter le décor, puis terminaient leur pensée en persan. Mais la découverte la plus intéressante concernait le « déclenchement » (triggering). Sur Digikala, si quelqu'un utilisait un mot anglais, il y avait de fortes chances qu'il en utilise un autre juste après. C'est comme si, une fois que l'on commence à parler d'une marque ou d'un produit spécifique, les mots anglais ne cessent de couler. Cela ne se produisait pas autant sur Instagram ou X.
Enfin, ils ont vérifié quels sujets provoquaient le plus de mélanges. Sans surprise, les sujets de « l'Industrie et du Commerce » et de la « Marque et du Business » présentaient la plus grande quantité de code-mixing. Quand les gens parlent de shopping, de technologie ou de business, ils ne peuvent tout simplement pas s'empêcher de saupoudrer des termes anglais. L'équipe a confirmé le travail de son IA en faisant vérifier un échantillon par des experts humains, et les humains étaient d'accord avec l'IA presque tout le temps, prouvant que leur nouvelle bibliothèque est fiable.
En résumé, cet article ne nous donne pas seulement un nouveau jeu de données ; il nous donne une image claire de la façon dont les locuteurs persans mélangent naturellement les langues. Il suggère que si les types de mots empruntés changent selon la plateforme, la manière dont ils sont mélangés suit un rythme régulier. Cette carte est désormais ouverte à tous, aidant à construire de meilleurs outils de traduction, des chatbots plus intelligents et une compréhension plus profonde de la façon dont nous communiquons dans un monde où les langues dansent constamment ensemble.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.