← Derniers articles
💬 NLP

CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data

Cet article introduit CommonLID, un benchmark piloté par la communauté et annoté par l'humain couvrant 109 langues, qui révèle que les modèles d'identification de langue existants surestiment considérablement leur précision sur les données web bruitées, fournissant ainsi une ressource cruciale pour le développement de corpus multilingues plus représentatifs.

Auteurs originaux : Pedro Ortiz Suarez, Laurie Burchell, Catherine Arnett, Rafael Mosquera-Gómez, Sara Hincapie-Monsalve, Thom Vaughan, Damian Stewart, Malte Ostendorff, Idris Abdulmumin, Vukosi Marivate, Shamsuddeen Has
Publié 2026-06-10
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pedro Ortiz Suarez, Laurie Burchell, Catherine Arnett, Rafael Mosquera-Gómez, Sara Hincapie-Monsalve, Thom Vaughan, Damian Stewart, Malte Ostendorff, Idris Abdulmumin, Vukosi Marivate, Shamsuddeen Hassan Muhammad, Atnafu Lambebo Tonja, Hend Al-Khalifa, Nadia Ghezaiel Hammouda, Verrah Otiende, Tack Hwa Wong, Jakhongir Saydaliev, Melika Nobakhtian, Muhammad Ravi Shulthan Habibi, Chalamalasetti Kranti, Carol Muchemi, Khang Nguyen, Faisal Muhammad Adam, Luis Frentzen Salim, Reem Alqifari, Cynthia Amol, Joseph Marvin Imperial, Ilker Kesen, Ahmad Mustafid, Pavel Stepachev, Leshem Choshen, David Anugraha, Hamada Nayel, Seid Muhie Yimam, Vallerie Alexandra Putra, My Chiffon Nguyen, Azmine Toushik Wasi, Gouthami Vadithya, Rob van der Goot, Lanwenn ar C'horr, Karan Dua, Andrew Yates, Mithil Bangera, Yeshil Bangera, Hitesh Laxmichand Patel, Shu Okabe, Fenal Ashokbhai Ilasariya, Dmitry Gaynullin, Genta Indra Winata, Yiyuan Li, Juan Pablo Martínez, Amit Agarwal, Ikhlasul Akmal Hanif, Raia Abu Ahmad, Esther Adenuga, Filbert Aurelian Tjiaranata, Weerayut Buaphet, Michael Anugraha, Sowmya Vajjala, Benjamin Rice, Azril Hafizi Amirudin, Jesujoba O. Alabi, Srikant Panda, Yassine Toughrai, Bruhan Kyomuhendo, Daniel Ruffinelli, Akshata A, Manuel Goulão, Ej Zhou, Ingrid Gabriela Franco Ramirez, Cristina Aggazzotti, Konstantin Dobler, Jun Kevin, Quentin Pagès, Nicholas Andrews, Nuhu Ibrahim, Mattes Ruckdeschel, Amr Keleg, Mike Zhang, Casper Muziri, Saron Samuel, Sotaro Takeshita, Kun Kerdthaisong, Luca Foppiano, Rasul Dent, Tommaso Green, Ahmad Mustapha Wali, Kamohelo Makaaka, Vicky Feliren, Inshirah Idris, Hande Celikkanat, Abdulhamid Abubakar, Jean Maillard, Benoît Sagot, Thibault Clérice, Kenton Murray, Sarah Luger

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez l'internet comme une bibliothèque immense et chaotique contenant des livres dans des milliers de langues différentes. Si vous voulez construire un « super-lecteur » (un grand modèle de langage) capable de comprendre tous ces livres, vous avez d'abord besoin d'un bibliothécaire capable de trier rapidement les livres dans les bonnes sections linguistiques. Ce bibliothécaire est appelé un système d'Identification de la Langue (LID - Language Identification).

Le document que vous avez partagé, CommonLID, soutient que les bibliothécaires actuels font un travail médiocre, surtout avec les livres désordonnés et bruyants que l'on trouve sur le web ouvert. Voici une décomposition de leurs conclusions en utilisant des analogies simples :

1. Le Problème : Des bibliothécaires qui ne connaissent que les livres « propres »

Pendant longtemps, les chercheurs ont pensé que le travail de tri des langues était « résolu ». Ils ont testé leurs bibliothécaires avec des livres très propres et parfaits, comme des documents gouvernementaux ou des actualités traduites (imaginez cela comme des encyclopédies). Sur ces livres propres, les bibliothécaires obtenaient un score de 95 % ou plus.

Cependant, le véritable internet ressemble davantage à un marché aux puces animé. Il y a de l'argot, des fautes de frappe, des langues mélangées et du bruit aléatoire. Le document a constaté que lorsque vous prenez ces mêmes bibliothécaires « experts » et que vous les placez dans un marché aux puces, ils sont confus. Ils commencent à mal étiqueter les langues, en particulier pour les langues qui disposent de peu de livres disponibles (langues à faibles ressources).

L'analogie : C'est comme tester un chef dans une cuisine parfaite et calme avec des ingrédients frais, puis s'attendre à ce qu'il cuisine un repas gastronomique dans une tente venteuse avec des épices périmées. Le chef échoue, non pas parce qu'il est mauvais, mais parce que le test ne correspondait pas au chaos du monde réel.

2. La Solution : Un nouveau test, ancré dans le monde réel (CommonLID)

Pour corriger cela, les auteurs ont créé CommonLID. Considérez cela comme un nouvel examen rigoureux conçu spécifiquement pour les conditions du « marché aux puces » du web.

  • Qui a passé l'examen ? Plus de 80 locuteurs natifs du monde entier (la communauté) ont aidé à le créer.
  • Qu'y avait-il au test ? Ils ont pris du texte réel et désordonné provenant du web (Common Crawl) et ont demandé à des locuteurs natifs de trier manuellement ligne par ligne.
  • Quelle est sa taille ? Il couvre 109 langues différentes, dont beaucoup ont été ignorées par les tests précédents. C'est comme ajouter une toute nouvelle aile à la bibliothèque qui était auparavant verrouillée.

3. Les Résultats : Les « experts » sont trop confiants

Les auteurs ont pris huit des outils de « bibliothécaires » les plus populaires (comme CLD2, GlotLID, fasttext) et les ont soumis à ce nouvel examen CommonLID. Ils les ont également testés sur les anciens examens « propres » pour comparer.

Les découvertes choquantes :

  • Les anciens scores étaient faux : Les scores élevés sur les examens propres étaient trompeurs. Ils faisaient paraître les outils bien plus intelligents qu'ils ne le sont réellement.
  • La lutte du monde réel : Sur le nouvel examen CommonLID, les meilleurs outils n'ont obtenu qu'environ 60 à 70 % de bonnes réponses. C'est une note insuffisante dans de nombreux systèmes scolaires.
  • Le biais de la « Bible » : Beaucoup de ces outils ont été entraînés principalement sur des textes religieux (comme la Bible). Lorsqu'ils voient un texte religieux, ils sont excellents. Mais quand ils voient un tweet, un message de forum ou un blog, ils sont perdus. C'est comme un étudiant qui aurait mémorisé le dictionnaire mais qui serait incapable de tenir une conversation.

4. L'Élément Humain : Donner du crédit aux aides

Une partie unique de ce document est la manière dont ils ont construit le jeu de données. Au lieu d'embaucher des travailleurs de la foule à bas coût, ils ont invité des chercheurs et des locuteurs natifs à aider.

  • La règle : Si vous avez annoté (trié) au moins 100 documents, vous deveniez co-auteur du document.
  • Pourquoi ? Cela garantit que les personnes qui parlent les langues sont celles qui sont créditées pour l'amélioration de la technologie, plutôt que d'être simplement des travailleurs de la saisie de données invisibles.

5. La Vue d'Ensemble : Nous avons besoin de meilleurs outils

Le document conclut que nous ne pouvons pas construire des systèmes d'IA équitables et mondiaux si nos « bibliothécaires » continuent d'échouer à trier correctement les livres.

  • État actuel : Aucun outil unique ne fonctionne bien pour toutes les langues et pour tous les types de textes (web vs propre).
  • La conclusion : Nous devons cesser de faire confiance aux anciens tests « propres ». Nous devons utiliser de nouveaux tests désordonnés et réels, comme CommonLID, pour trouver des outils qui fonctionnent réellement dans le monde réel.

En bref : Le document dit : « Arrêtez de prétendre que le problème du tri des langues est résolu. Nous avons construit un nouveau test, plus difficile, utilisant de vraies personnes et de vraies données du web, et il a prouvé que nos outils actuels échouent pour les langues qui ont le plus besoin d'aide. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →