Wiki Dumps to Training Corpora: South Slavic Case
Cet article présente une méthodologie agnostique en matière de langue pour transformer les dumps bruts de Wikimedia en corpus d'entraînement de haute qualité et riches sur le plan linguistique pour sept langues slaves du Sud, en extrayant systématiquement du texte à partir de plusieurs projets wiki et en utilisant un filtrage basé sur les n-grammes pour éliminer les articles de faible qualité et répétitifs.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous souhaitiez construire une immense bibliothèque d'histoires, de poèmes et d'articles de presse pour enseigner à un robot comment parler et comprendre sept langues slaves du Sud différentes (comme le serbe, le croate, le bulgare et d'autres). Vous décidez d'utiliser Wikipédia et ses sites sœurs (comme Wikisource ou Wikinews) comme matière première, car ils sont gratuits et regorgent de textes.
Cependant, si vous vous contentez de récupérer les fichiers bruts de ces sites web, vous n'obtenez pas une bibliothèque d'histoires. Vous obtenez un entrepôt chaotique rempli de :
- Débris de construction : Codes informatiques cachés, instructions de mise en forme et « plans » indiquant à quoi le site web doit ressembler, mais qui ne font pas partie de l'histoire.
- Verrue cassée : Liens brisés et sections vides.
- Clones fabriqués en usine : Des milliers d'articles qui se ressemblent presque à s'y méprendre car ils ont été générés automatiquement à partir de bases de données plutôt que rédigés par des humains.
Ce papier est un guide expliquant comment nettoyer cet entrepôt désordonné pour le transformer en une bibliothèque immaculée. L'auteur, Mihailo Škorić, décompose le processus en deux phases principales : Le Grand Nettoyage et Le Filtre de Qualité.
Phase 1 : Le Grand Nettoyage (Extraction du texte)
Imaginez les données brutes de Wikipédia comme une maison encore en construction. Elle est remplie d'échafaudages, de pots de peinture et de plans partout. On ne peut pas encore y habiter.
L'auteur a créé une « équipe de construction » spécialisée (un programme informatique) pour démolir la maison jusqu'à ses murs nus et habitables.
- Dépouiller les échafaudages : Le programme utilise un outil appelé
mwparserfromhell(un nom fancy pour un outil qui comprend le langage secret de Wikipédia) pour arracher tout le code informatique, les modèles et les balises de mise en forme. - Éliminer le bruit : Il supprime les listes de « Catégories » (comme des étiquettes sur un classeur), retire les descriptions d'images et enlève les sections « Références » qui ressemblent à des notes de bas de page mais ne font pas partie de l'histoire principale.
- Aplatir les tableaux : Wikipédia utilise souvent des tableaux pour organiser les données. Le programme transforme ces grilles complexes en phrases simples et lisibles afin que le robot ne soit pas confus par les lignes de la grille.
- Le Résultat : Après cette phase, vous avez un tas de texte brut et propre. Ce n'est plus un site web ; ce sont juste des mots.
Phase 2 : Le Filtre de Qualité (Élimination des clones)
Maintenant que vous avez du texte propre, un nouveau problème se pose. Certains articles sont des textes « zombies ». Ce sont des articles qui semblent avoir été écrits par un humain, mais qui ont en réalité été générés automatiquement par un ordinateur. Ils sont répétitifs, ennuyeux et disent la même chose encore et encore, avec de légères variations.
Si vous nourrissez votre robot avec ces articles « zombies », il apprendra à parler dans une boucle robotique et répétitive. Pour résoudre ce problème, l'auteur utilise une Stratégie de Détective :
- Regroupement par quartier : Le programme regroupe les articles par sujet (par exemple, tous les articles sur « l'Histoire » vont dans une pièce, tous ceux sur le « Sport » dans une autre). Il est plus facile de trouver des doublons si l'on ne compare que des pommes avec des pommes.
- Le scan « Empreinte digitale » : Le programme transforme chaque article en une « empreinte digitale » mathématique (un vecteur). Il examine les premiers mots de l'article pour voir s'ils correspondent au modèle d'un template.
- Le test de similarité : Il compare ces empreintes digitales entre elles en utilisant une astuce mathématique appelée MinHashing. Imaginez que vous avez deux livres. S'ils partagent trop de phrases identiques dans le même ordre, ils sont probablement des clones.
- Le seuil de coupure : Le programme calcule un « score de similarité ». Si un article est trop similaire aux autres (au-dessus d'un certain seuil), il est éjecté de la bibliothèque. C'est comme un videur de boîte de nuit qui dit : « Tu ressembles exactement à tout le monde dans la file ; tu n'entres pas. »
Les Résultats
Le papier a testé cette méthode sur sept langues slaves du Sud. Les résultats ont été dramatiques :
- Serbe : A présenté le plus gros désordre à nettoyer. Avant le filtrage, il comptait plus de 500 000 articles. Après que le « videur » a fait son travail, près de la moitié ont été supprimés car ils étaient des doublons ou générés automatiquement. Le nombre de mots a chuté d'environ 60 %.
- Bulgare et slovène : Ceux-ci étaient déjà assez propres, ils ont donc perdu moins d'articles.
- La récompense : Le résultat final est une bibliothèque plus petite, mais de bien meilleure qualité. Les mots de ces nouvelles bibliothèques correspondent à la façon dont les humains parlent réellement, plutôt qu'à la façon dont une base de données génère du texte.
Pourquoi cela compte
L'auteur soutient que pour qu'un robot apprenne bien une langue, il doit lire de l'écriture réelle d'humains, et non du remplissage généré par ordinateur. En réalisant ce processus en deux étapes (nettoyer le code, puis filtrer les clones), le papier fournit un ensemble fiable et de haute qualité de livres pour entraîner des modèles d'IA dans les langues slaves du Sud.
En bref : Le papier nous apprend comment prendre un tas désordonné et rempli de code de Wikipédia, le nettoyer de ses déchets informatiques, puis jeter les articles « copier-coller », laissant derrière soi une collection pure de langage humain prête à être apprise par un robot.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.