← Derniers articles
💬 NLP

Operationalizing Linguistic Methods through Prompt-Engineering Skills: An Automatic Chinese Web Neologism Detection Pipeline

Cet article présente un pipeline automatique pour la détection des néologismes du web chinois qui traduit des principes linguistiques traditionnels en compétences d'ingénierie de prompts, atteignant une couverture élevée sur un vaste corpus tout en identifiant la génération de candidats et la classification sémantique comme des goulots d'étranglement clés grâce à une nouvelle analyse de décomposition du rappel conditionnel.

Auteurs originaux : Yufeng Wu, Meichun Liu

Publié 2026-06-09
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yufeng Wu, Meichun Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de trouver de nouveaux mots d'argot tendance que les gens inventent sur Internet en Chine. C'est comme essayer de pêcher dans un océan immense et trouble, où l'eau est remplie de vieux poissons connus, de débris aléatoires et de quelques créatures brandues et totalement inédites que vous n'avez jamais vues auparavant.

Ce document décrit un filet de pêche à quatre étapes conçu spécifiquement pour capturer automatiquement ces nouveaux « poissons d'Internet » (néologismes), sans qu'un humain ait besoin d'examiner chaque débris.

Voici comment le processus fonctionne, en utilisant des analogies simples :

La vue d'ensemble : Transformer les règles en « compétences »

Traditionnellement, les linguistes ont écrit des livres décrivant comment les nouveaux mots sont créés (comme la façon dont vous pouvez combiner deux mots pour en créer un nouveau). Mais ces livres sont de simples descriptions ; ils ne disent pas à un ordinateur comment le faire.

Les auteurs ont pris ces règles linguistiques et les ont transformées en « compétences » pour une IA (un grand modèle de langage). Imaginez que vous donnez à un stagiaire très intelligent mais littéral une liste de contrôle spécifique et un ensemble d'exemples, plutôt que de lui dire simplement : « Trouve-moi de nouveaux mots ».

Le pipeline à quatre étapes

Étape 1 : Le grand filet (Génération de candidats)
L'équipe est partie d'une immense bibliothèque de 267 millions de documents web chinois. Au lieu d'utiliser un dictionnaire standard pour découper le texte, ils ont simplement saisi toutes les combinaisons possibles de 2, 3 ou 4 caractères qui apparaissaient fréquemment.

  • Le résultat : Ils ont remonté un seau contenant 1,2 million de candidats potentiels pour mots. C'est la « prise brute ».

Étape ce 2 : La vérification du dictionnaire et le test de la colle (Pré-filtrage)

  • La vérification du dictionnaire : Ils ont vérifié si ces mots figuraient déjà dans le dictionnaire chinois standard de 2005. Si c'était le cas, ils les jetaient (car ils ne sont pas nouveaux).
  • Le test de la colle (PMI) : Ils ont utilisé un test mathématique pour voir si les caractères d'un candidat « collent » étroitement ensemble. Par exemple, « social » et « mort » collent bien ensemble pour former une « mort sociale » (un nouveau concept), mais des caractères aléatoires comme « pomme » et « nuage » ne collent pas forcément. Si la colle est faible, le candidat est écarté.
  • Le résultat : Le seau rétrécit à 783 000 candidats.

Étape 3 : L'architecte grammatical (Compétence de bonne formation)
C'est ici que l'IA obtient sa première « compétence ». L'IA examine les candidats restants et se demande : « Est-ce que cela ressemble à une structure de mot chinois réelle ? »

  • Elle vérifie si le mot suit des règles telles que « Adjectif + Nom » ou « Verbe + Objet ».
  • Elle ignore si l'IA a déjà entendu le mot auparavant ; elle se soucie uniquement de savoir si la structure fait sens.
  • Le résultat : Le seau rétrécit à 226 000 candidats qui semblent structurellement sains.

Étape 4 : Le juge final (Classification à trois voies)
Cette étape se divise en deux étapes pour décider ce qu'est réellement le mot :

  • 4A (Le filtre par règles) : Un filtre simple basé sur des règles élimine rapidement les déchets évidents (comme les mots commençant par « le » ou se terminant par une préposition qui leur donne l'air de fragments de phrases).
  • 4B (Le juge IA) : L'IA utilise une seconde « compétence » pour rendre la décision finale. Elle doit choisir entre trois options :
    1. Néologisme : Un mot d'argot nouveau et valide.
    2. Entité : Le nom d'une personne, d'un lieu ou d'une chose (pas un nouveau mot).
    3. Aucun : Juste du bruit aléatoire ou une expression existante.
  • Le résultat : Le seau final contient 226 959 éléments classifiés, dont 4 853 nouveaux mots confirmés.

L'évaluation par « Rayons X » : Trouver les fuites

Les auteurs ne se sont pas contentés de dire : « Nous avons trouvé 4 853 mots ! » Ils voulaient savoir où ils avaient perdu les mots qu'ils auraient dû trouver. Ils ont utilisé une méthode spéciale de « rayons X » appelée décomposition du rappel conditionnel.

Imaginez que vous avez un seau percé de cinq trous. Au lieu de mesurer simplement la quantité d'eau restante à la fin, ils ont mesuré combien d'eau s'est échappée à chaque trou spécifique.

Les conclusions :

  1. Deux grosses fuites : Ils ont découvert que la plupart des « nouveaux mots » ont été perdus dès le début (Étape 1, car le filet initial n'était pas assez large) et à la toute fin (Étape 4B, car l'IA avait du mal à décider si un mot était vraiment « nouveau » ou s'il s'agissait d'une entité connue).
  2. Le problème de la longueur : Ils ont découvert un motif amusant basé sur la longueur des mots :
    • L'IA était excellente pour vérifier si des mots de 2, 3 ou 4 caractères étaient structurellement corrects (elle en a validé presque tous).
    • Cependant, l'IA devenait moins performante pour décider si ces mots étaient nouveaux à mesure qu'ils devenaient longs. Elle était douée pour repérer les nouveaux mots de 2 caractères, mais sa précision chutait considérablement pour les mots de 4 caractères.

L'essentiel

L'article prouve que l'on peut transformer les anciennes règles linguistiques en « compétences » d'IA modernes pour trouver automatiquement de nouveaux mots. Ils ont publié leur liste de 4 853 nouveaux mots ainsi que leur méthode de test par « rayons X » en tant que ressource publique.

Cependant, ils ont également identifié une limite : bien que l'IA soit excellente pour vérifier si un mot ressemble à un mot, elle éprouve encore des difficultés pour la tâche plus complexe de décider si ce mot est véritablement nouveau, surtout lorsqu'il est long et complexe.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →