← Derniers articles
💬 NLP

From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection

Cet article présente un pipeline évolutif et modulaire combinant un filtrage basé sur des règles et une classification par LLM pour traiter 527 millions de publications Reddit, réduisant avec succès 124,6 millions de jetons uniques à 1 021 candidats néologismes, dont 58,7 % ont été confirmés comme de véritables innovations lexicales par vérification manuelle.

Auteurs originaux : Diego Rossini, Lonneke van der Plas

Publié 2026-05-08
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Diego Rossini, Lonneke van der Plas

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédiez une bibliothèque contenant 527 millions de livres (des publications Reddit de 2005 à 2024). Quelque part au sein de cette montagne de texte, il y a quelques milliers de mots entièrement nouveaux que les gens viennent d'inventer. Votre objectif est de les trouver.

Si vous tentiez de lire chaque mot de cette bibliothèque pour trouver les nouveaux, vous seriez occupé pour le reste de votre vie. La plupart des mots « bizarres » que vous trouvez ne sont pas de nouvelles inventions ; ce sont simplement des fautes de frappe, des gens qui écrivent deux mots collés sans espace, ou des mots provenant d'autres langues.

Ce papier décrit un filtre intelligent et multi-étapes conçu pour tamiser cette montagne de texte et vous remettre un tout petit tas gérable de « suspects » qui sont réellement de nouveaux mots.

Voici comment le pipeline fonctionne, étape par étape :

1. Le Tamis Géant (Filtrage basé sur des règles)

Considérez la première étape comme une série de tamis géants. Vous versez les 124 millions de mots uniques à travers eux un par un.

  • Le tamis « Mot ancien » : Si un mot figurait dans un dictionnaire avant 2015, il est jeté. Nous ne nous soucions que du nouveau.
  • Le tamis « Nonsense » : Si un mot ressemble à un coup de clavier aléatoire (par exemple « asdfgh »), à une faute de frappe, ou à une chaîne de lettres répétées, il est éliminé.
  • Le tamis « Colle » : Si deux mots se sont collés sans espace (comme « datingapp »), le système tente de les séparer. S'ils n'étaient qu'une erreur, ils finissent à la poubelle.
  • Le tamis « Étranger » : Si le système pense qu'un mot est en espagnol ou en tagalog, il le met de côté (bien que certains mots hybrides complexes passent à travers).

Le Résultat : Cette étape est incroyablement efficace. Elle élimine 99,99 % des mots. Elle réduit les 124 millions de candidats à environ 175 000 nouveaux mots potentiels.

2. Le Panel de Juges (Classification par LLM)

Maintenant, nous avons 175 000 suspects. Nous ne pouvons pas encore tous les lire manuellement, alors nous demandons à un panel de quatre « juges » IA différents (Grands Modèles de Langage) d'examiner chacun d'eux.

  • Les juges sont invités à classer chaque mot dans l'une des quatre catégories suivantes :
    1. Néologisme : Un véritable nouveau mot (par exemple, « doomscrolling »).
    2. Entité : Un nom de personne, de marque ou de lieu (par exemple, « Elon »).
    3. Étranger : Un mot provenant d'une autre langue.
    4. Aucun : Juste une faute de frappe, un nom d'utilisateur ou des déchets.
  • Le Système de Vote : Pour éviter qu'une IA ne soit trop paresseuse ou trop folle, elles votent. Si la majorité s'accorde pour dire qu'un mot est un « Néologisme », il passe au tour suivant. Si elles ne sont pas d'accord, le mot est généralement écarté par sécurité.

3. L'Inspecteur Final (Vérification)

Même après le vote du panel d'IA, il reste environ 10 000 candidats « Néologisme ». C'est encore trop pour qu'un humain puisse vérifier rapidement.
Ainsi, un juge IA final, très strict (Claude), examine à nouveau la liste. Ce juge est extrêmement conservateur. Il dit : « Si je ne suis pas à 100 % sûr que c'est un nouveau mot, je le classe comme 'Aucun'. »

  • Cette étape réduit la liste de 10 000 à seulement 1 021 candidats.

La Révélation Finale

Les chercheurs ont ensuite pris ces 1 021 mots finaux et les ont vérifiés à la main.

  • La Bonne Nouvelle : 58,7 % d'entre eux (599 mots) étaient de véritables nouvelles inventions !
  • La Mauvaise Nouvelle : Le reste était soit des noms de choses (entités), soit des mots étrangers qui ont passé à travers, soit simplement des erreurs.

Quel Genre de Nouveaux Mots Ont-ils Trouvé ?

Le papier a révélé que les nouveaux mots sont créés de deux manières principales :

  1. Les « Suiveurs de Règles » : Des gens ajoutant des préfixes ou des suffixes à des mots existants (comme ajouter « -isme » à « woke » pour faire « wokeisme »).
  2. Les « Briseurs de Règles » : Des gens qui écrasent des mots ensemble ou les modifient pour le plaisir (comme fusionner « Barbie » et « Oppenheimer » pour faire « Barbenheimer », ou changer « thick » en « thiccest » pour l'emphase).

Pourquoi Cela Compte

La principale réalisation du papier n'est pas seulement de trouver les mots ; c'est la compression. Ils ont transformé une tâche impossible pour un humain (lire 124 millions de mots) en une tâche qu'un humain peut achever en une journée (vérifier 1 021 mots).

Ce que le papier NE fait PAS :

  • Il ne prédit pas l'avenir de la langue.
  • Il ne corrige pas les fautes de frappe pour les utilisateurs.
  • Il ne fonctionne pas sur des expressions comme « touch grass » (il ne trouve que des mots uniques).
  • Il ne repère pas les mots qui ont changé de sens mais ont gardé la même orthographe (comme « Karen » devenant une insulte argotique), car le système pense que « Karen » est juste un vieux nom.

En bref, c'est une machine à chercher de l'or hautement efficace. Elle creuse à travers une immense montagne de terre numérique, filtre les roches et la saleté, et vous remet un petit seau de pépites d'or (nouveaux mots) prêtes à être polies par un expert humain.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →