← Nieuwste papers
💬 NLP

From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection

Dit artikel presenteert een schaalbare, modulaire pijplijn die regelgebaseerde filtering en LLM-classificatie combineert om 527 miljoen Reddit-posts te verwerken, waarbij 124,6 miljoen unieke tokens succesvol worden teruggebracht tot 1.021 neologismekandidaten, waarvan 58,7% door handmatige verificatie als echte lexicale innovaties zijn bevestigd.

Oorspronkelijke auteurs: Diego Rossini, Lonneke van der Plas

Gepubliceerd 2026-05-08
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Diego Rossini, Lonneke van der Plas

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een bibliotheek voor met 527 miljoen boeken (Reddit-berichten van 2005 tot 2024). Ergens in deze berg tekst bevinden zich een paar duizend gloednieuwe woorden die mensen zojuist hebben bedacht. Je doel is om ze te vinden.

Als je zou proberen elk enkel woord in die bibliotheek te lezen om de nieuwe te vinden, zou je de rest van je leven bezig zijn. De meeste "vreemde" woorden die je tegenkomt, zijn geen nieuwe uitvindingen; het zijn gewoon typefouten, mensen die twee woorden zonder spatie achter elkaar typen, of woorden uit andere talen.

Dit artikel beschrijft een slimme, meerstapsfilter die is ontworpen om door die berg tekst te zeven en je een klein, hanteerbaar hoopje "verdachten" aan te reiken die daadwerkelijk nieuwe woorden zijn.

Hier is hoe de pijplijn stap voor stap werkt:

1. De Reuzenzeef (Regelgebaseerde Filtering)

Stel je de eerste fase voor als een reeks reuzenzeven. Je giet de 124 miljoen unieke woorden er één voor één doorheen.

  • De "Oud Woord"-zeef: Als een woord voor 2015 in een woordenboek stond, wordt het weggegooid. We geven alleen om het nieuwe spul.
  • De "Onzin"-zeef: Als een woord eruitziet als een toetsenbordgesmoor (bijvoorbeeld "asdfgh"), een typefout, of een rij herhaalde letters, wordt het weggegooid.
  • De "Lijm"-zeef: Als twee woorden zonder spatie aan elkaar zijn gaan plakken (zoals "datingapp"), probeert het systeem ze uit elkaar te halen. Als het gewoon een fout was, gaan ze in de prullenbak.
  • De "Buitenlandse"-zeef: Als het systeem denkt dat een woord Spaans of Tagalog is, zet het die apart (hoewel sommige lastige gemengde-taalwoorden er toch doorheen glippen).

Het Resultaat: Deze fase is ongelooflijk efficiënt. Het gooit 99,99% van de woorden weg. Het reduceert de 124 miljoen kandidaten tot ongeveer 175.000 potentiële nieuwe woorden.

2. Het Panel van Rechters (LLM-classificatie)

Nu hebben we 175.000 verdachten. We kunnen ze nog niet allemaal handmatig lezen, dus we vragen een panel van vier verschillende AI-"rechters" (Grote Taalmodellen) om elk woord te bekijken.

  • De rechters worden gevraagd elk woord in één van de vier bakken te sorteren:
    1. Neologisme: Een echt nieuw woord (bijvoorbeeld "doomscrolling").
    2. Entiteit: Een naam van een persoon, merk of plaats (bijvoorbeeld "Elon").
    3. Buitenlands: Een woord uit een andere taal.
    4. Geen: Gewoon een typefout, een gebruikersnaam of rotzooi.
  • Het Stemingssysteem: Om te voorkomen dat één AI te lui of te gek is, stemmen ze. Als de meerderheid het ermee eens is dat een woord een "Neologisme" is, gaat het naar de volgende ronde. Als ze het oneens zijn, wordt het woord meestal veiligheidshalve verworpen.

3. De Eindcontroleur (Verificatie)

Zelfs nadat het AI-panel heeft gestemd, zijn er nog steeds ongeveer 10.000 "Neologisme"-kandidaten. Dat is nog steeds te veel voor een mens om snel te controleren.
Dus kijkt een laatste, zeer strenge AI-rechter (Claude) opnieuw naar de lijst. Deze rechter is extreem conservatief. Hij zegt: "Als ik niet 100% zeker ben dat dit een nieuw woord is, noem ik het 'Geen'."

  • Deze stap reduceert de lijst van 10.000 naar slechts 1.021 kandidaten.

De Finale Onthulling

De onderzoekers namen deze laatste 1.021 woorden en controleerden ze handmatig.

  • Het Goede Nieuws: 58,7% van hen (599 woorden) waren echte nieuwe uitvindingen!
  • Het Slechte Nieuws: De rest waren ofwel namen van dingen (entiteiten), buitenlandse woorden die er doorheen waren geslopen, of gewoon fouten.

Wat voor Soort Nieuwe Woorden Vonden Ze?

Het artikel vond dat nieuwe woorden op twee hoofdmanieren worden gecreëerd:

  1. De "Regelvolgers": Mensen die voorvoegsels of achtervoegsels toevoegen aan bestaande woorden (zoals "-isme" toevoegen aan "woke" om "wokeisme" te maken).
  2. De "Regelbrekers": Mensen die woorden tegen elkaar slaan of ze voor de lol veranderen (zoals "Barbie" en "Oppenheimer" samenvoegen tot "Barbenheimer", of "thick" veranderen in "thiccest" voor nadruk).

Waarom Dit Belangrijk Is

De belangrijkste prestatie van het artikel is niet alleen het vinden van de woorden; het is de compressie. Ze hebben een taak die onmogelijk was voor een mens (het lezen van 124 miljoen woorden) gecomprimeerd tot een taak die een mens in één dag kan afronden (het controleren van 1.021 woorden).

Wat het artikel NIET doet:

  • Het voorspelt niet de toekomst van de taal.
  • Het corrigeert geen typefouten voor gebruikers.
  • Het werkt niet op zinnen zoals "touch grass" (het vindt alleen losse woorden).
  • Het vangt geen woorden die van betekenis zijn veranderd maar dezelfde spelling hebben behouden (zoals "Karen" die een slang-uitroep wordt), omdat het systeem denkt dat "Karen" gewoon een oude naam is.

Kortom, dit is een uiterst efficiënte goudmijnmachine. Het graaft door een enorme berg digitale modder, zeurt de rotsen en modder eruit, en geeft je een klein emmertje met goudbaren (nieuwe woorden) dat klaar is om door een menselijk expert gepolijst te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →