From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection
Questo articolo presenta una pipeline scalabile e modulare che combina filtraggio basato su regole e classificazione tramite LLM per elaborare 527 milioni di post di Reddit, riducendo con successo 124,6 milioni di token unici a 1.021 candidati neologismi, dei quali il 58,7% è stato confermato come innovazione lessicale genuina attraverso verifica manuale.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di avere una biblioteca contenente 527 milioni di libri (post di Reddit dal 2005 al 2024). Da qualche parte dentro questa montagna di testo, ci sono alcune migliaia di parole completamente nuove inventate di recente dalle persone. Il tuo obiettivo è trovarle.
Se provassi a leggere ogni singola parola in quella biblioteca per trovare quelle nuove, saresti impegnato per il resto della tua vita. La maggior parte delle parole "strane" che trovi non sono nuove invenzioni; sono semplicemente errori di battitura, persone che scrivono due parole attaccate senza spazio, o parole di altre lingue.
Questo articolo descrive un filtro intelligente a più stadi progettato per setacciare quella montagna di testo e consegnarti un piccolo e gestibile mucchio di "sospetti" che sono effettivamente parole nuove.
Ecco come funziona la pipeline, passo dopo passo:
1. Il Setaccio Gigante (Filtraggio Basato su Regole)
Pensa alla prima fase come a una serie di setacci giganti. Versi le 124 milioni di parole uniche attraverso di essi, uno per uno.
- Il Setaccio "Parola Vecchia": Se una parola era presente in un dizionario prima del 2015, viene scartata. Ci interessa solo la roba nuova.
- Il Setaccio "Senza Senso": Se una parola sembra un colpo di tastiera casuale (ad esempio "asdfgh"), un errore di battitura o una stringa di lettere ripetute, viene buttata via.
- Il Setaccio "Colla": Se due parole si sono attaccate senza spazio (come "datingapp"), il sistema cerca di separarle. Se erano solo un errore, finiscono nel cestino.
- Il Setaccio "Straniero": Se il sistema ritiene che una parola sia in spagnolo o tagalog, la mette da parte (anche se alcune parole miste e insidiose riescono a passare).
Il Risultato: Questa fase è incredibilmente efficiente. Scarta il 99,99% delle parole. Riduce i 124 milioni di candidati a circa 175.000 potenziali parole nuove.
2. Il Pannello dei Giudici (Classificazione tramite LLM)
Ora abbiamo 175.000 sospetti. Non possiamo ancora leggerli tutti manualmente, quindi chiediamo a un pannello di quattro diversi "giudici" AI (Modelli Linguistici di grandi dimensioni) di esaminare ciascuno di essi.
- Ai giudici viene chiesto di classificare ogni parola in una di quattro categorie:
- Neologismo: Una parola genuinamente nuova (ad esempio "doomscrolling").
- Entità: Un nome di persona, marca o luogo (ad esempio "Elon").
- Straniero: Una parola di un'altra lingua.
- Nessuna: Solo un errore di battitura, un nome utente o spazzatura.
- Il Sistema di Voto: Per evitare che un'AI sia troppo pigra o troppo pazza, votano. Se la maggioranza concorda che una parola è un "Neologismo", passa al turno successivo. Se non sono d'accordo, la parola viene solitamente scartata per sicurezza.
3. L'Ispettore Finale (Verifica)
Anche dopo il voto del pannello AI, ci sono ancora circa 10.000 candidati "Neologismo". Sono ancora troppi per essere controllati rapidamente da un umano.
Quindi, un giudice AI finale e molto severo (Claude) esamina di nuovo l'elenco. Questo giudice è estremamente conservatore. Dice: "Se non sono sicuro al 100% che questa sia una parola nuova, la classificherò come 'Nessuna'".
- Questo passaggio riduce l'elenco da 10.000 a soli 1.021 candidati.
La Rivelazione Finale
I ricercatori hanno poi preso queste ultime 1.021 parole e le hanno controllate manualmente.
- La Buona Notizia: Il 58,7% di esse (599 parole) erano genuine nuove invenzioni!
- La Cattiva Notizia: Il resto era costituito o da nomi di cose (entità), parole straniere sfuggite al filtro, o semplicemente errori.
Che Tipo di Parole Nuove Hanno Trovato?
L'articolo ha scoperto che le parole nuove vengono create in due modi principali:
- I "Rispettatori delle Regole": Persone che aggiungono prefissi o suffissi a parole esistenti (come aggiungere "-ismo" a "woke" per creare "wokeismo").
- I "Trasgressori delle Regole": Persone che uniscono parole o le modificano per divertimento (come fondere "Barbie" e "Oppenheimer" per creare "Barbenheimer", o cambiare "thick" in "thiccest" per enfasi).
Perché Questo È Importante
Il principale risultato dell'articolo non è solo trovare le parole; è la compressione. Hanno trasformato un compito impossibile per un umano (leggere 124 milioni di parole) in un compito che un umano può completare in un giorno (controllare 1.021 parole).
Cosa l'articolo NON fa:
- Non prevede il futuro della lingua.
- Non corregge gli errori di battitura per gli utenti.
- Non funziona su frasi come "touch grass" (trova solo singole parole).
- Non cattura parole che hanno cambiato significato ma mantengono la stessa ortografia (come "Karen" diventata un insulto gergale), perché il sistema pensa che "Karen" sia solo un vecchio nome.
In breve, questa è una macchina per l'estrazione dell'oro altamente efficiente. Scava attraverso una massiccia montagna di terra digitale, filtra via rocce e terra, e ti consegna un piccolo secchio di pepite d'oro (parole nuove) pronte per essere lucidate da un esperto umano.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.