← Ultimi articoli
💻 computer science

GLeMM: A large-scale multilingual dataset for morphological research

Il documento introduce GLeMM, un dataset di morfologia derivazionale su larga scala, completamente automatizzato e multilingue, che copre sette lingue europee, progettato per consentire la ricerca basata sui dati e il test computazionale delle relazioni forma-significato nella formazione delle parole.

Autori originali: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

Pubblicato 2026-09-25
📖 6 min di lettura🧠 Approfondimento

Autori originali: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Il linguaggio è un sistema vivente in cui le parole evolvono costantemente, scindendosi e fondendosi per creare nuovi significati. Quando prendiamo una parola come "happy" e la trasformiamo in "happiness", o "teach" in "teacher", stiamo compiendo un processo chiamato derivazione. È così che gli esseri umani ampliano il proprio vocabolario, creando idee complesse a partire da radici semplici. Per decenni, i linguisti hanno cercato di mappare queste connessioni, chiedendosi perché alcune parole cambino in modi prevedibili mentre altre sembrino seguire le proprie regole uniche. Si sono chiesti se il modo in cui una lingua costruisce nuove parole sia lo stesso in culture diverse, o se ogni lingua possieda la propria logica segreta. Fino a poco tempo fa, rispondere a queste domande significava affidarsi all'intuizione degli esperti e a piccole liste di esempi selezionati a mano. Era un po' come cercare di comprendere il meteo osservando una singola nuvola: si poteva avere un'idea del modello, ma si perdeva l'occasione di vedere la tempesta.

Un team di ricercatori ha ora costruito una massiccia biblioteca digitale per cambiare il modo in cui studiamo questo processo. Hanno creato una risorsa chiamata GLeMM, che sta per una collezione multilingue su larga scala di dati sulla formazione delle parole. Invece di affidarsi a piccole liste, hanno raccolto informazioni su quasi 1,2 milioni di coppie di parole correlate in sette lingue europee: inglese, francese, tedesco, italiano, polacco, russo e spagnolo. L'obiettivo era andare oltre le congetture e lasciare che l'enorme volume di dati rivelasse la vera struttura di come le lingue crescono. Automatizzando il processo di ricerca di queste connessioni, i ricercatori sono stati in grado di vedere schemi precedentemente invisibili, offrendo un quadro più chiaro di come la forma e il significato interagiscano quando creiamo nuove parole.

I ricercatori non si sono seduti a scrivere manualmente ogni connessione tra le parole. Al contrario, si sono rivolti a Wiktionary, il dizionario online gratuito che chiunque può modificare. Si sono resi conto che le definizioni che le persone scrivono per le parole contengono spesso indizi su come quelle parole siano correlate. Per esempio, se la definizione di "spryness" dice che è "la proprietà di essere spry", la parola "spry" è presente proprio nella spiegazione. Il team ha sviluppato un metodo informatico per scansionare milioni di queste definizioni, cercando coppie di parole in cui una sia definita usando l'altra. Hanno poi verificato se le due parole apparissero abbastanza simili da essere correlate, come ad esempio condividendo una radice comune. Incrociando questi risultati con altri elenchi di parole correlate, hanno filtrato le corrispondenze casuali e mantenuto solo le coppie che mostravano un modello coerente e ripetitivo. Ciò ha permesso loro di costruire una vasta rete di famiglie di parole per ciascuna delle sette lingue, catturando tutto, dai suffissi semplici come "-ness" a cambiamenti più compliessi che coinvolgono prefissi e molteplici passaggi.

Ciò che hanno scoperto mette in discussione alcune idee radicate su come funziona il linguaggio. Per molto tempo, molti linguisti hanno creduto che le famiglie di parole fossero come reti complete, dove ogni parola in una famiglia è direttamente connessa a tutte le altre parole. Se avevi una parola per "travel", una per "traveler" e una per "traveling", la teoria suggeriva che fossero tutte ugualmente collegate in un triangolo perfetto. Tuttavia, i dati di GLeMM suggeriscono che questo accade raramente. Nel vasto dataset, la maggior parte delle famiglie di parole non sono reti perfette. Inveve, somigliano a un hub centrale con dei raggi, dove nuove parole si diramano da una radice principale ma non si connettono necessariamente tra loro. I ricercatori hanno scoperto che solo una minima frazione di gruppi di parole forma questi triangoli perfetti. In effetti, per ogni 100 coppie di parole che potrebbero teoricamente formare un triangolo, solo una manciata lo fa realmente. Questo suggerisce che il modo in cui costruiamo le parole sia più direzionale e gerarchico di quanto precedentemente pensato, con un flusso chiaro dalla parola base ai suoi derivati, piuttosto che un caos di connessioni reciproche.

Lo studio ha anche gettato luce su come diverse lingue gestiscono gli stessi concetti. Sebbene tutte e sette le lingue oggetto dello studio creino nuove parole, lo fanno con strumenti e frequenze differenti. Ad esempio, i ricercatori hanno osservato come le lingue esprimano l'idea di "fare qualcosa di nuovo". In francese, hanno trovato un modello specifico in cui un prefisso viene aggiunto a un verbo per invertire un'azione, creando un'intera famiglia di parole che rispecchia l'originale. In inglese esistono modelli simili, ma sono meno uniformi. Il dataset ha dimostrato che, sebbene la logica sottostante alla formazione delle parole sia condivisa, le regole specifiche variano significativamente. Una lingua potrebbe preferire di combinare due parole esistenti per crearne una nuova, mentre un'altra potrebbe preferire aggiungere una piccola terminazione a una singola parola. I ricercatori hanno anche scoperto che alcune formazioni di parole sono "al contrario". A volte, una parola più corta è in realtà derivata da una più lunga, anche se sembra che la parola più corta dovrebbe essere la radice. I dati hanno aiutato a identificare questi modelli inversi mostrando che avvengono molto meno frequentemente rispetto alla direzione standard, permettendo ai ricercatori di individuarli come eccezioni alla regola.

Nonostante la scala massiccia del progetto, i ricercatori sottolineano con cautela che la loro risorsa non è perfetta. Poiché i dati sono stati raccolti automaticamente da un dizionario pubblico, contengono errori e incongruenze. Alcune coppie di parole che sembrano correlate potrebbero non esserlo, e alcune definizioni potrebbero essere leggermente errate. Tuttavia, la dimensione enorme della collezione significa che questi errori sono abbastanza rari da non distorcere il quadro generale. I ricercatori stimano che l'accuratezza delle coppie di parole sia molto alta, con oltre il 90 percento delle connessioni nelle sezioni inglese e francese che risultano corrette. La risorsa è progettata per essere un punto di partenza per ulteriori indagini, un luogo dove altri scienziati possano testare le proprie teorie contro una vasta quantità di dati reali. Non è la risposta definitiva al mistero del linguaggio, ma è un potente nuovo strumento che ci permette di vedere il panorama della formazione delle parole con una chiarezza che prima era impossibile.

La creazione di GLeMM rappresenta un cambiamento nel modo in cui studiamo il linguaggio, passando da piccoli esempi curati a un'esplorazione massiccia basata sui dati. Trattando il dizionario come un corpus vivente di milioni di relazioni, i ricercatori hanno aperto una finestra sull'architettura nascosta del discorso umano. Hanno dimostrato che, sebbene le lingue siano diverse, esse seguono determinati principi strutturali che possono essere misurati e osservati. I risultati suggeriscono che il modo in cui costruiamo le parole non è una collezione casuale di abitudini, ma un sistema strutturato con schemi chiari, eccezioni e una direzione distinta. Mentre i ricercatori pianificano di espandere questo lavoro includendo più lingue e perfezionando i loro metodi, questa risorsa promette di approfondire la nostra comprensione della capacità della mente umana di creare significato dal suono. Ci ricorda che ogni nuova parola che pronunciamo è parte di una vasta e interconnessa storia e che ora, per la prima volta, abbiamo una mappa abbastanza grande da poter vedere l'intero territorio.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →