GLeMM: A large-scale multilingual dataset for morphological research
L'article présente GLeMM, un ensemble de données de morphologie dérivationnelle multilingue, à grande échelle et entièrement automatisé, couvrant sept langues européennes, conçu pour permettre la recherche axée sur les données et les tests computationnels des relations forme-sens dans la formation des mots.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Le langage est un système vivant où les mots évoluent constamment, se divisant et se fusionnant pour créer de nouvelles significations. Lorsque nous prenons un mot comme « happy » (heureux) et le transformons en « happiness » (bonheur), ou « teach » (enseigner) en « teacher » (enseignant), nous nous engageons dans un processus appelé dérivation. C'est ainsi que les êtres humains élargissent leur vocabulaire, créant des idées complexes à partir de racines simples. Pendant des décennies, les linguistes ont tenté de cartographier ces connexions, se demandant pourquoi certains mots changent de manière prévisible tandis que d'autres semblent suivre leurs propres règles uniques. Ils se sont demandé si la manière dont une langue construit de nouveaux mots est la même à travers différentes cultures, ou si chaque langue possède sa propre logique secrète. Jusqu'à récemment, répondre à ces questions signifiait s'appuyer sur l'intuition d'experts et sur de petites listes d'exemples choisis à la main. C'était un peu comme essayer de comprendre la météo en observant un nuage solitaire ; on peut percevoir un motif, mais on manque la tempête.
Une équipe de chercheurs a désormais construit une immense bibliothèque numérique pour changer la façon dont nous étudions ce processus. Ils ont créé une ressource appelée GLeMM, qui signifie une collection multilingue à grande échelle de données de formation de mots. Au lieu de s'appuyer sur de petites listes, ils ont rassemblé des informations sur près de 1,2 million de paires de mots apparentés dans sept langues européennes : l'anglais, le français, l'allemand, l'italien, le polonais, le russe et l'espagnol. L'objectif était de dépasser les suppositions et de laisser le volume massif de données révéler la véritable structure de la croissance des langues. En automatisant le processus de recherche de ces connexions, les chercheurs ont pu observer des motifs auparavant invisibles, offrant une image plus claire de la manière dont la forme et le sens interagissent lorsque nous créons de nouveaux mots.
Les chercheurs ne se sont pas assis pour noter manuellement chaque connexion de mots. À la place, ils se sont tournés vers Wiktionary, le dictionnaire en ligne gratuit que n'importe qui peut modifier. Ils ont réalisé que les définitions que les gens écrivent pour les mots contiennent souvent des indices sur la manière dont ces mots sont liés. Par exemple, si la définition de « spryness » (vivacité) est « la propriété d'être spry » (vif), le mot « spry » se trouve juste là dans l'explication. L'équipe a développé une méthode informatique pour scanner des millions de ces définitions, cherchant des paires de mots où l'un est défini en utilisant l'autre. Ils ont ensuite vérifié si les deux mots se ressemblaient suffisamment pour être apparentés, comme le fait de partager une racine commune. En recoupant ces résultats avec d'autres listes de mots apparentés, ils ont filtré les correspondances aléatoires et conservé uniquement les paires qui montraient un motif cohérent et répétitif. Cela leur a permis de construire un vaste réseau de familles de mots pour chacune des sept langues, capturant tout, des suffixes simples comme « -ness » aux changements plus complexes impliquant des préfixes et plusieurs étapes.
Ce qu'ils ont découvert remet en question certaines idées de longue date sur le fonctionnement du langage. Pendant longtemps, de nombreux linguistes ont cru que les familles de mots étaient comme des réseaux complets, où chaque mot d'une famille est directement connecté à tous les autres mots. Si vous aviez un mot pour « travel » (voyager), un mot pour « traveler » (voyageur) et un mot pour « traveling » (voyage), la théorie suggérait qu'ils étaient tous également liés dans un triangle parfait. Cependant, les données de GLeMM suggèrent que c'est rarement le cas. Dans l'immense ensemble de données, la plupart des familles de mots ne sont pas des réseaux parfaits. Au lieu de cela, elles ressemblent davantage à un moyeu central avec des rayons, où de nouveaux mots se ramifient à partir d'une racine principale sans nécessairement se reconnecter entre eux. Les chercheurs ont constaté que seule une infime fraction des groupes de mots forme ces triangles parfaits. En fait, pour chaque 100 paires de mots qui pourraient théoriquement former un triangle, seule une poignée de celles-ci le font réellement. Cela suggère que la manière dont nous construisons les mots est plus directionnelle et hiérarchique que ce que l'on pensait auparavant, avec un flux clair allant d'un mot de base vers ses dérivés, plutôt qu'un réseau chaotique de connexions mutuelles.
L'étude a également mis en lumière la manière dont différentes langues gèrent les mêmes concepts. Bien que les sept langues de l'étude créent de nouveaux mots, elles le font avec des outils et des fréquences différents. Par exemple, les chercheurs ont examiné comment les langues expriment l'idée de « faire quelque chose à nouveau ». En français, ils ont trouvé un motif spécifique où un préfixe est ajouté à un verbe pour inverser une action, créant toute une famille de mots qui reflète l'original. En anglais, des modèles similaires existent mais sont moins uniformes. L'ensemble de données a montré que si la logique sous-jacente de la formation des mots est partagée, les règles spécifiques varient considérablement. Une langue peut préférer combiner deux mots existants pour en faire un nouveau, tandis qu'une autre préfère ajouter une petite terminaison à un seul mot. Les chercheurs ont également découvert que certaines formations de mots sont « à l'envers ». Parfois, un mot plus court est en réalité dérivé d'un mot plus long, même si le mot plus court semble être la racine. Les données ont aidé à identifier ces modèles inverses en montrant qu'ils surviennent beaucoup moins fréquemment que la direction standard, permettant ainsi aux chercheurs de les repérer comme des exceptions à la règle.
Malgré l'échelle massive du projet, les chercheurs veillent à noter que leur ressource n'est pas parfaite. Comme les données ont été collectées automatiquement à partir d'un dictionnaire public, elles contiennent certaines erreurs et incohérences. Certaines paires de mots qui semblent apparentées ne le sont peut-être pas, et certaines définitions peuvent être légèrement erronées. Cependant, la taille considérable de la collection signifie que ces erreurs sont suffisamment rares pour ne pas fausser l'image globale. Les chercheurs estiment que la précision des paires de mots est très élevée, avec plus de 90 pour cent des connexions dans les sections anglaise et française qui sont correctes. La ressource est conçue pour être un point de départ pour de nouvelles investigations, un lieu où d'autres scientifiques peuvent tester leurs propres théories face à une vaste quantité de données réelles. Ce n'est pas une réponse finale au mystère du langage, mais c'est un nouvel outil puissant qui nous permet de voir le paysage de la formation des mots avec une clarté qui était impossible auparavant.
La création de GLeMM représente un changement dans notre façon d'étudier le langage, passant d'exemples de petite taille et soigneusement sélectionnés à une exploration massive pilotée par les données. En traitant le dictionnaire comme un corpus vivant de millions de relations, les chercheurs ont ouvert une fenêtre sur l'architecture cachée du discours humain. Ils ont montré que bien que les langues soient diverses, elles suivent certains principes structurels qui peuvent être mesurés et observés. Les résultats suggèrent que la manière dont nous construisons les mots n'est pas une collection aléatoire d'habitudes, mais un système structuré avec des motifs clairs, des exceptions et une direction distincte. Alors que les chercheurs prévoient d'étendre ce travail pour inclure plus de langues et d'affiner leurs méthodes, cette ressource promet d'approfondir notre compréhension de la capacité de l'esprit humain à créer du sens à partir du son. Elle nous rappelle que chaque nouveau mot que nous prononçons fait partie d'une histoire vaste et interconnectée, et que maintenant, pour la première fois, nous disposons d'une carte assez grande pour en voir tout le territoire.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.