GLeMM: A large-scale multilingual dataset for morphological research
Das Paper stellt GLeMM vor, einen groß angelegten, vollautomatisierten und mehrsprachigen Datensatz für derivationale Morphologie, der sieben europäische Sprachen abdeckt und darauf ausgelegt ist, datengesteuerte Forschung sowie das computergestützte Testen von Form-Bedeutungs-Beziehungen in der Wortbildung zu ermöglichen.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Sprache ist ein lebendiges System, in dem sich Wörter ständig entwickeln, aufspalten und verschmelzen, um neue Bedeutungen zu schaffen. Wenn wir ein Wort wie „happy“ nehmen und es in „happiness“ verwandeln, oder „teach“ in „teacher“, betreiben wir einen Prozess, der als Derivation bezeichnet wird. So erweitern Menschen ihren Wortschatz und erschaffen komplexe Ideen aus einfachen Wurzeln. Seit Jahrzehnten versuchen Linguisten, diese Verbindungen abzubilden, indem sie fragen, warum sich manche Wörter auf vorhersehbare Weise verändern, während andere scheinbar ihren eigenen, einzigartigen Regeln folgen. Sie haben sich gefragt, ob die Art und Weise, wie eine Sprache neue Wörter bildet, kulturübergreifend dieselbe ist oder ob jede Sprache ihre eigene geheime Logik besitzt. Bis vor kurzem bedeutete die Beantwortung dieser Fragen, sich auf die Intuition von Experten und kleine, handverlesene Listen von Beispielen zu verlassen. Es war ein wenig so, als versuchte man, das Wetter zu verstehen, indem man eine einzelne Wolke beobachtet; man bekommt zwar ein Gefühl für das Muster, aber man verpasst den Sturm.
Ein Team von Forschern hat nun eine massive digitale Bibliothek aufgebaut, um die Untersuchung dieses Prozesses zu verändern. Sie entwickelten eine Ressource namens GLeMM, was für eine groß angelegte, mehrsprachige Sammlung von Wortbildungdaten steht. Anstatt sich auf kleine Listen zu verlassen, sammelten sie Informationen über fast 1,2 Millionen Paare verwandter Wörter in sieben europäischen Sprachen: Englisch, Französisch, Deutsch, Italienisch, Polnisch, Russisch und Spanisch. Das Ziel war es, über bloßes Raten hinauszugehen und die schiere Menge an Daten die wahre Struktur dessen offenbaren zu lassen, wie Sprachen wachsen. Durch die Automatisierung des Prozesses zur Auffindung dieser Verbindungen konnten die Forscher Muster erkennen, die zuvor unsichtbar waren, was ein klareres Bild davon vermittelt, wie Form und Bedeutung interagieren, wenn wir neue Wörter erschaffen.
Die Forscher haben sich nicht hingesetzt, um jede Wortverbindung manuell aufzuschreiben. Stattdessen wandten sie sich an Wiktionary, dem kostenlosen Online-Wörterbuch, das jeder bearbeiten kann. Sie erkannten, dass die Definitionen, die Menschen für Wörter schreiben, oft Hinweise darauf enthalten, wie diese Wörter miteinander verwandt sind. Wenn zum Beispiel die Definition von „spryness“ besagt, dass es „die Eigenschaft ist, spry zu sein“, dann steht das Wort „spry“ direkt in der Erklärung. Das Team entwickelte eine Computermethode, um Millionen dieser Definitionen zu scannen und nach Wortpaaren zu suchen, bei denen eines mit dem anderen definiert wird. Sie prüften dann, ob die beiden Wörter ähnlich genug aussah, um verwandt zu sein, wie etwa durch das Teilen einer gemeinsamen Wurzel. Durch den Abgleich dieser Funde mit anderen Listen verwandter Wörter filterten sie zufällige Übereinstimmungen heraus und behielten nur jene Paare, die ein konsistentes, sich wiederholendes Muster zeigten. Dies ermöglichte es ihnen, ein riesiges Netzwerk von Wortfamilien für jede der sieben Sprachen aufzubauen, das alles von einfachen Suffixen wie „-ness“ bis hin zu komplexeren Veränderungen unter Einbeziehung von Präfixen und mehreren Schritten erfasste.
Was sie fanden, stellt einige lang gehegte Vorstellungen darüber infrage, wie Sprache funktioniert. Lange Zeit glaubten viele Linguisten, dass Wortfamilien wie vollständige Netze seien, in denen jedes Wort in einer Familie direkt mit jedem anderen Wort verbunden ist. Wenn man ein Wort für „travel“, ein Wort für „traveler“ und ein Wort für „traveling“ hätte, besagte die Theorie, dass sie alle gleichermaßen miteinander verknüpft wären – ein perfektes Dreieck. Die Daten aus GLeMM legen jedoch nahe, dass dies selten der Fall ist. In dem massiven Datensatz sind die meisten Wortfamilien keine perfekten Netze. Stattdessen ähneln sie einer zentralen Nabe mit Speichen, bei der neue Wörter von einer Hauptwurzel aus hervorgehen, aber nicht notwendigerweise wieder miteinander verbunden sind. Die Forscher fanden heraus, dass nur ein winziger Bruchteil der Wortgruppen diese perfekten Dreiecke bildet. Tatsächlich bilden von je 100 Wortpaaren, die theoretisch ein Dreieck bilden könnten, nur eine Handvoll tatsächlich eines. Dies deutet darauf hin, dass die Art und Weise, wie wir Wörter bilden, eher gerichtet und hierarchisch ist als bisher angenommen, mit einem klaren Fluss von einem Basiswort zu seinen Derivaten, statt eines chaotischen Netzes gegenseitiger Verbindungen.
Die Studie beleuchtete auch, wie verschiedene Sprachen dieselben Konzepte handhaben. Während alle sieben in der Studie untersuchten Sprachen neue Wörter erschaffen, tun sie dies mit unterschiedlichen Werkzeugen und Häufigkeiten. In Frankreich fanden sie beispielsweise ein spezifisches Muster, bei dem ein Präfix zu einem Verb hinzugefügt wird, um eine Handlung umzukehren, wodurch eine ganze Wortfamilie entsteht, die das Original spiegelt. In der englischen Sprache existieren ähnliche Muster, sind aber weniger einheitlich. Der Datensatz zeigte, dass die zugrunde liegende Logik der Wortbildung zwar gemeinsam ist, die spezifischen Regeln sich jedoch erheblich unterscheiden. Eine Sprache bevorzugt vielleicht, zwei existierende Wörter zu einem neuen zu kombinieren, während eine andere es bevorzugt, eine kleine Endung an ein einzelnes Wort anzuhängen. Die Forscher entdeckten auch, dass einige Wortbildungen „rückwärts“ verlaufen. Manchmal wird ein kürzeres Wort tatsächlich von einem längeren abgeleitet, obwohl es so aussieht, als sollte das kürzere das Stammwort sein. Die Daten halfen dabei, diese Rückwärtsmuster zu identifizieren, indem sie zeigten, dass sie viel seltener vorkommen als die Standardrichtung, was es den Forschern ermöglichte, sie als Ausnahmen zur Regel zu identifizieren.
Trotz des massiven Ausmaßes des Projekts betonen die Forscher, dass ihre Ressource nicht perfekt ist. Da die Daten automatisch aus einem öffentlichen Wörterbuch gesammelt wurden, enthält sie einige Fehler und Inkonsistenzen. Einige Wortpaare, die ähnlich aussehen, sind es vielleicht nicht, und manche Definitionen könnten leicht daneben liegen. Die schiere Größe der Sammlung bedeutet jedoch, dass diese Fehler selten genug sind, um das Gesamtbild nicht zu verzerren. Die Forscher schätzen, dass die Genauigkeit der Wortpaare sehr hoch ist, wobei über 90 Prozent der Verbindungen in den englischen und französischen Abschnitten korrekt sind. Die Ressource ist als Ausgangspunkt für weitere Untersuchungen konzipiert – ein Ort, an dem andere Wissenschaftler ihre eigenen Theorien an einer riesigen Menge an Realdaten testen können. Es ist nicht die endgültige Antwort auf das Rätsel der Sprache, aber es ist ein leistungsfähiges neues Werkzeug, das es uns ermöglicht, die Landschaft der Wortbildung mit einer Klarheit zu sehen, die zuvor unmöglich war.
Die Erstellung von GLeMM stellt einen Wandel in der Art und Weise dar, wie wir Sprache studieren, weg von kleinen, kuratierten Beispielen hin zu einer massiven, datengesteuerten Exploration. Indem sie das Wörterbuch als einen lebendigen Korpus von Millionen von Beziehungen behandeln, haben die Forscher ein Fenster in die verborgene Architektur der menschlichen Sprache geöffnet. Sie haben gezeigt, dass Sprachen zwar vielfältig sind, aber bestimmten strukturellen Prinzipien folgen, die messbar und beobachtbar sind. Die Ergebnisse legen nahe, dass die Art und Weise, wie wir Wörter bilden, keine zufällige Sammlung von Gewohnheiten ist, sondern ein strukturiertes System mit klaren Mustern, Ausnahmen und einer deutlichen Richtung. Während die Forscher planen, diese Arbeit auf mehr Sprachen auszuweiten und ihre Methoden zu verfeinern, verspricht diese Ressource, unser Verständnis der menschlichen Fähigkeit, aus Klang Bedeutung zu erschaffen, zu vertiefen. Sie erinnert uns daran, dass jedes neue Wort, das wir sprechen, Teil einer riesigen, miteinander vernetzten Geschichte ist, und nun haben wir zum ersten Mal eine Karte, die groß genug ist, um das gesamte Territorium zu sehen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.