GLeMM: A large-scale multilingual dataset for morphological research
تقدم الورقة البحثية GLeMM، وهي مجموعة بيانات للصرف الاشتقاقي واسعة النطاق، ومؤتمتة بالكامل، ومتعددة اللغات تغطي سبع لغات أوروبية، صُممت لتمكين الأبحاث القائمة على البيانات والاختبار الحسابي للعلاقات بين الشكل والمعنى في تكوين الكلمات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
اللغة هي نظام حي حيث تتطور الكلمات باستمرار، تنقسم وتندمج لتخلق معانٍ جديدة. عندما نأخذ كلمة مثل "happy" (سعيد) ونحولها إلى "happiness" (سعادة)، أو "teach" (يعلّم) إلى "teacher" (معلم)، فإننا نشارك في عملية تسمى "الاشتقاق". هكذا يوسع البشر مفرداتهم، مبتكرين أفكاراً معقدة من جذور بسيطة. لعقود من الزمن، حاول علماء اللغويات رسم خرائط لهذه الروابط، متسائلين لماذا تتغير بعض الكلمات بطرق يمكن التنبؤ بها بينما تتبع كلمات أخرى قواعدها الفريدة الخاصة. لقد تساءلوا عما إذا كانت الطريقة التي تبني بها اللغة كلمات جديدة هي نفسها عبر الثقافات المختلفة، أم أن لكل لغة منطقها السري الخاص. وحتى وقت قريب، كانت الإجابة على هذه الأسئلة تعتمد على حدس الخبراء وقوائم صغيرة مختارة بعناية من الأمثلة. كان الأمر يشبه محاولة فهم الطقس من خلال مراقبة سحابة واحدة؛ قد تحصل على تصور للنمط، لكنك ستفتقد العاصفة.
قام فريق من الباحثين الآن ببناء مكتبة رقمية ضخمة لتغيير كيفية دراستنا لهذه العملية. لقد أنشأوا مورداً يسمى GLeMM، وهو اختصار لـ "مجموعة متعددة اللغات واسعة النطاق لبيانات تكوين الكلمات". وبدلاً من الاعتماد على قوائم صغيرة، جمعوا معلومات عن ما يقرب من 1.2 مليون زوج من الكلمات ذات الصلة عبر سبع لغات أوروبية: الإنجليزية، والفرنسية، والألمانية، والإيطالية، والبولندية، والروسية، والإسبانية. كان الهدف هو تجاوز التخمين وترك حجم البيانات الهائل يكشف عن البنية الحقيقية لكيفية نمو اللغات. ومن خلال أتمتة عملية العثور على هذه الروابط، استطاع الباحثون رؤية أنماط كانت غير مرئية سابقاً، مما قدم صورة أوضح لكيفية تفاعل الشكل والمعنى عند ابتكارنا لكلمات جديدة.
لم يجلس الباحثون لكتابة كل علاقة بين الكلمات يدوياً. بدلاً من ذلك، لجأوا إلى "ويكشنري" (Wiktionary)، القاموس الإلكتروني الحر الذي يمكن لأي شخص تعديله. لقد أدركوا أن التعريفات التي يكتبها الناس للكلمات غالباً ما تحتوي على أدلة حول كيفية ارتباط تلك الكلمات ببعضها البعض. على سبيل المثال، إذا كان تعريف كلمة "spryness" (النشاط/الحيوية) يقول إنها "خاصية كون المرء spry (نشيطاً)"، فإن كلمة "spry" موجودة هناك في الشرح. طور الفريق طريقة حاسوبية لمسح الملايين من هذه التعريفات، بحثاً عن أزواج من الكلمات حيث يتم تعريف إحداها باستخدام الأخرى. ثم تحققوا مما إذا كانت الكلمتان تبدوان متشابهتين بما يكفي لكونهما مرتبطتين، مثل اشتراكهما في جذر مشترك. ومن خلال مقاطعة هذه النتائج مع قوائم أخرى للكلمات ذات الصلة، قاموا بتصفية المطابقات العشوائية واحتفظوا فقط بالأزواج التي أظهرت نمطاً ثابتاً ومتكرراً. سمح لهم هذا ببناء شبكة واسعة من عائلات الكلمات لكل لغة من اللغات السبع، لتشمل كل شيء بدءاً من اللاحقات البسيطة مثل "-ness" وصولاً إلى التغييرات الأكثر تعقيداً التي تتضمن سوابق وعدة خطوات.
ما وجدوه يتحدى بعض الأفكار الراسخة منذ فترة طويلة حول كيفية عمل اللغة. لفترة طويلة، اعتقد العديد من اللغويين أن عائلات الكلمات تشبه الشبكات الكاملة، حيث ترتبط كل كلمة في العائلة بكل كلمة أخرى مباشرة. فإذا كان لديك كلمة لـ "travel" (سفر)، وكلمة لـ "traveler" (مسافر)، وكلمة لـ "traveling" (سفر/تنقل)، فإن النظرية اقترحت أنها جميعاً مرتبطة بالتساوي في مثلث مثالي. ومع ذلك، تشير البيانات من GLeMM إلى أن هذا نادراً ما يحدث. في مجموعة البيانات الضخمة، لا تبدو معظم عائلات الكلمات كشبكات مثالية، بل تبدو أشبه بمركز له محاور، حيث تتفرع الكلمات الجديدة من جذر رئيسي ولكنها لا ترتبط بالضرورة ببعضها البعض. وجد الباحثون أن نسبة ضئيلة جداً من مجموعات الكلمات تشكل هذه المثلثات المثالية. في الواقع، مقابل كل 100 زوج من الكلمات التي يمكن نظرياً أن تشكل مثلثاً، يشكل عدد قليل منها فقط مثلثات فعلية. وهذا يشير إلى أن الطريقة التي نبني بها الكلمات هي أكثر اتجاهاً وهرمية مما كان يُعتقد سابقاً، مع تدفق واضح من الكلمة الأساسية إلى مشتقاتها، بدلاً من كونها شبكة فوضوية من الاتصالات المتبادلة.
كما سلطت الدراسة الضوء على كيفية تعامل اللغات المختلفة مع المفاهيم نفسها. وبينما تقوم جميع اللغات السبع في الدراسة بابتكار كلمات جديدة، إلا أنها تفعل ذلك بأدوات وتكرارات مختلفة. على سبيل المثال، نظر الباحثون في كيفية التعبير عن فكرة "القيام بشيء ما مرة أخرى". في الفرنسية، وجدوا نمطاً محدداً حيث تُضاف سابقة إلى الفعل لعكس إجراء ما، مما يخلق عائلة كاملة من الكلمات تحار الكلمة الأصلية. في الإنجليزية، توجد أنماط مماثلة ولكنها أقل اتساقاً. أظهرت مجموعة البيانات أنه بينما يتم تشارك المنطق الأساسي لتكوين الكلمات، فإن القواعد المحددة تختلف بشكل كبير. فقد تفضل لغة ما دمج كلمتين موجودتين لصنع كلمة جديدة، بينما تفضل لغة أخرى إضافة نهاية صغيرة إلى كلمة واحدة. كما اكتشف الباحثون أن بعض تكوينات الكلمات تكون "معكوسة". فأحياناً، تُشتق كلمة أقصر من كلمة أطول، رغم أن الكلمة الأقصر تبدو وكأنها هي الجذر. ساعدت البيانات في تحديد هذه الأنماط العكسية من خلال إظهار أنها تحدث بشكل أقل تكراراً من الاتجاه القياسي، مما سمح للباحثين برصدها كاستثناءات للقاعدة.
وعلى الرغم من النطاق الهائل للمشروع، يحرص الباحثون على ملاحظة أن موردهم ليس مثالياً. ولأن البيانات جُمعت تلقائياً من قاموس عام، فهي تحتوي على بعض الأخطاء والتناقضات. فقد تبدو بعض أزواج الكلمات مرتبطة وهي ليست كذلك، وقد تكون بعض التعريفات غير دقيقة تماماً. ومع ذلك، فإن الحجم الهائل للمجموعة يعني أن هذه الأخطاء نادرة لدرجة أنها لا تشوه الصورة الكبيرة. يقدر الباحثون أن دقة أزواج الكلمات عالية جداً، حيث تزيد نسبة الاتصالات الصحيحة في القسمين الإنجليزي والفرنسي عن 90 بالمائة. تم تصميم هذا المورد ليكون نقطة انطلاق لمزيد من الاستقصاء، ومكاناً يمكن للعلماء الآخرين فيه اختبار نظرياتهم الخاصة مقابل كمية هائلة من البيانات الواقعية. إنه ليس إجابة نهائية للغز اللغة، ولكنه أداة جديدة قوية تسمح لنا برؤية مشهد تكوين الكلمات بوض وصفاء كان مستحيلاً من قبل.
يمثل إنشاء GLeMM تحولاً في كيفية دراستنا للغة، من الانتقال من الأمثلة الصغيرة والمنتقاة إلى الاستكشاف القائم على البيانات الضخمة. ومن خلال التعامل مع القاموس كمتن حي لملايين العلاقات، فتح الباحثون نافذة على البنية الخفية للنطق البشري. لقد أظهروا أنه بينما تتنوع اللغات، فإنها تتبع مبادئ هيكلية معينة يمكن قياسها وملاحظتها. وتشير النتائج إلى أن الطريقة التي نبني بها الكلمات ليست مجرد مجموعة عشوائية من العادات، بل هي نظام منظم ذو أنماط واضحة، واستثناءات، واتجاه محدد. وبينما يخطط الباحثون لتوسيع هذا العمل ليشمل المزيد من اللغات وتحسين أساليبهم، يعد هذا المورد بتعميق فهمنا لقدرة العقل البشري على خلق المعنى من الصوت. إنه يذكرنا بأن كل كلمة جديدة ننطقها هي جزء من تاريخ مترابط وواسع، والآن، وللمرة الأولى، لدينا خريطة كبيرة بما يكفي لرؤية الإقليم بأكمله.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.