GLeMM: A large-scale multilingual dataset for morphological research
यह शोध पत्र GLeMM को प्रस्तुत करता है, जो सात यूरोपीय भाषाओं को कवर करने वाला एक बड़े पैमाने का, पूर्णतः स्वचालित और बहुभाषी व्युत्पत्तिपरक रूपविज्ञान (derivational morphology) डेटासेट है, जिसे शब्द निर्माण में रूप-अर्थ संबंधों के डेटा-संचालित अनुसंधान और कम्प्यूटेशनल परीक्षण को सक्षम करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
भाषा एक जीवित प्रणाली है जहाँ शब्द निरंतर विकसित होते हैं, नए अर्थ बनाने के लिए विभाजित और विलीन होते हैं। जब हम "happy" (खुश) जैसे शब्द को "happiness" (खुशी) में बदलते हैं, या "teach" (सिखाना) को "teacher" (शिक्षक) में बदलते हैं, तो हम 'डेरिवेशन' (व्युत्पत्ती) नामक प्रक्रिया में संलग्न होते हैं। इसी तरह मानव beings सरल मूल शब्दों से जटिल विचार बनाकर अपनी शब्दावली का विस्तार करते हैं। दशकों से, भाषाविदों ने इन संबंधों का मानचित्र बनाने की कोशिश की है, यह पूछते हुए कि क्यों कुछ शब्द अनुमानित तरीकों से बदलते हैं जबकि अन्य अपने स्वयं के अद्वितीय नियमों का पालन करते प्रतीत होते हैं। वे यह भी जानना चाहते थे कि क्या अलग-अलग संस्कृतियों में भाषा नए शब्द बनाने का तरीका समान है, या क्या प्रत्येक भाषा का अपना गुप्त तर्क होता है। हाल तक, इन प्रश्नों का उत्तर देने का अर्थ विशेषज्ञों की अंतर्दर्ष्टि और चुनिले उदाहरणों की छोटी सूचियों पर निर्भर रहना था। यह एक अकेले बादल को देखकर मौसम को समझने की कोशिश करने जैसा था; आप एक पैटर्न का आभास तो पा सकते हैं, लेकिन आप तूफान को चूक जाते हैं।
शोधकर्ताओं की एक टीम ने इस प्रक्रिया के अध्ययन को बदलने के लिए एक विशाल डिजिटल पुस्तकालय बनाया है। उन्होंने GLeMM नामक एक संसाधन बनाया, जिसका अर्थ है 'लार्ज-स्केल मल्टीलिंगुअल कलेक्शन ऑफ वर्ड-फॉर्मेशन डेटा' (शब्द निर्माण डेटा का बड़े पैमाने पर बहुभाषी संग्रह)। छोटी सूचियों पर निर्भर रहने के बजाय, उन्होंने सात यूरोपीय भाषाओं: अंग्रेजी, फ्रेंच, जर्मन, इतालवी, पोलिश, रूसी और स्पेनिश में संबंधित शब्दों के लगभग 1.2 मिलियन जोड़ों की जानकारी एकत्र की। इसका लक्ष्य अनुमान लगाने से आगे बढ़ना और डेटा की विशाल मात्रा को यह प्रकट करने देना था कि भाषाएँ कैसे बढ़ती हैं। इन कनेक्शनों को खोजने की प्रक्रिया को स्वचालित करके, शोधकर्ता उन पैटर्नों को देख सके जो पहले अदृश्य थे, जिससे एक स्पष्ट चित्र मिला कि जब हम नए शब्द बनाते हैं तो रूप और अर्थ कैसे परस्पर क्रिया करते हैं।
शोधकर्ताओं ने हर शब्द संबंध को मैन्युअल रूप से लिखने के लिए नहीं बैठा। इसके बजाय, उन्होंने विकिपीडिया के समान ऑनलाइन शब्दकोश 'विकशनरी' (Wiktionary) की ओर रुख किया, जिसे कोई भी संपादित कर सकता है। वे इस बात को समझ गए कि लोग शब्दों के लिए जो परिभाषाएँ लिखते हैं, उनमें अक्सर इस बात के सुराग होते हैं कि वे शब्द एक-दूसरे से कैसे संबंधित हैं। उदाहरण के लिए, यदि "spryness" (फुर्तीलापन) की परिभाषा कहती है कि यह "being spry" (फुर्तीला होने) का गुण है, तो मूल शब्द "spry" वहीं व्याख्या में मौजूद है। टीम ने लाखों ऐसी परिभाषाओं को स्कैन करने के लिए एक कंप्यूटर पद्धति विकसित की, जो शब्दों के ऐसे जोड़ों की तलाश करती है जहाँ एक को दूसरे का उपयोग करके परिभाषित किया गया हो। फिर उन्होंने यह जाँच की कि क्या दोनों शब्द इतने समान दिखते हैं कि वे संबंधित हों, जैसे कि एक सामान्य मूल साझा करना। इन निष्कर्षों को संबंधित शब्दों की अन्य सूचियों के साथ क्रॉस-रेफरेंस करके, उन्होंने यादृच्छिक मिलानों को फ़िल्टर किया और केवल उन जोड़ों को रखा जिन्होंने एक सुसंगत, दोहराव वाला पैटर्न दिखाया। इसने उन्हें प्रत्येक भाषा के लिए शब्द परिवारों का एक विशाल नेटवर्क बनाने की अनुमति दी, जिसमें "-ness" जैसे सरल प्रत्ययों से लेकर उपसर्गों और कई चरणों वाले अधिक जटिल परिवर्तनों तक सब कुछ शामिल था।
उन्होंने जो पाया वह भाषा के काम करने के बारे में कुछ लंबे समय से चले आ रहे विचारों को चुनौती देता है। लंबे समय तक, कई भाषाविदों का मानना था कि शब्द परिवार पूर्ण जाल (webs) की तरह होते हैं, जहाँ परिवार का प्रत्येक शब्द दूसरे प्रत्येक शब्द से सीधे जुड़ा होता है। यदि आपके पास "travel" (यात्रा) के लिए एक शब्द है, "traveler" (यात्री) के लिए एक शब्द है, और "traveling" (यात्रा करना) के लिए एक शब्द है, तो सिद्धांत बताता है कि वे सभी एक पूर्ण त्रिकोण में समान रूप से जुड़े हुए हैं। हालाँकि, GLeMM के डेटा से पता चलता है कि यह शायद ही कभी होता है। विशाल डेटासेट में, अधिकांश शब्द परिवार पूर्ण जाल नहीं हैं। इसके बजाय, वे एक केंद्रीय केंद्र (hub) और उससे निकलने वाली तीलियों (spokes) की तरह दिखते हैं, जहाँ नए शब्द एक मुख्य मूल से निकलते हैं लेकिन आवश्यक रूप से एक-दूसरे से वापस नहीं जुड़ते हैं। शोधकर्ताओं ने पाया कि केवल एक बहुत छोटा हिस्सा ही इन पूर्ण त्रिकोणों को बनाता है। वास्तव में, शब्दों के हर 100 जोड़ों के लिए जो सैद्धांतिक रूप से एक त्रिकोण बना सकते हैं, केवल कुछ ही ऐसा करते हैं। यह सुझाव देता है कि जिस तरह से हम शब्द बनाते हैं, वह पहले की तुलना में अधिक दिशात्मक और पदानुक्रमित (hierarchical) है, जिसमें एक आधार शब्द से उसके व्युत्पन्न शब्दों की ओर एक स्पष्ट प्रवाह होता है, न कि आपसी कनेक्शनों का एक अराजक जाल।
अध्ययन ने इस बात पर भी प्रकाश डाला कि विभिन्न भाषाएँ एक ही अवधारणा को कैसे संभालती हैं। जबकि अध्ययन की सभी सात भाषाएँ नए शब्द बनाती हैं, वे इसे अलग-अलग उपकरणों और आवृत्तियों के साथ करती हैं। उदाहरण के लिए, शोधकर्ताओं ने "कुछ फिर से करने" के विचार को व्यक्त करने के तरीके पर नज़र डाली। फ्रेंच में, उन्होंने एक विशिष्ट पैटर्न पाया जहाँ एक क्रिया को उलटने के लिए एक उपसर्ग जोड़ा जाता है, जिससे मूल शब्द के समान शब्दों का एक पूरा परिवार बन जाता है। अंग्रेजी में, समान पैटर्न मौजूद हैं लेकिन वे कम एकरूप हैं। डेटासेट ने दिखाया कि जबकि शब्द निर्माण का अंतर्निहित तर्क साझा है, विशिष्ट नियम काफी भिन्न हैं। एक भाषा एक नया शब्द बनाने के लिए दो मौजूदा शब्दों को जोड़ने को प्राथमिकता दे सकती है, जबकि दूसरी भाषा एक एकल शब्द में एक छोटा सा अंत (ending) जोड़ने को प्राथमिकता देती है। शोधकर्ताओं ने यह भी खोजा कि कुछ शब्द निर्माण "उल्टे" होते हैं। कभी-कभी, एक छोटा शब्द एक लंबे शब्द से व्युत्पन्न होता है, भले ही वह छोटा शब्द मूल दिखना चाहिए। डेटा ने इन रिवर्स पैटर्न की पहचान करने में मदद की क्योंकि वे मानक दिशा की तुलना में बहुत कम बार होते हैं, जिससे शोधकर्ता उन्हें नियम के अपवाद के रूप में पहचान सके।
परियोजना के विशाल पैमाने के बावजूद, शोधकर्ता सावधानी बरतते हुए कहते हैं कि उनका संसाधन पूर्ण नहीं है। चूंकि डेटा स्वचालित रूप से एक सार्वजनिक शब्दकोश से एकत्र किया गया था, इसलिए इसमें कुछ त्रुटियाँ और विसंगतियाँ हैं। कुछ शब्द जोड़े जो संबंधित दिखते हैं वे शायद नहीं हैं, और कुछ परिभाषाएँ थोड़ी गलत हो सकती हैं। हालाँकि, संग्रह का विशाल आकार यह सुनिश्चित करता है कि ये त्रुटियाँ इतनी दुर्लभ हैं कि वे बड़े चित्र को विकृत नहीं करती हैं। शोधकर्ता अनुमान लगाते हैं कि शब्द जोड़ों की सटीकता बहुत अधिक है, जिसमें अंग्रेजी और फ्रेंच अनुभागों में 90 प्रतिशत से अधिक कनेक्शन सही हैं। यह संसाधन आगे की जांच के लिए एक शुरुआती बिंदु के रूप में डिज़ाइन किया गया है, एक ऐसी जगह जहाँ अन्य वैज्ञानिक वास्तविक दुनिया के विशाल डेटा के विरुद्ध अपने स्वयं के सिद्धांतों का परीक्षण कर सकते हैं। यह भाषा के रहस्य का अंतिम उत्तर नहीं है, बल्कि एक शक्तिशाली नया उपकरण है जो हमें शब्द निर्माण के परिदृश्य को उस स्पष्टता के साथ देखने की अनुमति देता है जो पहले असंभव थी।
GLeMM का निर्माण भाषा के अध्ययन के तरीके में एक बदलाव का प्रतिनिधित्व करता है, जो छोटे, क्यूरेटेड उदाहरणों से हटकर विशाल, डेटा-संचालित अन्वेषण की ओर बढ़ता है। लाखों संबंधों के एक जीवित संग्रह के रूप में शब्दकोश को मानकर, शोधकर्ताओं ने मानव भाषण की छिपी हुई वास्तुकला में एक खिड़की खोल दी है। उन्होंने दिखाया है कि जबकि भाषाएँ विविध हैं, वे कुछ संरचनात्मक सिद्धांतों का पालन करती हैं जिन्हें मापा और देखा जा सकता है। निष्कर्ष बताते हैं कि जिस तरह से हम शब्द बनाते हैं, वह आदतों का एक यादृच्छिक संग्रह नहीं है, बल्कि स्पष्ट पैटर्न, अपवादों और एक विशिष्ट दिशा के साथ एक संरचित प्रणाली है। जैसे-जैसे शोधकर्ता अधिक भाषाओं को शामिल करने और अपनी विधियों को परिष्कृत करने के लिए इस कार्य का विस्तार करने की योजना बना रहे हैं, यह संसाधन मानव मन की ध्वनि से अर्थ बनाने की क्षमता की गहरी समझ प्रदान करने का वादा करता है। यह हमें याद दिलाता है कि हमारे द्वारा बोला जाने वाला प्रत्येक नया शब्द एक विशाल, परस्पर जुड़ी हुई इतिहास का हिस्सा है, और अब, पहली बार, हमारे पास एक ऐसा मानचित्र है जो पूरे क्षेत्र को देखने के लिए पर्याप्त बड़ा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।