← नवीनतम पेपर
💻 computer science

GLeMM: A large-scale multilingual dataset for morphological research

यह शोध पत्र GLeMM को प्रस्तुत करता है, जो सात यूरोपीय भाषाओं को कवर करने वाला एक बड़े पैमाने का, पूर्णतः स्वचालित और बहुभाषी व्युत्पत्तिपरक रूपविज्ञान (derivational morphology) डेटासेट है, जिसे शब्द निर्माण में रूप-अर्थ संबंधों के डेटा-संचालित अनुसंधान और कम्प्यूटेशनल परीक्षण को सक्षम करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

प्रकाशित 2026-09-25
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

भाषा एक जीवित प्रणाली है जहाँ शब्द निरंतर विकसित होते हैं, नए अर्थ बनाने के लिए विभाजित और विलीन होते हैं। जब हम "happy" (खुश) जैसे शब्द को "happiness" (खुशी) में बदलते हैं, या "teach" (सिखाना) को "teacher" (शिक्षक) में बदलते हैं, तो हम 'डेरिवेशन' (व्युत्पत्ती) नामक प्रक्रिया में संलग्न होते हैं। इसी तरह मानव beings सरल मूल शब्दों से जटिल विचार बनाकर अपनी शब्दावली का विस्तार करते हैं। दशकों से, भाषाविदों ने इन संबंधों का मानचित्र बनाने की कोशिश की है, यह पूछते हुए कि क्यों कुछ शब्द अनुमानित तरीकों से बदलते हैं जबकि अन्य अपने स्वयं के अद्वितीय नियमों का पालन करते प्रतीत होते हैं। वे यह भी जानना चाहते थे कि क्या अलग-अलग संस्कृतियों में भाषा नए शब्द बनाने का तरीका समान है, या क्या प्रत्येक भाषा का अपना गुप्त तर्क होता है। हाल तक, इन प्रश्नों का उत्तर देने का अर्थ विशेषज्ञों की अंतर्दर्ष्टि और चुनिले उदाहरणों की छोटी सूचियों पर निर्भर रहना था। यह एक अकेले बादल को देखकर मौसम को समझने की कोशिश करने जैसा था; आप एक पैटर्न का आभास तो पा सकते हैं, लेकिन आप तूफान को चूक जाते हैं।

शोधकर्ताओं की एक टीम ने इस प्रक्रिया के अध्ययन को बदलने के लिए एक विशाल डिजिटल पुस्तकालय बनाया है। उन्होंने GLeMM नामक एक संसाधन बनाया, जिसका अर्थ है 'लार्ज-स्केल मल्टीलिंगुअल कलेक्शन ऑफ वर्ड-फॉर्मेशन डेटा' (शब्द निर्माण डेटा का बड़े पैमाने पर बहुभाषी संग्रह)। छोटी सूचियों पर निर्भर रहने के बजाय, उन्होंने सात यूरोपीय भाषाओं: अंग्रेजी, फ्रेंच, जर्मन, इतालवी, पोलिश, रूसी और स्पेनिश में संबंधित शब्दों के लगभग 1.2 मिलियन जोड़ों की जानकारी एकत्र की। इसका लक्ष्य अनुमान लगाने से आगे बढ़ना और डेटा की विशाल मात्रा को यह प्रकट करने देना था कि भाषाएँ कैसे बढ़ती हैं। इन कनेक्शनों को खोजने की प्रक्रिया को स्वचालित करके, शोधकर्ता उन पैटर्नों को देख सके जो पहले अदृश्य थे, जिससे एक स्पष्ट चित्र मिला कि जब हम नए शब्द बनाते हैं तो रूप और अर्थ कैसे परस्पर क्रिया करते हैं।

शोधकर्ताओं ने हर शब्द संबंध को मैन्युअल रूप से लिखने के लिए नहीं बैठा। इसके बजाय, उन्होंने विकिपीडिया के समान ऑनलाइन शब्दकोश 'विकशनरी' (Wiktionary) की ओर रुख किया, जिसे कोई भी संपादित कर सकता है। वे इस बात को समझ गए कि लोग शब्दों के लिए जो परिभाषाएँ लिखते हैं, उनमें अक्सर इस बात के सुराग होते हैं कि वे शब्द एक-दूसरे से कैसे संबंधित हैं। उदाहरण के लिए, यदि "spryness" (फुर्तीलापन) की परिभाषा कहती है कि यह "being spry" (फुर्तीला होने) का गुण है, तो मूल शब्द "spry" वहीं व्याख्या में मौजूद है। टीम ने लाखों ऐसी परिभाषाओं को स्कैन करने के लिए एक कंप्यूटर पद्धति विकसित की, जो शब्दों के ऐसे जोड़ों की तलाश करती है जहाँ एक को दूसरे का उपयोग करके परिभाषित किया गया हो। फिर उन्होंने यह जाँच की कि क्या दोनों शब्द इतने समान दिखते हैं कि वे संबंधित हों, जैसे कि एक सामान्य मूल साझा करना। इन निष्कर्षों को संबंधित शब्दों की अन्य सूचियों के साथ क्रॉस-रेफरेंस करके, उन्होंने यादृच्छिक मिलानों को फ़िल्टर किया और केवल उन जोड़ों को रखा जिन्होंने एक सुसंगत, दोहराव वाला पैटर्न दिखाया। इसने उन्हें प्रत्येक भाषा के लिए शब्द परिवारों का एक विशाल नेटवर्क बनाने की अनुमति दी, जिसमें "-ness" जैसे सरल प्रत्ययों से लेकर उपसर्गों और कई चरणों वाले अधिक जटिल परिवर्तनों तक सब कुछ शामिल था।

उन्होंने जो पाया वह भाषा के काम करने के बारे में कुछ लंबे समय से चले आ रहे विचारों को चुनौती देता है। लंबे समय तक, कई भाषाविदों का मानना था कि शब्द परिवार पूर्ण जाल (webs) की तरह होते हैं, जहाँ परिवार का प्रत्येक शब्द दूसरे प्रत्येक शब्द से सीधे जुड़ा होता है। यदि आपके पास "travel" (यात्रा) के लिए एक शब्द है, "traveler" (यात्री) के लिए एक शब्द है, और "traveling" (यात्रा करना) के लिए एक शब्द है, तो सिद्धांत बताता है कि वे सभी एक पूर्ण त्रिकोण में समान रूप से जुड़े हुए हैं। हालाँकि, GLeMM के डेटा से पता चलता है कि यह शायद ही कभी होता है। विशाल डेटासेट में, अधिकांश शब्द परिवार पूर्ण जाल नहीं हैं। इसके बजाय, वे एक केंद्रीय केंद्र (hub) और उससे निकलने वाली तीलियों (spokes) की तरह दिखते हैं, जहाँ नए शब्द एक मुख्य मूल से निकलते हैं लेकिन आवश्यक रूप से एक-दूसरे से वापस नहीं जुड़ते हैं। शोधकर्ताओं ने पाया कि केवल एक बहुत छोटा हिस्सा ही इन पूर्ण त्रिकोणों को बनाता है। वास्तव में, शब्दों के हर 100 जोड़ों के लिए जो सैद्धांतिक रूप से एक त्रिकोण बना सकते हैं, केवल कुछ ही ऐसा करते हैं। यह सुझाव देता है कि जिस तरह से हम शब्द बनाते हैं, वह पहले की तुलना में अधिक दिशात्मक और पदानुक्रमित (hierarchical) है, जिसमें एक आधार शब्द से उसके व्युत्पन्न शब्दों की ओर एक स्पष्ट प्रवाह होता है, न कि आपसी कनेक्शनों का एक अराजक जाल।

अध्ययन ने इस बात पर भी प्रकाश डाला कि विभिन्न भाषाएँ एक ही अवधारणा को कैसे संभालती हैं। जबकि अध्ययन की सभी सात भाषाएँ नए शब्द बनाती हैं, वे इसे अलग-अलग उपकरणों और आवृत्तियों के साथ करती हैं। उदाहरण के लिए, शोधकर्ताओं ने "कुछ फिर से करने" के विचार को व्यक्त करने के तरीके पर नज़र डाली। फ्रेंच में, उन्होंने एक विशिष्ट पैटर्न पाया जहाँ एक क्रिया को उलटने के लिए एक उपसर्ग जोड़ा जाता है, जिससे मूल शब्द के समान शब्दों का एक पूरा परिवार बन जाता है। अंग्रेजी में, समान पैटर्न मौजूद हैं लेकिन वे कम एकरूप हैं। डेटासेट ने दिखाया कि जबकि शब्द निर्माण का अंतर्निहित तर्क साझा है, विशिष्ट नियम काफी भिन्न हैं। एक भाषा एक नया शब्द बनाने के लिए दो मौजूदा शब्दों को जोड़ने को प्राथमिकता दे सकती है, जबकि दूसरी भाषा एक एकल शब्द में एक छोटा सा अंत (ending) जोड़ने को प्राथमिकता देती है। शोधकर्ताओं ने यह भी खोजा कि कुछ शब्द निर्माण "उल्टे" होते हैं। कभी-कभी, एक छोटा शब्द एक लंबे शब्द से व्युत्पन्न होता है, भले ही वह छोटा शब्द मूल दिखना चाहिए। डेटा ने इन रिवर्स पैटर्न की पहचान करने में मदद की क्योंकि वे मानक दिशा की तुलना में बहुत कम बार होते हैं, जिससे शोधकर्ता उन्हें नियम के अपवाद के रूप में पहचान सके।

परियोजना के विशाल पैमाने के बावजूद, शोधकर्ता सावधानी बरतते हुए कहते हैं कि उनका संसाधन पूर्ण नहीं है। चूंकि डेटा स्वचालित रूप से एक सार्वजनिक शब्दकोश से एकत्र किया गया था, इसलिए इसमें कुछ त्रुटियाँ और विसंगतियाँ हैं। कुछ शब्द जोड़े जो संबंधित दिखते हैं वे शायद नहीं हैं, और कुछ परिभाषाएँ थोड़ी गलत हो सकती हैं। हालाँकि, संग्रह का विशाल आकार यह सुनिश्चित करता है कि ये त्रुटियाँ इतनी दुर्लभ हैं कि वे बड़े चित्र को विकृत नहीं करती हैं। शोधकर्ता अनुमान लगाते हैं कि शब्द जोड़ों की सटीकता बहुत अधिक है, जिसमें अंग्रेजी और फ्रेंच अनुभागों में 90 प्रतिशत से अधिक कनेक्शन सही हैं। यह संसाधन आगे की जांच के लिए एक शुरुआती बिंदु के रूप में डिज़ाइन किया गया है, एक ऐसी जगह जहाँ अन्य वैज्ञानिक वास्तविक दुनिया के विशाल डेटा के विरुद्ध अपने स्वयं के सिद्धांतों का परीक्षण कर सकते हैं। यह भाषा के रहस्य का अंतिम उत्तर नहीं है, बल्कि एक शक्तिशाली नया उपकरण है जो हमें शब्द निर्माण के परिदृश्य को उस स्पष्टता के साथ देखने की अनुमति देता है जो पहले असंभव थी।

GLeMM का निर्माण भाषा के अध्ययन के तरीके में एक बदलाव का प्रतिनिधित्व करता है, जो छोटे, क्यूरेटेड उदाहरणों से हटकर विशाल, डेटा-संचालित अन्वेषण की ओर बढ़ता है। लाखों संबंधों के एक जीवित संग्रह के रूप में शब्दकोश को मानकर, शोधकर्ताओं ने मानव भाषण की छिपी हुई वास्तुकला में एक खिड़की खोल दी है। उन्होंने दिखाया है कि जबकि भाषाएँ विविध हैं, वे कुछ संरचनात्मक सिद्धांतों का पालन करती हैं जिन्हें मापा और देखा जा सकता है। निष्कर्ष बताते हैं कि जिस तरह से हम शब्द बनाते हैं, वह आदतों का एक यादृच्छिक संग्रह नहीं है, बल्कि स्पष्ट पैटर्न, अपवादों और एक विशिष्ट दिशा के साथ एक संरचित प्रणाली है। जैसे-जैसे शोधकर्ता अधिक भाषाओं को शामिल करने और अपनी विधियों को परिष्कृत करने के लिए इस कार्य का विस्तार करने की योजना बना रहे हैं, यह संसाधन मानव मन की ध्वनि से अर्थ बनाने की क्षमता की गहरी समझ प्रदान करने का वादा करता है। यह हमें याद दिलाता है कि हमारे द्वारा बोला जाने वाला प्रत्येक नया शब्द एक विशाल, परस्पर जुड़ी हुई इतिहास का हिस्सा है, और अब, पहली बार, हमारे पास एक ऐसा मानचित्र है जो पूरे क्षेत्र को देखने के लिए पर्याप्त बड़ा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →