Wiktionary as a Crowdsourced Lexicon for English Dialects
यह शोध पत्र अंग्रेजी बोलियों के लिए एक नैतिक रूप से क्राउडसोर्स्ड लेक्सिकन (शब्दकोश) के रूप में विकीकोशनरी (Wiktionary) का मूल्यांकन करता है, जो वर्णनात्मक विश्लेषण और सोशल मीडिया डेटा के माध्यम से यह प्रदर्शित करता है कि यह क्षेत्रीय विविधताओं के लिए ओईडी (OED) जैसे पारंपरिक शब्दकोशों की कवरेज के बराबर या उससे अधिक है, साथ ही बोली-संवेदी भाषा संसाधनों में व्यापक चुनौतियों को भी रेखांकित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
भाषा एक एकल, ठोस ब्लॉक नहीं है; यह एक जीवंत परिदृश्य है जो इस बात पर बदलता और परिवर्तित होता है कि आप कहाँ खड़े हैं। एक शब्द जिसका लंदन में एक अर्थ हो सकता है, वह ऑकलैंड में पूरी तरह से अलग अर्थ रख सकता है, या मुम्बई में उसका अस्तित्व ही नहीं हो सकता। दशकों से, इन भाषाई क्षेत्रों का मानचित्र बनाने वाले लोग पारंपरिक शब्दकोशों पर निर्भर रहे हैं, जो विशेषज्ञों की उन टीमों द्वारा संकलित पुस्तकें हैं जो यह तय करने में वर्षों बिताते हैं कि कौन से शब्द शामिल करने के लिए पर्याप्त महत्वपूर्ण हैं। लेकिन भाषा की दुनिया किसी भी संपादकीय टीम की तुलना में कहीं अधिक तेजी से आगे बढ़ रही है, विशेष रूप से दुनिया भर में बोली जाने वाली अंग्रेजी की कई विविधताओं के लिए। जैसे-जैसे कंप्यूटर और आर्टिफिशियल इंटेलिजेंस (कृत्रिम बुद्धिमत्ता) अधिक सामान्य होते जा रहे हैं, उन्हें इन स्थानीय अंतरों को समझने के लिए सिखाने की बढ़ती आवश्यकता है। यदि एक कंप्यूटर न्यूजीलैंड के वाक्यांश और अमेरिकी वाक्यांश के बीच अंतर नहीं कर सकता, तो वह इसका उपयोग करने वाले लोगों को समझने में विफल रहेगा। यह तकनीक में निष्पक्षता के लिए एक समस्या पैदा करता है, क्योंकि केवल मानक अंग्रेजी पर आधारित सिस्टम अक्सर लोगों के बोलने के समृद्ध, विविध तरीकों के साथ संघर्ष करते हैं।
इसे हल करने के लिए, शोधकर्ता भाषा डेटा एकत्र करने के नए तरीके खोज रहे हैं जो विशाल और अद्यतित (अप-टू-डेट) दोनों हो। एक आशाजनक स्रोत विकिपीडिया (Wiktionary) है, जो एक मुफ्त, ऑनलाइन शब्दकोश है जिसे कोई भी संपादित कर सकता है। पारंपरिक पुस्तकों के विपरीत, जो भुगतान प्राप्त विशेषज्ञों के एक छोटे समूह द्वारा लिखी जाती हैं, विकिपीडिया एक क्राउडसोर्स्ड (जन-सहयोग आधारित) परियोजना है जहाँ दुनिया भर के स्वयंसेवक प्रविष्टियाँ, परिभाषाएँ और उदाहरण जोड़ते हैं। शोधकर्ताओं ने जो प्रश्न पूछा वह सरल लेकिन कठिन था: क्या यह खुला, समुदाय-निर्मित शब्दकोश अंग्रेजी की कई बोलियों के लिए एक विश्वसनीय मानचित्र के रूप में कार्य कर सकता है? विशेष रूप से, वे जानना चाहते थे कि क्या विकिपीडिया प्रसिद्ध ऑक्सफोर्ड इंग्लिश डिक्शनरी की तरह क्षेत्रीय शब्दों को कवर करता है, और क्या वहां पाए जाने वाले शब्द वास्तव में सोशल मीडिया पर लोगों की वास्तविक बातचीत में दिखाई देते हैं।
शोधकर्ताओं ने बारह अलग-अलग राष्ट्रीय अंग्रेजी विविधताओं के लिए विकिपीडिया की सामग्री की तुलना ऑक्सफोर्ड इंग्लिश डिक्शनरी के साथ करना शुरू किया, जिसमें ब्रिटिश और अमेरिकी अंग्रेजी जैसी प्रसिद्ध किस्मों से लेकर भारत, केन्या और फिलीपींस की किस्में शामिल थीं। उन्होंने पाया कि जबकि पारंपरिक शब्दकोश अभी भी मानक अमेरिकी और ब्रिटिश अंग्रेजी के आकार के मामले में थोड़ा बढ़त बनाए रखता है, विकिपीडिया वास्तव में कई अन्य क्षेत्रों के लिए अधिक क्षेत्र कवर करता है। कनाडाई, आयरिश और ऑस्ट्रेलियाई अंग्रेजी जैसी विविधताओं के लिए, विकिपीडिया में पारंपरिक शब्दकोश की तुलना में काफी अधिक प्रविष्टियाँ थीं। गैर-पारंपरिक "इनर सर्कल" के अंग्रेजी बोलने वाले देशों के लिए यह अंतर और भी चौंकाने वाला था। जहाँ पारंपरिक शब्दकोश के पास केन्याई या पाकिस्तानी अंग्रेजी के लिए एक भी प्रविष्टि नहीं थी, वहीं विकिपीडिया के पास इन विविधताओं के लिए सैकड़ों प्रविष्टियाँ थीं। यह सुझाव देता है कि समुदाय-संचालित मॉडल उन शब्दों को पकड़ने में उल्लेखनीय रूप से सक्षम है जिन्हें पेशेवर संपादक शायद अनदेखा कर दें या जिन्हें शामिल करने के लिए उनके पास अभी समय न हो।
यह परीक्षण करने के लिए कि ये शब्द वास्तव में वास्तविक दुनिया में उपयोग किए जा रहे थे या नहीं, टीम ने सोशल मीडिया का सहारा लिया। उन्होंने रेडिट (Reddit), जो एक लोकप्रिय ऑनलाइन फोरम है, के देश-विशिष्ट समुदायों से लाखों पोस्ट और टिप्पणियों का अध्ययन किया। उन्होंने इन डिजिटल समुदायों को भौगोलिक स्थान के प्रतिनिधि (प्रॉक्सी) के रूप में माना, यह मानकर कि न्यूजीलैंड के समुदाय में पोस्ट करने वाले लोग संभवतः न्यूजीलैंड की अंग्रेजी का उपयोग कर रहे हैं। इसके बाद उन्होंने यह जांचा कि क्या प्रत्येक देश के लिए विकिपीडिया में सूचीबद्ध शब्द संबंधित ऑनलाइन समुदाय में बार-बार दिखाई देते हैं। परिणामों ने एक मजबूत संबंध दिखाया। जब उन्होंने मुख्य पोस्ट को देखा जो लोग लिखते थे, तो विकिपीडिया में पाए जाने वाले शब्द ठीक वहीं दिखाई दिए जहाँ उनकी अपेक्षा की गई थी। उदाहरण के लिए, न्यूजीलैंड के विशिष्ट शब्द न्यूजीलैंड के समुदाय में सबसे अधिक बार दिखाई दिए, और भारत के शब्द भारतीय समुदाय में सबसे अधिक बार दिखाई दिए। यह संरेखण बताता है कि विकिपीडिया केवल शब्दों की सूची नहीं है, बल्कि यह वास्तव में इस बात का प्रतिबिंब है कि लोग अपने दैनिक डिजिटल जीवन में कैसे बोलते हैं।
हालाँकि, अध्ययन ने यह भी प्रकट किया कि पाठ (टेक्स्ट) का प्रकार बहुत मायने रखता है। मुख्य पोस्ट को देखते समय शब्दकोश और सोशल मीडिया डेटा के बीच संबंध बहुत मजबूत था, लेकिन प्रतिक्रिया में लोग जो टिप्पणियाँ छोड़ते थे, उन्हें देखते समय यह बहुत कमजोर हो गया। कमेंट सेक्शन में, भाषा अधिक संवादात्मक थी और अक्सर अन्य भाषाओं के साथ मिश्रित थी। उदाहरण के लिए, न्यूजीलैंड के समुदाय में, कुछ शब्द जो न्यूजीलैंड की अंग्रेजी लग रहे थे, वास्तव में टैगालोग (Tagalog), जो फिलीपींस की भाषा है, के सामान्य शब्द निकले, क्योंकि दोनों भाषाओं में कुछ समान वर्तनी (स्पेलिंग) साझा है। इसने एक चुनौती को उजागर किया: जबकि शब्दकोश उपयोगी है, तेज-तर्रार, संवादात्मक बातचीत में भाषा का उपयोग बहुत अव्यवस्थित और कई कारकों से प्रभावित हो सकता है। शोधकर्ताओं ने पाया कि शब्दकोश तब सबसे अच्छा काम करता है जब पाठ अधिक औपचारिक या संरचित होता है, जैसे कि एक मुख्य पोस्ट, न कि एक कमेंट थ्रेड की त्वरित बातचीत में।
अध्ययन ने शब्दों के निर्माण के तरीके पर भी बारीकी से नज़र डाली। उन्होंने न्यूजीलैंड की अंग्रेजी के लिए विकिपीडिया में पाए जाने वाले नए शब्दों के प्रकारों की पारंपरिक शब्दकोश के साथ तुलना की। उन्होंने इन शब्दों को बनाने के पैटर्न में बहुत उच्च स्तर की सहमति पाई, जैसे कि दो शब्दों को एक साथ जोड़ना या किसी शब्द के अर्थ को थोड़ा बदलना। यह सुझाव देता है कि भले ही विकिपीडिया स्वयंसेवकों द्वारा लिखा गया है, शब्दों को बनाने का तरीका पेशेवर भाषाविदों के समान तार्किक नियमों का पालन करता है। शोधकर्ताओं ने नोट किया कि विकिपीडिया मुहावरों और लोकोक्तियों (idioms)—शब्दों के ऐसे समूह जिनका एक विशिष्ट अर्थ होता है—को शामिल करने में विशेष रूप से अच्छा था, जो अक्सर पारंपरिक शब्दकोशों में गायब होते हैं। यह क्राउडसोर्स्ड संसाधन को भाषा के रंगीन, अभिव्यंजक पक्ष को समझने के लिए विशेष रूप से मूल्यवान बनाता है जिसे औपचारिक पुस्तकें कभी-कभी छोड़ देती हैं।
अंततः, यह शोध पत्र निष्कर्ष निकालता है कि विकिपीडिया अंग्रेजी बोलियों को समझने के लिए एक शक्तिशाली और व्यवहार्य उपकरण है, विशेष रूप से उन क्षेत्रों के लिए जो ऐतिहासिक रूप रूप से भाषा तकनीक में कम प्रतिनिधित्व वाले रहे हैं। यह पेशेवर शब्दकोशों की आवश्यकता को प्रतिस्थापित नहीं करता है, बल्कि यह उन्हें एक तेज़, अधिक समावेशी और अधिक अद्यतित दृष्टिकोण प्रदान करके पूरक बनाता है कि भाषा कैसे विकसित हो रही है। शोधकर्ता चेतावनी देते हैं कि इस डेटा का उपयोग करने के लिए सावधानी की आवश्यकता है, विशेष रूप से ऑनलाइन बातचीत के मामले में जहाँ विभिन्न भाषाएँ मिल सकती हैं या जहाँ संदर्भ शब्द के अर्थ को बदल देता है। लेकिन निष्पक्ष और सटीक भाषा उपकरण बनाने के लक्ष्य के लिए, जो केवल बहुमत के लिए नहीं बल्कि सभी के लिए काम करें, यह खुला, समुदाय-निर्मित शब्दकोश एक महत्वपूर्ण कड़ी प्रदान करता है। यह दिखाता है कि जब लोग अपनी भाषा को दस्तावेजीकृत करने के लिए एक साथ आते हैं, तो वे एक ऐसा संसाधन बनाते हैं जो गहराई से सटीक और उल्लेखनीय रूप से व्यापक होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।