← नवीनतम पेपर
💻 computer science

Design-Based Study of an Invisible Field Tool for Endangered Languages

यह डिज़ाइन-आधार-रिसर्च अध्ययन मोज़िला कॉमन वॉयस प्लेटफॉर्म के लिए एक एक्सेल-वीबीए (Excel-VBA) सत्यापन टूल के विकास और क्षेत्र परीक्षण का विवरण देता है, जो यह प्रदर्शित करता है कि कैसे तकनीकी विशेषताओं के बजाय सामुदायिक ऑर्थोग्राफी (लेखन पद्धति) प्राथमिकताओं को प्राथमिकता देने वाले पुनरावृत्तीय डिज़ाइन सुधार, लुप्तप्राय सर्केशियन भाषा परियोजनाओं में डेटा गुणवत्ता और प्रतिभागी स्थिरता को बढ़ा सकते हैं।

मूल लेखक: Mehmet Uğur Nemlioğlu

प्रकाशित 2026-09-21
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mehmet Uğur Nemlioğlu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मानव संचार के विशाल परिदृश्य में, कुछ भाषाएँ लाखों लोगों द्वारा बोली जाती हैं, जबकि अन्य केवल कुछ हज़ार लोगों द्वारा बोली जाने वाली एक धागे की तरह लटकी रहती हैं, जो दुनिया भर में बिखरे हुए हैं। जब कोई भाषा इस तरह के खतरे का सामना करती है, तो इसे बचाने की लड़ाई अक्सर डिजिटल दुनिया में चली जाती है। इस उद्देश्य के लिए सबसे शक्तिशाली उपकरणों में से एक एक विशाल, वैश्विक परियोजना है जहाँ स्वयंसेवक वाक्यों को ज़ोर से पढ़ते हुए खुद को रिकॉर्ड करते हैं। इन रिकॉर्डिंग का उपयोग कंप्यूटर को मानव भाषण समझने के लिए सिखाने के लिए किया जाता है, जिसे स्पीच रिकग्निशन (वाक् पहचान) नामक तकनीक कहा जाता है। ऐसी परियोजना में शामिल होने के लिए, किसी भाषा को इन रिकॉर्डिंग के एक विशाल संग्रह की आवश्यकता होती है, लेकिन उन्हें इकट्ठा करना कठिन है जब बोलने वाले कम हों, कई अलग-अलग देशों में रहते हों, और शायद जटिल कंप्यूटर सॉफ़्टवेयर के साथ सहज न हों। चुनौती केवल बोलने वाले लोगों को खोजने की नहीं है, बल्कि यह सुनिश्चित करने की भी है कि वे जो पाठ पढ़ रहे हैं वह सही ढंग से लिखा गया है, जो एक ऐसा कार्य बन जाता है जो अविश्वसनीय रूप से कठिन है जब एक भाषा एक अद्वितीय वर्णमाला का उपयोग करती है जिसे मानक कंप्यूटर कीबोर्ड आसानी से सहारा नहीं देते।

यह कहानी है कि कैसे एक शोधकर्ता ने दो लुप्तप्राय भाषाओं, अडिघे (Adyghe) और कबरडियन (Kabardian) के लिए इस समस्या का समाधान किया, जो रूस, तुर्की और मध्य पूर्व के सर्कसियन समुदायों द्वारा बोली जाती हैं। ये भाषाएँ एक गहरा इतिहास साझा करती हैं लेकिन दशकों पहले सिरिलिक वर्णमाला का उपयोग करके दो अलग-अलग लिखित रूपों में मानकीकृत की गई थीं। आज, उनके बोलने वाले बिखरे हुए हैं, और कई को कंप्यूटर पर उन्हें सही ढंग से लिखने के लिए आवश्यक विशिष्ट वर्णों के साथ संघर्ष करना पड़ता है। मेहमत उगर नेमलियोग्लू (Mehmet Uğur Nemlioğlu) नामक एक शोधकर्ता ने समुदाय की अपनी भाषा को संरक्षित करने की इच्छा और एक वैश्विक डिजिटल मंच की तकनीकी मांगों के बीच एक सेतु बनाने का संकल्प लिया। उन्होंने एक नई वेबसाइट या एक जटिल आर्टिफिशियल इंटेलिजेंस सिस्टम नहीं बनाया। इसके बजाय, उन्होंने एक सरल, अदृश्य उपकरण बनाया जो एक सामान्य स्प्रेडशीट प्रोग्राम के भीतर रहता है, जिसे टेक्स्ट को साफ करने, त्रुटियों को ठीक करने और डेटा को व्यवस्थित करने के लिए डिज़ाइन किया गया है ताकि साधारण स्वयंसेवक बिना कंप्यूटर विशेषज्ञ बने योगदान दे सकें।

यात्रा एक निराशाजनक वास्तविकता के साथ शुरू हुई। इस टूल के अस्तित्व में आने से पहले, रिकॉर्डिंग प्लेटफॉर्म के लिए वाक्यों को तैयार करने की प्रक्रिया धीमी और गलतियों से भरी थी। स्वयंसेवक साझा दस्तावेजों में वाक्य टाइप करते थे, लेकिन इन दस्तावेजों में अक्सर छिपी हुई त्रुटियाँ होती थीं। सबसे आम गलती सिरिलिक वर्णमाला के एक विशिष्ट अक्षर से जुड़ी थी जो एक ऊर्ध्वाधर पट्टी (vertical bar) जैसा दिखता है, जिसका उपयोग गले में एक तीखी रुकावट को चिह्नित करने के लिए किया जाता है। क्योंकि मानक कीबोर्ड में यह कुंजी नहीं होती है, लोग अक्सर गलती से एक नियमित लैटिन अक्षर "I" या संख्या "1" टाइप कर देते थे। ये छोटी त्रुटियाँ वाक्यों को उन कंप्यूटरों के लिए अनुपयोगी बना देती थीं जो भाषा सीखने की कोशिश कर रहे थे। इसके अलावा, इन त्रुटियों की जाँच करने की प्रक्रिया के लिए उन्नत तकनीकी कौशल वाले व्यक्ति की आवश्यकता होती थी जो जटिल कमांड-लाइन प्रोग्राम चला सके, जो एक ऐसी बाधा थी जिसने कई समुदाय के सदस्यों को मदद करने से रोक दिया। वाक्य दिनों या हफ्तों तक अधर में लटके रहते थे, एक विशेषज्ञ के ठीक करने की प्रतीक्षा करते थे, जिससे अक्सर स्वयंसेवकों की रुचि कम हो जाती थी और वे योगदान देना बंद कर देते थे।

इसे हल करने के लिए, शोधकर्ता ने एक ऐसा टूल विकसित किया जो एक स्प्रेडशीट के भीतर काम करता है, एक ऐसा प्रोग्राम जिसे लगभग हर कोई उपयोग करना जानता है। उन्होंने इसे टुकड़ों में बनाया, समुदाय के साथ परीक्षण किया और जैसे-जैसे समस्याएँ सामने आईं उन्हें ठीक किया। यह टूल एक शांत संपादक की तरह कार्य करता है। जब एक स्वयंसेवक स्प्रेडशीट में वाक्यों की एक सूची पेस्ट करता है, तो टूल तुरंत हर पंक्ति को स्कैन करता है। यह गलत वर्णों को ढूंढता है और उन्हें सही वर्णों से बदल देता है। यह जाँचता है कि विराम चिह्न सही स्थान पर हैं या नहीं और क्या वाक्य बहुत लंबे हैं। यह वाक्यों को इस आधार पर अलग-अलग फोल्डरों में भी वर्गीकृत करता है कि वे भाषा के किस संस्करण से संबंधित हैं, जैसे कि तुर्की में बोली जाने वाली भाषा का संस्करण या रूस में बोली जाने वाली भाषा का संस्करण। यह छँटाई महत्वपूर्ण है क्योंकि दोनों भाषाओं के अलग-अलग बोलियाँ हैं, और रिकॉर्डिंग को उपयोगी बनाने के लिए अलग रखा जाना आवश्यक है। एक बार जब टूल अपना काम पूरा कर लेता है, तो यह मिनटों में वैश्विक मंच पर अपलोड करने के लिए तैयार स्वच्छ फाइलें तैयार करता है, एक ऐसा कार्य जिसे पहले करने में कई दिन लग जाते थे।

इस दृष्टिकोण के परिणाम तत्काल और महत्वपूर्ण थे। एक हजार वाक्यों के एक बैच को संसाधित करने में लगने वाला समय कई दिनों से घटकर लगभग बीस से पचास मिनट रह गया। इस गति परिवर्तन ने न केवल समय बचाया; इसने समुदाय के मिजाज को भी बदल दिया। स्वयंसेवक देख सकते थे कि उनका काम तैयारी से रिकॉर्डिंग कतार में लगभग तुरंत पहुँच रहा है, जिससे वे योगदान देने के लिए प्रेरित रहे। डेटा की गुणवत्ता में भी नाटकीय सुधार हुआ। टूल ने हजारों ऐसी त्रुटियों को पकड़ लिया जो अन्यथा छूट जातीं, यह सुनिश्चित करते हुए कि वैश्विक डेटाबेस में अपलोड की गई रिकॉर्डिंग स्वच्छ और सटीक हों। शोधकर्ता ने देखा कि टूल दैनिक कार्यप्रवाह में इतना एकीकृत हो गया कि यह उपयोगकर्ताओं के लिए अदृश्य सा महसूस होने लगा, जो बस देखते थे कि उनके वाक्य ठीक और व्यवस्थित हो रहे हैं बिना कभी इसके पीछे के कोड को समझे।

हालाँकि, अध्ययन ने एक आश्चर्यजनक मानवीय तत्व को भी उजागर किया जिसे अकेले तकनीक हल नहीं कर सकती थी। शोधकर्ता ने सिरिलिक टेक्स्ट को लैटिन वर्णमाला संस्करण में स्वचालित रूप से अनुवादित करने की एक सुविधा शामिल की थी, इस उम्मीद में कि इससे उन बोलने वालों की मदद मिलेगी जो पारंपरिक लिपि नहीं पढ़ सकते। उन्हें उम्मीद थी कि इससे परियोजना अधिक सुलभ हो जाएगी। इसके विपरीत, समुदाय ने इसका विरोध किया। कई बोलने वाले, यहाँ तक कि वे भी जो सिरिलिक लिपि के साथ संघर्ष कर रहे थे, अपनी पारंपरिक लेखन प्रणाली के प्रति गहरा लगाव महसूस करते थे। वे लैटिन रूपांतरित संस्करण के बजाय मूल लिपि में पढ़ना और रिकॉर्ड करना पसंद करते थे। इस प्रतिरोध ने दिखाया कि भाषा को बचाने के प्रयास में, समुदाय की अपनी पहचान और लेखन परंपराओं के बारे में भावनाएं तकनीकी सुविधा जितनी ही महत्वपूर्ण हैं। शोधकर्ता को इस फीडबैक को सुनना पड़ा और परियोजना को समायोजित करना पड़ा, जिससे "तकनीकी रूप से लचीले" लैटिन विकल्प के बजाय पारंपरिक लिपि को प्राथमिकता मिली।

इस परियोजना की सफलता कि कैसे लुप्तप्राय भाषाओं के लिए तकनीक बनाई जाती है, इसके बारे में सोचने का एक नया तरीका प्रदान करती है। यह सुझाव देती है कि सबसे प्रभावी उपकरण हमेशा सबसे जटिल नहीं होते, बल्कि वे होते हैं जो पृष्ठभूमि में गायब हो जाते हैं, जिससे लोग वह करने पर ध्यान केंद्रित कर सकें जिसमें वे सर्वश्रेष्ठ हैं: बोलना और अपनी संस्कृति को संरक्षित करना। शोधकर्ता ने पाया कि तकनीकी बाधाओं को हटाकर, वह स्वयंसेदारों के एक छोटे समूह को एक बड़ी टीम का काम करने के लिए सशक्त कर सकते थे। फिर भी, इस दृष्टिकोण के साथ एक चेतावनी भी आई। क्योंकि टूल बहुत सहज था, इसलिए टूल के भीतर सूक्ष्म त्रुटियों को पकड़ना आसान था। यह तभी हुआ जब शोधकर्ता ने टूल का उपयोग करना बंद किया और दुनिया के साथ साझा करने की तैयारी में कोड को ताज़ा नज़रों से देखा, तब उसे वे छोटी गलतियाँ मिलीं जो वर्षों से आँखों के सामने छिपी हुई थीं। इसने उन्हें सिखाया कि भले ही उपकरण अदृश्य हों, उन्हें समुदाय के लिए दृश्यमान होना चाहिए ताकि उनकी जाँच की जा सके और उन पर भरोसा किया जा सके।

अंततः, यह अध्ययन प्रदर्शित करता है कि डिजिटल युग में भाषा को बचाने के लिए तकनीक और मानवीय विश्वास के बीच साझेदारी की आवश्यकता होती है। टूल ने केवल एक प्रक्रिया को तेज़ नहीं किया; इसने स्वयंसेवकों और डेटा के बीच के संबंध को फिर से बनाया। काम को सुलभ बनाकर, शोधकर्ता ने एक बिखरे हुए समुदाय को जुड़ा हुआ और सक्षम महसूस कराया। निष्कर्ष पुष्टि करते हैं कि जब तकनीक को समुदाय की विशिष्ट आवश्यकताओं और भावनाओं को ध्यान में रखकर बनाया जाता है, तो यह संरक्षण के लिए एक शक्तिशाली बल बन सकती है। आगे का मार्ग इन सबक को अपनाने और टूल का एक वेब-आधारित संस्करण बनाने में निहित है जिसे कोई भी उपयोग कर सके, यह सुनिश्चित करते हुए कि इन भाषाओं को जीवित रखने का कार्य प्रारंभिक परियोजना समाप्त होने के बहुत बाद तक जारी रहे। अडिघे और कबरडियन की कहानी दिखाती है कि लुप्तप्राय भाषाओं का भविष्य केवल आवाज़ों को रिकॉर्ड करने में नहीं है, बल्कि उन आवाज़ों को सुने जाने के लिए सही स्थान बनाने में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →