Yorùbá in Unicode: An Overview of a Problem
यह शोध पत्र यह तर्क देता है कि डिजिटल प्लेटफॉर्म पर योरूबा (Yorùbá) टेक्स्ट रेंडरिंग की निरंतर विफलता का मूल कारण मुख्य डायक्रिटिक संयोजनों के लिए यूनिकोड में प्रीकंपोज्ड कैरेक्टर्स (precomposed characters) का अभाव है, और यह अस्थिर संयोजी अनुक्रमों (combining sequences) पर निर्भरता के कारण होने वाली इन विसंगतियों को हल करने के लिए एक औपचारिक एन्कोडिंग अनुरोध का प्रस्ताव करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
भाषा केवल ध्वनियों का एक संग्रह मात्र नहीं है; लाखों लोगों के लिए, यह एक ऐसी प्रणाली है जहाँ आवाज़ का स्वर (पिच) किसी शब्द का अर्थ पूरी तरह से बदल देता है। योरूबा भाषा में, जो पश्चिम अफ्रीका और डायस्पोरा में 4 करोड़ से अधिक लोगों द्वारा बोली जाती है, एक ऊंचे स्वर और एक नीचे के स्वर के बीच का अंतर "हाथ" शब्द को "झाड़ू" या "सम्मान" में बदल सकता है। स्वर (टोन) पर यह निर्भरता कोई काव्य संबंधी सजावट नहीं बल्कि एक व्याकरणिक आवश्यकता है। सही स्वर चिह्नों के बिना, एक साधारण वाक्य दर्जनों संभावित अर्थों वाला एक भ्रमित करने वाला पहेली बन सकता है, जिससे पाठक यह अनुमान लगाने में रह जाते हैं कि पिता एक बड़े खेत के अंदर गए या एक बड़ी कार के। इसे हल करने के लिए, लेखक संकेतों (डाइक्रिटिक्स) की एक प्रणाली का उपयोग करते हैं—अक्षरों के ऊपर या नीचे रखे जाने वाले छोटे निशान—जो इन स्वर परिवर्तनों को दर्शाते हैं।
हालाँकि, डिजिटल दुनिया को इन जटिल चिह्नों को ध्यान में रखकर नहीं बनाया गया था। जब कंप्यूटर पहली बार आए, तो उन्हें अंग्रेजी वर्णमाला के मानक अक्षरों को संभालने के लिए डिज़ाइन किया गया था, न कि टोनल भाषाओं के लिए आवश्यक स्तरित (लेयर्ड) प्रतीकों के लिए। इसने एक निरंतर समस्या पैदा कर दी: जबकि तकनीक तकनीकी रूप से इन चिह्नों को प्रदर्शित कर सकती थी, लेकिन वह हमेशा उन्हें सही स्थान पर रखने या उन्हें सही ढंग से गिनने में सक्षम नहीं थी। एक अक्षर जिसमें स्वर चिह्न हो, वह एक स्क्रीन पर ठीक दिख सकता है लेकिन दूसरी स्क्रीन पर एक खाली बॉक्स या गलत स्थान पर स्थित प्रतीक में बदल सकता है। कोला टुबोसुन का यह शोध पत्र जांच करता है कि ऐसा क्यों होता है, जो योरूबा में लेखन के इतिहास से लेकर आज के कंप्यूटरों में टेक्स्ट को संग्रहीत करने के कठोर नियमों तक इस मुद्दे का पता लगाता है। लेखक का तर्क है कि वर्तमान प्रणाली टोनल भाषाओं के लिए मौलिक रूप से त्रुटिपूर्ण है और वह इसे ठीक करने के लिए एक विशिष्ट, संरचनात्मक परिवर्तन का प्रस्ताव करता है।
योरूबा लेखन की कहानी कंप्यूटर युग से बहुत पहले शुरू हुई थी। मूल रूप से एक मौखिक भाषा होने के नाते, इसे 19वीं शताब्दी में मिशनरियों और व्यापारियों द्वारा रोमन वर्णमाला का उपयोग करके पहली बार लिखा गया था। शुरुआती लेखकों को उन भाषाओं के लिए अंग्रेजी अक्षरों को अनुकूलित करने में संघर्ष करना पड़ा जहाँ स्वर (पिच) मायने रखता है। कुछ ने स्वर दिखाने के लिए अतिरिक्त अक्षरों का उपयोग करने की कोशिश की, जैसे कि "h" या "r" जोड़ना, जबकि अन्य ने स्वरों के ऊपर बिंदु या रेखाओं का उपयोग किया। समय के साथ, एक मानक प्रणाली उभरी जिसने कुछ स्वरों के नीचे बिंदुओं और स्वर दिखाने के लिए उनके ऊपर चिह्नों का उपयोग किया। मध्य-20वीं शताब्दी तक, यह प्रणाली अच्छी तरह से स्थापित हो गई थी, जिससे लेखकों के लिए उन शब्दों के बीच अंतर करना संभव हो गया जो दिखने में समान थे लेकिन सुनने में अलग थे। लेकिन जब डिजिटल युग आया, तो यह सावधानीपूर्वक तैयार की गई प्रणाली एक दीवार से टकरा गई।
समस्या का मूल कारण यह है कि कंप्यूटर टेक्स्ट को कैसे संग्रहीत करते हैं। टेक्स्ट को विभिन्न उपकरणों और प्रोग्रामों के बीच आसानी से भेजने के लिए, यूनिकोड कंसोर्टियम नामक एक वैश्विक संगठन ने पात्रों (कैरेक्टर्स) की एक मानक सूची बनाई। इस प्रणाली में, एक एकल चिह्न वाला अक्षर, जैसे कि एक एक्सेंट वाला "o", अक्सर एक एकल, पूर्व-निर्मित इकाई के रूप में संग्रहीत किया जाता है। यह कई भाषाओं के लिए अच्छा काम करता है। हालाँकि, योरूबा के लिए, इस प्रणाली को एक ही अक्षर पर दो अलग-अलग चिह्नों को जोड़ने की आवश्यकता होती है: स्वर के प्रकार को दिखाने के लिए नीचे एक बिंदु, और स्वर (पिच) दिखाने के लिए ऊपर एक चिह्न। वर्तमान डिजिटल मानक के पास इन स्टैक्ड संयोजनों के लिए कोई एकल, पूर्व-निर्मित कोड नहीं है। इसके बजाय, यह कंप्यूटर को दो अलग-अलग टुकड़ों को जोड़कर उन्हें बनाने के लिए मजबूर करता है: आधार अक्षर जिसमें बिंदु है, और फिर उसके ऊपर स्वर का चिह्न।
पात्रों को एक-एक करके बनाने की यह विधि ही परेशानी की शुरुआत करती है। जबकि यह एक कंप्यूटर पर काम कर सकता है, यदि टेक्स्ट को दूसरे प्लेटफॉर्म, दूसरे फॉन्ट या दूसरे देश में ले जाया जाता है, तो वे टुकड़े अलग हो सकते हैं या खिसक सकते हैं। एक लेखक एक नाम को पूरी तरह से टाइप कर सकता है, केवल यह देखने के लिए कि दस्तावेज़ को सहेजने या प्रिंट करने पर स्वर चिह्न गलत अक्षर पर कूद जाता है या पूरी तरह से गायब हो जाता है। लेखक दशकों के प्रकाशन के माध्यम से इस विफलता का दस्तावेजीकरण करते हैं, जिसमें ऐसे बुक कवर्स दिखाए गए हैं जहाँ टेक्स्ट प्रिंट होने के बाद स्वर चिह्नों को हाथ से बनाया गया था क्योंकि टाइपसेटिंग मशीनें उन्हें संभाल नहीं सकीं। डिजिटल पुस्तकालयों में, कैटलॉग करने वाले कभी-कभी गलत प्रतीकों का उपयोग करते हैं क्योंकि सही वाले उपलब्ध नहीं होते, जिससे शोधकर्ताओं के लिए वास्तविक शीर्षकों द्वारा पुस्तकों को खोजना असंभव हो जाता है। यहाँ तक कि सोशल मीडिया प्लेटफॉर्म भी, जो प्रत्येक वर्ण की गिनती करते हैं, इन स्टैक्ड चिह्नों को कई अलग-अलग पात्रों के रूप में मानते हैं, जिससे योरूबा टेक्स्ट लिखने की क्षमता अनैतिक रूप से सीमित हो जाती है।
यह शोध पत्र इन पात्रों को ठीक क्यों नहीं किया जा सकता है, इसके आधिकारिक स्पष्टीकरण को चुनौती देता है। यूनिकोड कंसोर्टियम का कहना है कि उनकी प्रणाली स्थिर है और पुराने सिस्टम में संग्रहीत टेक्स्ट की निरंतरता को तोड़ने के लिए नए पूर्व-निर्मित संयोजन जोड़ना हानिकारक होगा। उनका तर्क है कि टुकड़ों को संयोजित करने की वर्तमान विधि पर्याप्त है और समस्या खराब फॉन्ट्स या पुराने सॉफ्टवेयर से उत्पन्न होती है। लेखक इस बात का खंडन करते हुए, यह बताते हैं कि विफलताएं तब भी होती हैं जब टेक्स्ट को आधुनिक, उच्च-गुणवत्ता वाली प्रणालियों के बीच सही ढंग से एनकोड और स्थानांतरित किया जाता है। मुद्दा केवल यह नहीं है कि टेक्स्ट कैसा दिखता है, बल्कि यह है कि वह व्यवहार कैसे करता है: यह सही ढंग से खोजने में विफल रहता है, इसकी गिनती गलत होती है, और स्थानांतरण के दौरान यह दूषित हो जाता है। लेखक नोट करते हैं कि जबकि सिस्टम ने हाल के वर्षों में हजारों नए इमोजी के लिए जगह बनाई है, इसने अफ्रीकी टोनल भाषाओं की आवश्यक जरूरतों के लिए अपने नियमों को अपडेट करने से इनकार कर दिया है।
इसे हल करने के लिए, शोध पत्र एक सीधा और विशिष्ट हस्तक्षेप प्रस्तावित करता है: डिजिटल मानक में चार नए, पूर्व-निर्मित पात्रों का निर्माण। ये खुले "o" और "e" स्वरों के लिए एकल इकाइयाँ होंगी जिनमें नीचे एक बिंदु और ऊपर एक स्वर चिह्न दोनों होंगे। इससे टेक्स्ट एक एकल, अटूट इकाई के रूप में यात्रा कर सकेगा, यह सुनिश्चित करते हुए कि "हाथ" के लिए शब्द "हाथ" ही रहे चाहे उसे कहीं भी पढ़ा जाए। लेखक स्वीकार करते हैं कि विशेष कीबोर्ड और ऐसे सॉफ़्टवेयर जैसे वर्तमान उपकरण, जो स्वचालित रूप से स्वर चिह्न जोड़ते हैं, ने लेखन को आसान बना दिया है, लेकिन वे अस्थायी समाधान हैं। वे उस अंतर्निहित संरचनात्मक दोष को हल नहीं करते हैं जो टेक्स्ट के टूटने का कारण बनता है।
निष्कर्ष यह है कि समस्या लेखकों के प्रयास की कमी या व्यक्तिगत सॉफ़्टवेयर की विफलता नहीं है, बल्कि वैश्विक नियमों में एक अंतराल है जो डिजिटल संचार को नियंत्रित करता है। लेखक का तर्क है कि यूनिकोड कंसोर्टियम के पास इसे ठीक करने की तकनीकी क्षमता है और ऐसा करना आधुनिक दुनिया में भाषा के अस्तित्व और उचित उपयोग के लिए आवश्यक है। इन चार विशिष्ट पात्रों को बनाकर, डिजिटल दुनिया अंततः योरूबा का समर्थन उसी तरह कर सकेगी जैसे वह उन भाषाओं का समर्थन करती है जिन्हें स्टैक्ड चिह्नों की आवश्यकता नहीं होती। यह न केवल लाखों योरूबा बोलने वालों की मदद करेगा, बल्कि उन अन्य टोनल भाषाओं के लिए भी एक मिसाल कायम करेगा जो समान डिजिटल बाधाओं का सामना कर रही हैं। यह शोध पत्र संघर्ष के रिकॉर्ड और एक ऐसे समाधान के रोडमैप दोनों के रूप में कार्य करता है जो दशकों से प्रतीक्षा कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।