← नवीनतम पेपर
💻 computer science

Open Sign Bibles (OSB): An Open-Access Multilingual Sign Language Bibles Dataset

यह शोध पत्र ओपन साइन बाइबल्स (OSB) को प्रस्तुत करता है, जो अपने प्रकार का सबसे बड़ा कानूनी रूप से बाधा रहित बहुभाषी डेटासेट है, जिसमें मल्टीमॉडल रिट्रीवल और कंट्रास्टिव लर्निंग अनुसंधान को सुगम बनाने के लिए 20 सांकेतिक भाषाओं में 700 घंटों से अधिक के ओपन लाइसेंस प्राप्त बाइबिल वीडियो शामिल हैं, जो 800 से अधिक बोली जाने वाली भाषाओं के समानांतर टेक्स्ट के साथ संरेखित हैं।

मूल लेखक: Colin Leong, Joshua Nemecek, Kavitha Raju, Joel Mathew, Vijayan Asari, Elisabeth Leong

प्रकाशित 2026-08-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Colin Leong, Joshua Nemecek, Kavitha Raju, Joel Mathew, Vijayan Asari, Elisabeth Leong

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

भाषा वह प्राथमिक उपकरण है जिसका उपयोग मनुष्य विचारों को साझा करने, कहानियाँ सुनाने और इतिहास को आगे बढ़ाने के लिए करते हैं। दुनिया के अधिकांश लोगों के लिए, यह ध्वनि और भाषण के माध्यम से होता है। लेकिन लाखों बधिर (Deaf) लोगों के लिए, भाषा दृश्य है, जो हाथों की गति, चेहरे के भाव और शरीर की स्थिति से बनती है। ये सांकेतिक भाषाएँ (sign languages) हैं, जो अपने स्वयं के व्याकरण और संस्कृति वाली विशिष्ट और जटिल प्रणालियाँ हैं। फिर भी, डिजिटल युग में, इन भाषाओं को पीछे छोड़ दिया गया है। जहाँ कंप्यूटर लिखित पाठ को आसानी से खोज सकते हैं या बोले गए शब्दों को समझ सकते हैं, वहीं वे सांकेतिक भाषा को "पढ़ने" में संघर्ष करते हैं। एक लंबे वीडियो के भीतर एक विशिष्ट संकेत (sign) को खोजने के लिए, या एक संकेत को लिखित वाक्य से जोड़ने के लिए आवश्यक तकनीक बनाना कठिन रहा है क्योंकि इसके लिए पर्याप्त डेटा उपलब्ध नहीं था। मौजूदा साइन लैंग्वेज वीडियो के अधिकांश संग्रह या तो बहुत छोटे हैं, पे-वॉल (paywalls) के पीछे बंद हैं, या कॉपीराइट द्वारा प्रतिबंधित हैं, जिससे शोधकर्ताओं के पास मशीनों को सांकेकरों की दृश्य दुनिया को समझने के लिए प्रशिक्षित करने हेतु आवश्यक कच्चा माल उपलब्ध नहीं हो पा रहा है।

शोधकर्ताओं की एक टीम ने अब एक विशाल नए संसाधन को जारी किया है जिसे इस बदलाव के लिए डिज़ाइन किया गया है: 'ओपन साइन बाइबल्स' (Open Sign Bibles) डेटासेट। यह संग्रह 20 विभिन्न सांकेतिक भाषाओं में पेशेवर रूप से अनुवादित बाइबिल वीडियो के 700 घंटों से अधिक को एक साथ लाता है। पिछले डेटासेट्स के विपरीत, जो इंटरनेट पर बिखरे हुए थे या उपयोग के लिए विशेष अनुमति की आवश्यकता थी, यह संपूर्ण लाइब्रेरी डाउनलोड करने और अध्ययन करने के लिए किसी के लिए भी स्वतंत्र रूप से उपलब्ध है। यह परियोजना इन वीडियो को 800 से अधिक बोली जाने वाली भाषाओं में बाइबिल के पाठ से जोड़ती है, जो दृश्य और लिखित के बीच एक सेतु बनाती है। उदाहरण के लिए, अमेरिकन साइन लैंग्वेज में एक सांकेतक के वीडियो को अंग्रेजी, स्पेनिश या हिंदी में लिखे गए उसी वृत्तांत से जोड़कर, शोधकर्ताओं ने कंप्यूटर को एक संकेत और उसके अर्थ के बीच के संबंध को समझने के लिए प्रशिक्षित करने हेतु एक शक्तिशाली उपकरण बनाया है।

यह डेटासेट दो मुख्य स्रोतों से बना है। पहला स्रोत 'डिजिटल बाइबल लाइब्रेरी' से आता है, जिसने विभिन्न पृष्ठभूमियों के सांकेतकों वाले हजारों वीडियो प्रदान किए हैं, जिनमें अक्सर स्क्रीन पर ग्राफिक्स या टेक्स्ट भी होता है। दूसरा स्रोत भारत के कच्चे स्टूडियो रिकॉर्डिंग का एक सेट है, जिसमें एक सादे बैकग्राउंड के सामने एक अकेला सांकेतक दिखाई देता है। कुल मिलाकर, इस संग्रह में 8,000 से अधिक व्यक्तिगत वीडियो क्लिप शामिल हैं। इस डेटा को कंप्यूटर के लिए उपयोगी बनाने के लिए, टीम ने इसे केवल ऑनलाइन नहीं डाला; उन्होंने इसे सावधानीपूर्वक व्यवस्थित किया। उन्होंने प्रत्येक वीडियो को बाइबिल के विशिष्ट छंदों (verses) से जोड़ा, जिससे कंप्यूटर को यह पता चल सके कि कौन सी कहानी सुनाई जा रही है। वीडियो के एक छोटे हिस्से के लिए, वे और भी आगे गए, और मैन्युअल रूप से उन सटीक क्षणों को चिह्नित किया जब विशिष्ट संकेत, जैसे कि "ईश्वर" (God) या "दिन" (day), स्क्रीन पर दिखाई देते हैं। विवरण का यह स्तर एक साधारण वीडियो संग्रह को एक संरचित शिक्षण उपकरण में बदल देता है।

शोधकर्ताओं ने इस नए डेटासेट का उपयोग यह परीक्षण करने के लिए किया कि वर्तमान तकनीक इन लंबे वीडियो के भीतर विशिष्ट संकेतों को खोजने में कितनी सक्षम है, जिसे "साइन स्पॉटिंग" (sign spotting) कहा जाता है। उन्होंने दो अलग-अलग दृष्टिकोणों का परीक्षण किया। पहले तरीके ने वीडियो में सांकेतक के हाथों और शरीर के बीच की भौतिक दूरी को मापने पर भरोसा किया, और उनकी तुलना ज्ञात उदाहरणों से की। यह दृष्टिकोण ठीक से काम नहीं कर सका; कंप्यूटर निरंतर गति के प्रवाह से भ्रमित हो गया और व्यक्तिगत संकेतों को विश्वसनीय रूप से नहीं चुन सका। दूसरे तरीके ने एक अधिक उन्नत प्रणाली का उपयोग किया जो केवल एक आकार के बजाय एक अवधारणा को पहचानने की तरह, गतिविधियों के पीछे के अर्थ को समझने के लिए सीखी। इस दृष्टिकोण ने आशा दिखाई। इसने "दिन" या "लोग" जैसे कुछ संकेतों को उच्च सटीकता के साथ सफलतापूर्वक पहचाना। हालाँकि, यह अन्य संकेतों के साथ संघर्ष करता रहा। यह कभी-कभी उन संकेतों के बीच भ्रमित हो गया जो दिखने में समान थे, जैसे कि "पुरुष" (man) और "ईश्वर" (god), भले ही उनके अर्थ बहुत भिन्न हों। यह उन संकेतों को पहचानने में भी विफल रहा जो देखे गए उदाहरणों से भिन्न तरीके से किए गए थे, जैसे कि एक बाएं हाथ के सांकेतक द्वारा या एक विशिष्ट सांस्कृतिक संदर्भ में उपयोग किया गया संकेत जो मानक शब्दकोश परिभाषा से भिन्न था।

परिणाम इस तकनीक की क्षमता और वर्तमान सीमाओं दोनों को उजागर करते हैं। यह प्रणाली तब सबसे अच्छा काम करती है जब विश्लेषण किया जा रहा वीडियो उन उदाहरणों के बहुत समान दिखता है जिन पर इसे प्रशिक्षित किया गया था। जब सांकेतक तेजी से चलता था, अलग हाथ का उपयोग करता था, या किसी शब्द को अद्वितीय अर्थ के साथ संकेत देता था, तो कंप्यूटर अक्सर चूक जाता था। शोधकर्ताओं ने पाया कि जबकि तकनीक कुछ सामान्य संकेतों को विश्वसनीय रूप से पहचान सकती है, यह अभी तक एक निरंतर बातचीत की पूरी जटिलता को समझने के लिए तैयार नहीं है। हालाँकि, डेटासेट स्वयं एक महत्वपूर्ण कदम है। एक बड़े, खुले और कानूनी रूप से स्पष्ट बहुभाषी सांकेतिक भाषा वीडियो का संग्रह प्रदान करके, शोधकर्ताओं ने वैज्ञानिक समुदाय को एक ठोस आधार दिया है। उन्होंने दिखाया है कि सही डेटा के साथ, कंप्यूटर बधिरों की दृश्य भाषा को सीखना शुरू कर सकते हैं, लेकिन उन्होंने यह भी स्पष्ट किया कि मानवीय अभिव्यक्ति की बारीकियों को संभालने के लिए बहुत अधिक काम करने की आवश्यकता है। आगे का मार्ग अधिक विविध उदाहरण एकत्र करने और उन सूक्ष्म अंतरों को बेहतर ढंग से समझने के लिए उपकरणों को परिष्कृत करने में निहित है जो दिखने में समान हैं लेकिन जिनका अर्थ अलग-अलग होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →