← नवीनतम पेपर
💻 computer science

Stack Transformer Based Spatial-Temporal Attention Model for Dynamic Sign Language and Fingerspelling Recognition

यह शोधपत्र सीक्वेंशियल स्पैटियो-टेम्पोरल अटेंशन नेटवर्क (SSTAN) का प्रस्ताव करता है, जो एक नवीन ट्रांसफॉर्मर-आधारित आर्किटेक्चर है जो निश्चित कंकाल ग्राफ या स्व-पर्यवेक्षित पूर्व-प्रशिक्षण पर निर्भर हुए बिना जटिल स्पैटियो-टेम्पोरल पैटर्न को प्रभावी ढंग से मॉडल करके गतिशील संकेत भाषा और फिंगरस्पेलिंग पहचान में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Koki Hirooka, Abu Saleh Musa Miah, Tatsuya Murakami, Md. Al Mehedi Hasan, Yong Seok Hwang, Jungpil Shin

प्रकाशित 2026-08-26
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Koki Hirooka, Abu Saleh Musa Miah, Tatsuya Murakami, Md. Al Mehedi Hasan, Yong Seok Hwang, Jungpil Shin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

दुनिया भर के लाखों लोगों के लिए, संचार करने की क्षमता एक सहज वस्तु नहीं है। जब सुनने की अक्षमता एक बाधा बन जाती है, तो सांकेतिक भाषा (sign language) एक महत्वपूर्ण सेतु बन जाती है, जो एक दृश्य-स्थानिक (visual-spatial) भाषा है जहाँ अर्थ हाथों के आकार, शरीर की गतिविधियों और चेहरे के भावों से निर्मित होता है। दशकों से, शोधकर्ताओं ने ऐसे कंप्यूटर बनाने की कोशिश की है जो इस भाषा को समझ सकें, इस उम्मीद में कि वे बधिर और सुनने वाले समुदायों के बीच एक निर्बाध अनुवाद बना सकें। चुनौती डेटा की जटिलता में निहित है: एक संकेत केवल हाथ की एक स्थिर तस्वीर नहीं है, बल्कि पूरे ऊपरी शरीर की गतिविधियों का एक तरल क्रम है। इस भाषा को सिखाने के शुरुआती प्रयासों ने वीडियो कैप्चर करने के लिए कैमरों पर भरोसा किया, लेकिन हाल के सबसे आशाजनक दृष्टिकोणों ने स्वयं कंकाल (skeleton) पर ध्यान केंद्रित किया है—जो जोड़ों और हड्डियों का एक अदृश्य मानचित्र है जो मानव गति को परिभाषित करता है। पृष्ठभूमि को हटाकर केवल शरीर की ज्यामिति पर ध्यान केंद्रित करके, वैज्ञानिकों ने उम्मीद की कि वे प्रकाश परिवर्तन और गोपनीयता संबंधी चिंताओं के प्रति मजबूत सिस्टम बना सकेंगे। हालाँकि, इन कंकाल मानचित्रों की व्याख्या करने के लिए उपयोग किए जाने वाले उपकरण एक दीवार से टकरा गए हैं। वे पारंपरिक रूप से शरीर के अंगों के जुड़ने के बारे में निश्चित नियमों पर निर्भर थे, यह मानते हुए कि हाथ केवल कलाई से संबंधित है, और कलाई कोहनी से। यह कठोर संरचना सरल गतिविधियों के लिए तो अच्छी काम करती है, लेकिन जब किसी संकेत के लिए हाथों को सिर के साथ संपर्क करने की आवश्यकता होती है या जब पूरा शरीर एक समन्वित, जटिल तरीके से चलता है, तो यह संघर्ष करती है।

जापान के अइज़ु विश्वविद्यालय के शोधकर्ताओं की एक टीम ने, दक्षिण कोरिया और बांग्लादेश के सहयोगियों के साथ मिलकर, इस समस्या को हल करने का एक नया तरीका प्रस्तावित किया है। शरीर के जुड़ाव के बारे में एक पूर्व-निर्धारित मानचित्र का पालन करने के लिए कंप्यूटर को मजबूर करने के बजाय, उन्होंने एक ऐसा सिस्टम बनाया जो एक ही बार में पूरी तस्वीर देखना सीखता है। वे इसे 'स्टैक्ड स्पैटियो-टेम्पोरल अटेंशन नेटवर्क' (Stacked Spatio-Temporal Attention Network) कहते हैं। एक ऐसे सिस्टम की कल्पना करें जो न केवल वीडियो के एक एकल फ्रेम को देखता है, बल्कि गति के पूरे क्रम को देखता है और साथ ही यह भी विचार करता है कि शरीर पर एक भी जोड़ दूसरे जोड़ से कैसे संबंधित है, चाहे वे एक-दूसरे से कितनी भी दूर क्यों न हों। यह दृष्टिकोण गतिशील संबंधों की गणना करने के लिए एक लचीली पद्धति को अपनाने हेतु पुराने, कठोर नियमों को त्याग देता है। शोधकर्ताओं ने इस नए आर्किटेक्चर का परीक्षण डेटा के तीन अलग-अलग सेटों पर किया: अमेरिकन साइन लैंग्वेज (ASL) शब्दों का एक बड़ा संग्रह, और जापानी तथा कोरियाई में उपयोग किए जाने वाले फिंगरस्पेलिंग (अक्षरों के संकेतों) के लिए समर्पित दो छोटे सेट। परिणाम आश्चर्यजनक थे। जापानी और कोरियाई फिंगरस्पेलिंग परीक्षणों में, नए मॉडल ने लगभग पूर्ण सटीकता प्राप्त की, जिससे संकेतों को लगभग हर बार सही ढंग से पहचाना गया। इससे भी महत्वपूर्ण बात यह है कि बड़े अमेरिकन साइन लैंग्वेज डेटासेट पर, मॉडल ने अन्य सभी विधियों को पछाड़ दिया जो केवल कंकाल डेटा का उपयोग करती हैं, जिसमें वे भी शामिल हैं जिन्हें विशाल, जटिल प्री-ट्रेनिंग तकनीकों का उपयोग करके प्रशिक्षित किया गया था।

इस सफलता का रहस्य यह है कि मॉडल सूचना को कैसे संसाधित करता है। पारंपरिक सिस्टम अक्सर शरीर को एक श्रृंखला की तरह मानते हैं, जहाँ सूचना एक जोड़ से दूसरे जोड़ तक गुजरती है, जिससे हाथ को सिर से जोड़ने के लिए कई चरणों की आवश्यकता होती है। हालाँकि, नया मॉडल एक ऐसी प्रक्रिया का उपयोग करता है जो इसे सभी जोड़ों को एक ही समय में देखने और तुरंत यह समझने की अनुमति देती है कि कौन से जोड़ एक साथ काम कर रहे हैं। यह प्रत्येक क्षण के लिए दो चरणों में ऐसा करता है: पहले, यह एक एकल फ्रेम के भीतर जोड़ों के स्थानिक संबंधों (spatial relationships) का विश्लेषण करता है, जिससे मुद्रा के आकार को समझा जा सके; फिर, यह टेम्पोरल संबंधों (temporal relationships) का विश्लेषण करता है, जो उस आकार को उससे पहले और बाद के आकारों से जोड़ता है। यह कंप्यूटर को एक निश्चित मानचित्र की आवश्यकता के बिना, सूक्ष्म, समन्वित गतिकी को समझने में सक्षम बनाता है। शोधकर्ताओं ने इस सिस्टम को शुरू से (from scratch) प्रशिक्षित किया, जिसका अर्थ है कि उन्होंने इसे सामान्य अवधारणाओं को सीखने के लिए लाखों अन्य चित्र या वीडियो नहीं दिए। उन्होंने बस इसे सांकेतिक भाषा का डेटा दिखाया, और मॉडल ने पैटर्न को अपने आप सीखा। यह एक महत्वपूर्ण अंतर है, क्योंकि यह सुझाव देता है कि मॉडल अत्यधिक कुशल है, जो भारी कम्प्यूटेशनल लागत के बिना जटिल कार्यों को सीखने में सक्षम है।

यह अध्ययन गहन था, जिसमें अमेरिकन साइन लैंग्वेज डेटासेट के 21,000 से अधिक वीडियो और जापानी एवं कोरियाई सेटों के सैकड़ों वीडियो का परीक्षण किया गया। शोधकर्ता यह सुनिश्चित करने में सावधानी बरत रहे थे कि मॉडल केवल प्रशिक्षण वीडियो के विशिष्ट लोगों को याद न कर रहा हो; उन्होंने डेटा को इस तरह विभाजित किया कि मॉडल का परीक्षण उन लोगों पर किया गया जिन्हें उसने पहले कभी नहीं देखा था। जापानी फिंगरस्पेलिंग परीक्षणों में, मॉडल ने 99.34% की शिखर सटीकता प्राप्त की, और कोरियाई परीक्षणों में, इसने 95.16% की सटीकता प्राप्त की। बड़े अमेरिकन साइन लैंग्वेज डेटासेट पर, इसने सबसे सामान्य 100 संकेतों के लिए 82.95% की शीर्ष सटीकता प्राप्त की, जिसने उन पिछले रिकॉर्डों को पीछे छोड़ दिया जो अधिक जटिल प्रशिक्षण विधियों पर आधारित सिस्टमों के पास थे। शोधकर्ताओं ने नोट किया कि जबकि अन्य सिस्टमों को समान स्तर के प्रदर्शन तक पहुँचने के लिए असंबंधित डेटा पर हजारों घंटों के प्री-ट्रेनिंग की आवश्यकता होती है, उनके मॉडल ने सीधे सांकेतिक भाषा डेटा से सीखकर ये परिणाम प्राप्त किए। यह इंगित करता है कि आर्किटेक्चर स्वाभाविक रूप से इस कार्य के लिए उपयुक्त है, जो मानव गति के जटिल नृत्य को उल्लेखनीय स्पष्टता के साथ पकड़ता है।

निश्चित रूप से, इस अध्ययन की कुछ सीमाएँ भी हैं। शोधकर्ताओं ने विशेष रूप से कंकाल डेटा (skeleton data) पर ध्यान केंद्रित किया, जिसका अर्थ है कि सिस्टम त्वचा के रंग, कपड़ों या पृष्ठभूमि को नहीं देखता है। यह गोपनीयता की रक्षा करने और यह सुनिश्चित करने के लिए एक जानबूझकर किया गया विकल्प है कि सिस्टम विभिन्न वातावरणों में काम करे, लेकिन इसका मतलब यह भी है कि मॉडल उन बारीकियों को नहीं पकड़ सकता होगा जो एक मानव पर्यवेक्षक पूर्ण वीडियो में देख सकता है। इसके अलावा, अध्ययन ने निरंतर बातचीत के बजाय अलग-अलग संकेतों (isolated signs)—व्यक्तिगत शब्दों या अक्षरों—पर ध्यान केंद्रित किया। जबकि मॉडल ने इन व्यक्तिगत इकाइयों को उच्च सटीकता के साथ पहचानने में महारत हासिल की, पूर्ण, प्रवाहमयी बातचीत को समझना एक भविष्य की चुनौती बनी हुई है। लेखकों ने यह भी स्वीकार किया कि विशुद्ध रूप से स्थिर संकेतों के लिए, जहाँ हाथ नहीं हिलता है, एक सरल सिस्टम जो एकल फ्रेम को देखता है, अधिक तेज़ हो सकता है, हालांकि उनके मॉडल ने सटीकता में उन सरल दृष्टिकोणों से बेहतर प्रदर्शन किया।

इस कार्य के निहितार्थ केवल बेहतर पहचान दर से कहीं अधिक हैं। यह प्रदर्शित करके कि एक लचीला, अटेंशन-आधारित सिस्टम बिना भारी प्री-ट्रेनिंग के कठोर, ग्राफ-आधारित मॉडलों से बेहतर प्रदर्शन कर सकता है, शोधकर्ताओं ने मानव गति को समझने के लिए एक नया मार्ग खोल दिया है। यह सुझाव देता है कि जटिल, गतिशील क्रियाओं को समझने की कुंजी उन्हें एक निश्चित संरचना में मजबूर करना नहीं है, बल्कि सिस्टम को स्वयं कनेक्शन खोजने देना है। जैसे-जैसे यह क्षेत्र आगे बढ़ता है, अगले चरणों में संभवतः इस कुशल कंकाल-आधारित दृष्टिकोण को वीडियो जैसे अन्य डेटा स्रोतों के साथ जोड़ना शामिल होगा, ताकि संचार के और भी शक्तिशाली उपकरण बनाए जा सकें। फिलहाल, यह कार्य एक महत्वपूर्ण प्रमाण के रूप में खड़ा है कि जब हम मशीनों को पूरी तस्वीर देखने देते हैं, तो वे हाथों की भाषा को उस स्पष्टता के साथ समझ सकते हैं जो पहले पहुंच से बाहर थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →