← नवीनतम पेपर
💻 computer science

SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting

यह शोध पत्र SMART का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो कुशल लघु-बैच वीडियो-टेक्स्ट संरेखण और संयुक्त टेम्पोरल स्थानीयकरण के माध्यम से निरंतर सांकेतिक भाषा पहचान और स्पॉटिंग को बढ़ाने के लिए MLLM-जनित मोशन विवरणों और एक मल्टी-स्केल टेम्पोरल एडेप्टर का लाभ उठाता है।

मूल लेखक: Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi

प्रकाशित 2026-08-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

लाखों लोगों के लिए जो बधिर या सुनने में अक्षम हैं, सांकेतिक भाषा केवल हाथों के संकेतों का एक संग्रह नहीं है, बल्कि अपने स्वयं के व्याकरण, लय और सूक्ष्मता के साथ एक पूर्ण, प्रवाहमयी भाषा है। जिस तरह बोले गए शब्द बिना किसी ठहराव के एक वाक्य में आपस में मिल जाते हैं, वैसे ही संकेतों का एक निरंतर प्रवाह अक्सर एक-दूसरे में विलीन हो जाता है, जिससे कंप्यूटर के लिए यह पहचानना कठिन हो जाता है कि एक संकेत कहाँ समाप्त होता है और दूसरा कहाँ शुरू होता है। दशकों से, शोधकर्ताओं ने मशीनों को इन वीडियो को समझने के लिए प्रशिक्षित करने की कोशिश की है, लेकिन वे एक जिद्दी बाधा का सामना करते रहे हैं: इन प्रणालियों को प्रशिक्षित करने के लिए उपलब्ध डेटा आमतौर पर केवल अंतिम वाक्य प्रदान करता है, जैसे कि एक ट्रांसक्रिप्ट, बिना कंप्यूटर को यह बताए कि वीडियो के किस सटीक क्षण का किस विशिष्ट शब्द के साथ संबंध है। सूक्ष्म समय (precise timing) की इस कमी के कारण कंप्यूटर को अनुमान लगाने के लिए मजबूर होना पड़ता है, जिसके परिणामस्वरूप अक्सर एक ऊबड़-खाबड़, असमान समझ प्राप्त होती है जहाँ मशीन एक शब्द को तो पहचान सकती है लेकिन यह नहीं जान पाती कि वह कितनी देर तक चला या वह कहाँ शुरू हुआ। इस सूक्ष्म ज्ञान के बिना, सांकेतिक भाषा के लिए एक वास्तव में प्रवाहपूर्ण अनुवादक बनाना पहुंच से बाहर बना हुआ है।

कोरिया में दानक विश्वविद्यालय के शोधकर्ताओं की एक टीम ने अब इस अंतर को पाटने के लिए एक नया दृष्टिकोण प्रस्तावित किया है, और एक प्रणाली पेश की है जिसे वे SMART कहते हैं। उनका कार्य उन दोहरी चुनौतियोंों का समाधान करता है जिनमें यह पहचानना शामिल है कि कौन से संकेत बनाए जा रहे हैं और वे वीडियो में ठीक कब होते हैं। केवल वाक्य की लंबाई के आधार पर शब्दों की सीमाओं का अनुमान लगाने की पुरानी पद्धति पर निर्भर रहने के बजाय, शोधकर्ताओं ने एक ऐसा ढांचा तैयार किया है जो एक शक्तिशाली प्रकार के आर्टिफिशियल इंटेलिजेंस का उपयोग करता है जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल कहा जाता है। इस प्रणाली के सीखने शुरू करने से पहले ही, यह AI एक सतर्क पर्यवेक्षक के रूप में कार्य करता है, जो सांकेतिक भाषा के वीडियो को देखता है और हर एक क्षण में होने वाली हाथ की गतिविधियों और चेहरे के भावों का विस्तृत विवरण लिखता है। ये विवरण एक समृद्ध, सिमेंटिक मार्गदर्शक के रूप में कार्य करते हैं, जो कंप्यूटर को दृश्य गति को विशिष्ट भाषाई अवधारणाओं के साथ जोड़ने में मदद करते हैं, ठीक वैसे ही जैसे एक शिक्षक संकेत की ओर इशारा करते हुए उसके अर्थ को समझाता है।

शोधकर्ताओं ने इन वीडियो को संसाधित करने के लिए एक विशेष इंजन डिजाइन किया, जो समय के साथ होने वाले परिवर्तनों पर बारीकी से ध्यान देता है। जबकि मानक वीडियो विश्लेषण उपकरण अक्सर फ्रेमों को अलग-थलग देखते हैं, यह नई प्रणाली कई पैमानों पर गति के प्रवाह को समझने के लिए बनाई गई है, जो त्वरित, तीक्ष्ण गतिविधियों और धीमी, अधिक विचारशील मुद्राओं, दोनों को कैप्चर करती है। पहले से उत्पन्न विस्तृत पाठ्य विवरणों के साथ इस टेम्पोरल अवेयरनेस (सामयिक जागरूकता) को जोड़कर, प्रणाली वीडियो को भाषा के अर्थ के साथ एक स्थिर और कुशल तरीके से संरेखित करना सीखती है, भले ही कंप्यूटर एक बार में बहुत कम वीडियो प्रोसेस कर रहा हो। यह मॉडल को सांकेतिक भाषा की गतिशीलता की एक बहुत स्पष्ट तस्वीर बनाने की अनुमति देता है जो पहले संभव नहीं था।

शायद इस कार्य का सबसे महत्वपूर्ण नवाचार यह है कि यह प्रणाली पहचान (recognition) और समय (timing) के दो कार्यों को एक साथ कैसे संभालती है। शोधकर्ताओं ने एक एकीकृत संरचना बनाई है जहाँ पहचान करने वाला हिस्सा सीधे उस हिस्से को जानकारी भेजता है जो सीमाओं का पता लगाता है। पिछले प्रयासों में, इन दो कार्यों को अक्सर अलग-अलग माना जाता था, या समय की जानकारी इतनी कम थी कि वह उपयोगी न हो सके। यहाँ, प्रणाली एक विशिष्ट संकेत को पहचानने में अपने आत्मविश्वास का उपयोग उस संकेत के किनारों को समय में और अधिक सटीक बनाने के लिए करती है, प्रभावी रूप से कंप्यूटर को बताती है, "मुझे यकीन है कि यह शब्द 'स्टॉप' है, इसलिए आइए ठीक से चिह्नित करें कि यह कब शुरू और समाप्त होता है।" यह एक फीडबैक लूप बनाता है जहाँ शब्दों को पहचानने की क्षमता सीमाओं को खोजने की क्षमता में सुधार करती है, और उन सीमाओं का सटीक समय, बदले में, सिस्टम को शब्दों को अधिक सटीकता से पहचानने में मदद करता है।

टीम ने जर्मन, चीनी और दो अलग-अलग कोरियाई सांकेतिक भाषा संग्रहों सहित चार विभिन्न सांकेतिक भाषा डेटासेट पर इस नए ढांचे का परीक्षण किया। परिणामों ने दिखाया कि उनकी पद्धति ने संकेतों के अनुक्रम को पहचानने और उन्हें वीडियो के भीतर सटीक रूप से खोजने, दोनों में सभी मौजूदा अत्याधुनिक प्रणालियों को पछाड़ दिया। एक बड़े डेटासेट पर, प्रणाली ने संकेतों को पहचानने की त्रुटि दर को एक प्रतिशत से भी कम कर दिया, जो पिछले तरीकों की तुलना में एक महत्वपूर्ण सुधार है। इसके अलावा, जब संकेतों के सटीक प्रारंभ और समाप्ति समय का पता लगाने के लिए कहा गया, तो प्रणाली ने सटीकता का एक ऐसा स्तर प्राप्त किया जो पारंपरिक तरीकों से कहीं अधिक था, जिससे यह सिद्ध हुआ कि ये दोनों कार्य वास्तव में एक-दूसरे के पूरक हैं। शोधकर्ताओं ने पाया कि भाषा विवरणों को एक मार्गदर्शक के रूप में उपयोग करके और पहचान एवं स्थान निर्धारण के कार्यों को एक-दूसरे का समर्थन करने देकर, वे कमजोर पर्यवेक्षण (weak supervision) की उन सीमाओं को पार कर सके जो लंबे समय से इस क्षेत्र में बनी हुई थीं।

यह कार्य सुझाव देता है कि प्रवाहपूर्ण सांकेतिक भाषा की समझ का मार्ग केवल बेहतर कैमरों या तेज़ प्रोसेसरों में नहीं है, बल्कि मशीनों को मानव गति की सिमेंटिक समृद्धि को समझने में प्रशिक्षित करने में है। गति के विस्तृत विवरण उत्पन्न करके और सीखने की प्रक्रिया को निर्देशित करने के लिए उनका उपयोग करके, SMART फ्रेमवर्क यह प्रदर्शित करता है कि कंप्यूटर सांकेतिक भाषा को विवरण के उस स्तर के साथ देख सकते हैं जो मानवीय धारणा के करीब है। निष्कर्ष संकेत देते हैं कि भाषा मॉडलों की व्यापक समझ को वीडियो विश्लेषण की सटीक टाइमिंग के साथ जोड़ना एक शक्तिशाली तालमेल बनाता है, जो बधिर और सुनने में अक्षम समुदाय के लिए संचार बाधाओं को अंततः तोड़ने वाले उपकरण बनाने के लिए एक आशाजनक नई दिशा प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →