← नवीनतम पेपर
💻 computer science

American Sign Language Recognition Using Mediapipe and Deep Learning: A Real-Time Approach

यह शोध पत्र एक वास्तविक समय (real-time), हल्का अमेरिकी सांकेतिक भाषा (ASL) पहचान प्रणाली प्रस्तुत करता है जो उपभोक्ता-श्रेणी के उपकरणों पर स्थिर ASL वर्णमाला संकेतों को वर्गीकृत करने में 98.49% सटीकता प्राप्त करने के लिए हैंड लैंडमार्क डिटेक्शन हेतु गूगल मीडियापाइप (Google MediaPipe) और एक डीप न्यूरल नेटवर्क का उपयोग करता है।

मूल लेखक: amna atiq

प्रकाशित 2026-09-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: amna atiq

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कई लोगों के लिए, संवाद करने की क्षमता एक स्वाभाविक प्रक्रिया है, ध्वनि और अर्थ का एक निर्बाध प्रवाह। लेकिन जो लोग बधिर या सुनने में अक्षम हैं, उनके लिए दुनिया अक्सर सन्नाटे की एक दीवार पेश करती है, विशेष रूप से उन लोगों के साथ बातचीत करते समय जो सांकेतिक भाषा नहीं जानते। अमेरिकन साइन लैंग्वेज (ASL) एक समृद्ध, दृश्य भाषा है जहाँ अर्थ हाथों के आकार, उंगलियों की गति और हथेली की स्थिति द्वारा व्यक्त किया जाता है। दशकों से, शोधकर्ताओं ने ऐसी मशीनें बनाने का प्रयास किया है जो किसी व्यक्ति को संकेत करते हुए देख सकें और उन इशारों को शब्दों में अनुवाद कर सकें, इस उम्मीद में कि उस अंतर को पाटा जा सके। शुरुआती प्रयासों में अक्सर सेंसर वाले विशेष दस्ताने या गहराई देख सकने वाले भारी कैमरों जैसे महंगे और भारी उपकरणों की आवश्यकता होती थी, जिससे यह तकनीक रोजमर्रा के उपयोग के लिए अव्यवहारिक हो जाती थी। लक्ष्य हमेशा यह खोजने का रहा है कि केवल एक साधारण कैमरे, जैसे कि लैपटॉप या फोन में लगे कैमरे का उपयोग करके इस अनुवाद को कैसे किया जाए, ताकि इस तकनीक का उपयोग कोई भी, कहीं भी कर सके।

लाहौर के इंजीनियरिंग एंड टेक्नोलॉजी यूनिवर्सिटी की अमना अतीक द्वारा किए गए एक हालिया अध्ययन ने उस लक्ष्य की ओर एक महत्वपूर्ण कदम उठाया है। शोधकर्ता ने एक ऐसी प्रणाली विकसित की है जो केवल एक मानक वेबकैम और कंप्यूटर का उपयोग करके अमेरिकन साइन लैंग्वेज वर्णमाला के स्थिर अक्षरों को वास्तविक समय (real time) में पहचान सकती है। जटिल हार्डवेयर पर निर्भर रहने के बजाय, यह प्रणाली एक डिजिटल आँख के रूपas कार्य करने के लिए 'मीडियापाइप' (MediaPipe) नामक एक सॉफ्टवेयर टूल का उपयोग करती है। यह टूल वीडियो फीड को स्कैन करता है और मानव हाथ के बीस-एक विशिष्ट बिंदुओं को खोजता है, जैसे कि अंगूठे का सिरा, पोर (knuckles), और कलाई। यह इन बिंदुओं की गति को ट्रैक करता है, जिससे हाथ का एक डिजिटल कंकाल बनता है जो त्रि-आयामी (three-dimensional) स्थान में मौजूद होता है। छवि के कच्चे पिक्सेल के बजाय इन बिंदुओं की स्थिति पर ध्यान केंद्रित करके, यह प्रणाली पृष्ठभूमि के शोर या प्रकाश में बदलाव जैसे विकर्षणों को अनदेखा कर सकती है, और केवल हाथ के आकार पर ध्यान केंद्रित करती है।

एक बार जब सॉफ्टवेयर ने हाथ का मानचित्रण कर लिया, तो यह जानकारी एक छोटे, कुशल कंप्यूटर प्रोग्राम को भेज देता है जिसे पैटर्न सीखना होता है। यह प्रोग्राम, जो आर्टिफिशियल इंटेलिजेंस का एक प्रकार है जिसे 'डीप न्यूरल नेटवर्क' कहा जाता है, को छह हजार से अधिक उदाहरणों के संग्रह पर प्रशिक्षित किया गया था। प्रत्येक उदाहरण में हाथ को A से Z तक के अक्षर बनाते हुए दिखाया गया था। प्रोग्राम ने इन बीस-एक हाथ के बिंदुओं की विशिष्ट व्यवस्था को सही अक्षर के साथ जोड़ना सीखा। यह परीक्षण करने के लिए कि यह कितनी अच्छी तरह काम करता है, शोधकर्ता ने डेटा को विभाजित किया, जिसमें अधिकांश भाग का उपयोग प्रोग्राम को सिखाने के लिए किया गया और एक अलग हिस्सा इसके ज्ञान का परीक्षण करने के लिए रखा गया। परिणाम आश्चर्यजनक थे: सिस्टम ने परीक्षण के लगभग निन्यानवे प्रतिशत मामलों में हाथ के इशारे को सही ढंग से पहचाना। यह एक लाइव वीडियो फीड के साथ तालमेल बिठाने के लिए पर्याप्त तेजी से काम करने में सक्षम था, जो प्रत्येक फ्रेम को लगभग बत्तीस मिलीसेकंड में प्रोसेस करता है, जो एक मानव पर्यवेक्षक के लिए तात्कालिक महसूस होने के लिए पर्याप्त तेज़ है।

अध्ययन ने इस बात पर भी बारीकी से गौर किया कि सिस्टम कहाँ लड़खड़ा सकता है। हालांकि इसने अधिकांश अक्षरों पर असाधारण प्रदर्शन किया, लेकिन इसने कभी-कभी उन अक्षरों के बीच भ्रम पैदा किया जो बहुत समान दिखते हैं, जैसे कि M, N और T। यह एक स्वाभाविक चुनौती है, क्योंकि इन संकेतों में उंगलियों की स्थिति में सूक्ष्म अंतर होते हैं जिन्हें यदि दृश्य (view) सटीक न हो, तो मनुष्यों के लिए भी पहचानना कठिन होता है। इन छोटी समस्याओं के बावजूद, सिस्टम ने सिद्ध किया कि उच्च सटीकता के लिए विशाल सुपरकंप्यूटर या विशेष सेंसर की आवश्यकता नहीं होती है। पूरा सेटअप आठ गीगाबाइट मेमोरी वाले एक मानक लैपटॉप पर सुचारू रूप से चला, जो यह दर्शाता है कि शक्तिशाली सहायक तकनीक हल्की और सुलभ हो सकती है। शोधकर्ता ने उल्लेख किया कि यह प्रणाली स्थिर संकेतों (static gestures) पर सबसे अच्छा काम करती है, जिसका अर्थ है एक स्थान पर रखे गए एकल अक्षर, न कि पूर्ण वाक्यों की निरंतर गति, जो कि भविष्य के लिए एक अधिक जटिल चुनौती है।

इस कार्य को विशेष रूप से सार्थक बनाने वाली बात इसकी व्यावहारिकता पर ध्यान केंद्रित करना है। दस्ताने, डेप्थ कैमरा या हाई-एंड ग्राफिक्स कार्ड की आवश्यकता को हटाकर, यह शोध दर्शाता है कि सांकेतिक भाषा का अनुवाद करने वाला उपकरण जल्द ही किसी भी व्यक्ति के लिए उपलब्ध हो सकता है जिसके पास कंप्यूटर और इंटरनेट कनेक्शन है। यह प्रणाली केवल आकृतियों को नहीं पहचानती; यह उन लोगों के लिए संचार का द्वार खोलती है जो अन्यथा अलग-थलग पड़ सकते हैं। शोधकर्ता इस आधार पर आगे बढ़ने की योजना बना रहे हैं, जिसमें वे सिस्टम को गतिशील संकेतों (dynamic signs) के प्रवाह को समझने के लिए प्रशिक्षित करेंगे और सॉफ्टवेयर को मोबाइल उपकरणों पर चलाने के लिए अनुकूलित करेंगे। फिलहाल, यह उपलब्धि एक स्पष्ट प्रदर्शन है कि सही सॉफ्टवेयर और सरल हार्डवेयर के संयोजन के साथ, हम सुनने वालों और बधिरों को अलग करने वाली बाधाओं को तोड़ना शुरू कर सकते हैं, जिससे एक मानक वेबकैम को मानवीय जुड़ाव के सेतु में बदला जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →