← नवीनतम पेपर
💻 computer science

Human Fall Detection Using Deep Learning Methods: A Multimodal Audio-Video Approach

यह अध्ययन एक मल्टीमॉडल डीप लर्निंग फ्रेमवर्क प्रस्तावित करता है जो मानव गिरने का पता लगाने (ह्यूमन फॉल डिटेक्शन) में 98% सटीकता प्राप्त करने के लिए डिसीजन-लेवल स्टैकिंग का उपयोग करके ऑडियो और वीडियो फीचर्स को फ्यूज करता है, जो सिंगल-मोडैलिटी मॉडल्स और अन्य फ्यूजन रणनीतियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Hamid Ghous, Qandeel Asghar, Numan Asghar, Syed Adil Hussain Shah, Syed Taimoor Hussain Shah, Marco Agostino Deriu

प्रकाशित 2026-09-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hamid Ghous, Qandeel Asghar, Numan Asghar, Syed Adil Hussain Shah, Syed Taimoor Hussain Shah, Marco Agostino Deriu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

गिरना एक मौन खतरा है, विशेष रूप से बुजुर्गों के लिए, जहाँ एक गलत कदम चोट, स्वतंत्रता की हानि, या उससे भी बदतर स्थिति का कारण बन सकता है। दशकों तक, समाधान अक्सर लोगों को एक ऐसा उपकरण पहनने के लिए कहना रहा है, जैसे कि एक पेंडेंट या रिस्टबैंड, जो अचानक गिरने को महसूस कर सके। लेकिन इन उपकरणों में एक दोष है: वे इस बात पर निर्भर करते हैं कि व्यक्ति उन्हें पहनना याद रखे, और वे असहज या कलंकजनक हो सकते हैं। इसने शोधकर्ताओं को बिना छुए देखने और सुनने का तरीका खोजने के लिए प्रेरित किया है, जिसमें कैमरों और माइक्रोफ़ोन का उपयोग करके गिरते ही घटना का पता लगाया जा सके। चुनौती यह है कि एक गिरना और रोज़मर्रा की अन्य क्रियाएं, जैसे कि तेज़ी से बैठना, जूते के फीते बांधने के लिए झुकना, या बस आराम करने के लिए लेट जाना, एक जैसी दिखती और सुनाई देती हैं। इस समस्या को हल करने के लिए, वैज्ञानिकों ने डीप लर्निंग की ओर रुख किया है, जो कंप्यूटर इंटेलिजेंस का एक प्रकार है जो हजारों उदाहरणों का अध्ययन करके पैटर्न सीखता है, ठीक वैसे ही जैसे एक बच्चा कई अलग-अलग कुत्तों को देखकर कुत्ते को पहचानना सीखता है। इन प्रणालियों को शरीर की दृश्य गति और उससे उत्पन्न ध्वनियों, दोनों को समझने के लिए प्रशिक्षित करके, शोधकर्ता एक ऐसी सुरक्षा प्रणाली बनाने की आशा करते हैं जो हमेशा देख रही हो, हमेशा सुन रही हो, और हमेशा अलार्म बजाने के लिए तैयार हो।

पाकिस्तान और इटली के विश्वविद्यालयों के शोधकर्ताओं की एक टीम ने बिल्कुल इसी तरह की प्रणाली बनाने का लक्ष्य रखा, लेकिन एक विशिष्ट मोड़ के साथ: वे देखना चाहते थे कि क्या दृष्टि और ध्वनि को मिलाने से अकेले किसी एक इंद्रिय के उपयोग से बेहतर परिणाम मिल सकते हैं। उन्होंने वीडियो रिकॉर्डिंग के एक संग्रह के साथ शुरुआत की, जिसमें लोगों को गिरते हुए दिखाने के साथ-साथ सामान्य गतिविधियाँ जैसे चलना और बैठना भी दिखाया गया था। शोधकर्ताओं ने वीडियो और ऑडियो को सूचना के दो अलग-अलग प्रवाहों के रूप में माना। सबसे पहले, उन्होंने प्रत्येक वीडियो क्लिप से ध्वनि को अलग किया। उन्होंने ऑडियो को एक एकल चैनल में परिवर्तित किया और फिर इसे समय के साथ इसकी आवृत्तियों (frequencies) के एक विस्तृत मानचित्र में विभाजित किया, ताकि उन तीव्र, अचानक ऊर्जा स्पाइक्स (spikes) को खोजा जा सके जो शरीर के फर्श से टकराने पर होते हैं। उन्होंने इस ध्वनि डेटा को प्रबंधनीय रूप में संकुचित करने के लिए एक गणितीय विधि का उपयोग किया और फिर केवल सबसे उपयोगी ध्वनि विशेषताओं को चुनने के लिए एक कंप्यूटरीकृत खोज प्रक्रिया लागू की, जिससे शोर को हटा दिया गया। इन चुनी गई विशेषताओं को एक प्रकार के कृत्रिम मस्तिष्क में डाला गया जो अनुक्रमों (sequences) को याद रखने के लिए डिज़ाइन किया गया था, जिससे यह समझना संभव हुआ कि गिरना कुछ सेकंड तक चलने वाला ध्वनि का एक विशिष्ट पैटर्न है, न कि केवल एक एकल शोर।

साथ ही, शोधकर्ताओं ने वीडियो फ्रेमों को देखा। उन्होंने व्यक्ति के चेहरे या कपड़ों को पहचानने की कोशिश नहीं की; इसके बजाय, वे पूरी तरह से इस बात पर ध्यान केंद्रित कर रहे थे कि शरीर कैसे हिलता है। उन्होंने एक विशेष दृश्य सारांश बनाया जो दिखाया कि पिछले कुछ सेकंड में गति कहाँ हुई थी, जिसमें गति के पथ को उजागर किया गया और दृश्य के पुराने, स्थिर भागों को धुंधला कर दिया गया। इस चलती-फिरती तस्वीर से, उन्होंने व्यक्ति की रूपरेखा (outline) को ट्रेस किया ताकि उनकी गति का स्पष्ट आकार प्राप्त किया जा सके। ध्वनि की तरह ही, उन्होंने इन दृश्य पैटर्न को एक अनुक्रम-सीखने वाले कंप्यूटर मॉडल में डाला जो इस बात को ट्रैक कर सकता था कि एक क्षण से दूसरे क्षण तक गति का आकार कैसे बदलता है। परिणाम दो अलग-अलग विशेषज्ञ थे: एक जो गिरने के लिए सुनने में अच्छा था, और दूसरा जो गिरने को देखने में बेहतर था। ध्वनि-आधारित प्रणाली ने लगभग 81 प्रतिशत बार गिरना सही ढंग से पहचाना, जबकि वीडियो-आधारित प्रणाली और भी सटीक थी, जिसने 92 प्रतिशत बार इसे सही पाया।

हालाँकि, वास्तविक परीक्षण यह नहीं था कि प्रत्येक प्रणाली अकेले कितनी अच्छी तरह काम करती है, बल्कि यह था कि वे मिलकर कैसे काम करती हैं। शोधकर्ताओं ने ऑडियो और वीडियो प्रणालियों के निर्णयों को संयोजित करने के छह अलग-अलग तरीके आजमाए। कुछ तरीके सरल थे, जैसे दोनों के स्कोर का औसत लेना या बहुमत के वोट से निर्णय लेना। इन सरल दृष्टिकोणों ने खराब प्रदर्शन किया, जिसमें कुछ संयोजनों की सटीकता गिरकर 36 प्रतिशत तक रह गई। इससे पता चला कि केवल दो संकेतों को मिला देना पर्याप्त नहीं था; प्रणाली को साक्ष्य को तौलने के लिए एक स्मार्ट तरीके की आवश्यकता थी। शोधकर्ताओं ने फिर एक ऐसी विधि आजमाई जहाँ एक तीसरे, अधिक उन्नत कंप्यूटर मॉडल ने ऑडियो और वीडियो विशेषज्ञों के आउटपुट को संयोजित करना सीखा। यह अंतिम प्रणाली, जो दो विशेषज्ञों के काम की समीक्षा करने वाले एक पर्यवेक्षक की तरह कार्य करती थी, ने 98 प्रतिशत सटीकता हासिल की। यह गिरने को तब भी पहचान पाने में सक्षम थी जब एक इंद्रिय अनिश्चित थी, प्रभावी रूप से वीडियो की शक्ति का उपयोग ऑडियो की पुष्टि करने के लिए, या ध्वनि की स्पष्टता का उपयोग दृश्य की पुष्टि करने के लिए कर सकती थी।

अध्ययन सुझाव देता है कि हालांकि कैमरे शक्तिशाली हैं, ध्वनि जोड़ना एक अधिक विश्वसनीय सुरक्षा जाल बनाता है। शोधकर्ताओं ने पाया कि गिरने से विशिष्ट ध्वनिक संकेत (acoustic signatures) उत्पन्न होते हैं जिन्हें अक्सर दृष्टि-मात्र प्रणालियों द्वारा छोड़ दिया जाता है, विशेष रूप से यदि व्यक्ति आंशिक रूप से छिपा हुआ हो या प्रकाश व्यवस्था खराब हो। इसके विपरीत, ध्वनि पृष्ठभूमि के शोर से भ्रमित हो सकती है, जिससे दृश्य पुष्टि आवश्यक हो जाती है। इन दोनों सूचना प्रवाहों को मिलाने के लिए एक परिष्कृत विधि का उपयोग करके, टीम ने प्रदर्शित किया कि एक बहु-मोडल (multimodal) दृष्टिकोण एकल इंद्रिय पर निर्भर रहने की तुलना में कहीं अधिक श्रेष्ठ है। हालाँकि, उन्होंने उल्लेख किया कि उनके परिणाम नियंत्रित वातावरण में सिम्युलेटेड गिरावटों के अपेक्षाकृत छोटे सेट से आए थे, और वास्तविक दुनिया की स्थितियाँ जिनमें कई लोग, अलग-अलग शोर के स्तर और विभिन्न कैमरा कोण होंगे, नई चुनौतियाँ पेश करेंगे। यह कार्य इस समस्या को पूरी तरह से हल करने का दावा नहीं करता है, लेकिन यह भविष्य की प्रणालियों के लिए एक मजबूत आधार प्रदान करता है जो घरों और देखभाल केंद्रों की निगरानी अधिक विश्वास के साथ कर सकें, यह सुनिश्चित करते हुए कि जब कोई गिरता है, तो मदद तुरंत बुलाई जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →