← नवीनतम पेपर
🤖 AI

Multilevel neural networks with dual-stage feature fusion for human activity recognition

यह शोध पत्र एक नवीन दो-स्तरीय न्यूरल नेटवर्क ढांचे का प्रस्ताव और सत्यापन करता है जिसमें द्वि-चरणीय फीचर फ्यूजन (मध्यवर्ती और विलंबित फ्यूजन को संयोजित करना) शामिल है, जो केवल विलंबित फ्यूजन या मानक बेसलाइन आर्किटेक्चर वाले मॉडलों की तुलना में बेहतर मानव गतिविधि पहचान सटीकता प्राप्त करता है।

मूल लेखक: Abeer FathAllah Brery, Ascensión Gallardo-Antolín, Israel Gonzalez-Carrasco, Mahmoud Fakhry

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abeer FathAllah Brery, Ascensión Gallardo-Antolín, Israel Gonzalez-Carrasco, Mahmoud Fakhry

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को यह समझने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं कि किसी व्यक्ति के स्मार्टवॉच या फोन से आने वाले डेटा को देखकर वह क्या कर रहा है। शायद वह चल रहा है, दौड़ रहा है, बैठा है, या सो रहा है। इसे ह्यूमन एक्टिविटी रिकग्निशन (HAR) कहा जाता है।

यह शोध पत्र एक "सुपर-स्मार्ट" कंप्यूटर मस्तिष्क (एक न्यूरल नेटवर्क) बनाने के बारे में है जो इन गतिविधियों का अनुमान लगाने में वास्तव में कुशल है। लेखकों ने केवल एक मस्तिष्क नहीं बनाया; उन्होंने एक दो-मंजिला फैक्ट्री बनाई है जहाँ जानकारी ऊपर की ओर प्रवाहित होती है, संसाधित होती है, और फिर सर्वोत्तम अनुमान लगाने के लिए चतुर तरीकों से संयोजित की जाती है।

यहाँ उनके विचार का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. कच्चा माल: सेंसर

फोन में सेंसर (एक्सेलेरोमीटर और जायरोस्कोप) को रसोई में दो अलग-अलग शेफ के रूप में सोचें।

  • शेफ A (एक्सेलेरोमीटर): यह मापता है कि फोन कितना हिल रहा है या ऊपर-नीचे हो रहा है।
  • शेफ B (जायरोस्कोप): यह मापता है कि फोन कैसे घूम रहा है या मुड़ रहा है।

दोनों शेफ सब्जियां (डेटा) काट रहे हैं, लेकिन वे थोड़ा अलग-अलग काम कर रहे हैं। यदि आप केवल शेफ A की बात सुनते हैं, तो आप एक घुमाव (spin) को मिस कर सकते हैं। यदि आप केवल शेफ B की बात सुनते हैं, तो आप एक उछाल (jump) को मिस कर सकते हैं। पूरी तस्वीर पाने के लिए आपको दोनों की आवश्यकता है।

2. दो-मंजिला फैक्ट्री (आर्किटेक्चर)

लेखकों ने इस डेटा को संसाधित करने के लिए दो स्तरों (या मंजिलों) वाला एक सिस्टम बनाया है।

  • स्तर 1 (पहली मंजिल): यह वह जगह है जहाँ दोनों शेफों से कच्चा डेटा प्रवेश करता है। सिस्टम डेटा को विभाजित करता है और इसे दो अलग-अलग "विशेषज्ञों" (न्यूरल नेटवर्क) को उनके पहले दौर के काम के लिए भेजता है।

    • कुछ विशेषज्ञ CNNs हैं (जो पैटर्न पहचानने में अच्छे हैं, जैसे डेटा के ढेर में एक विशिष्ट आकार को पहचानना)।
    • कुछ LSTMs हैं (जो अनुक्रमों को याद रखने में अच्छे हैं, जैसे यह जानना कि "चलना" आमतौर पर "खड़े होने" के बाद आता है)।
    • कुछ CLSTMs हैं (जो एक हाइब्रिड हैं जो एक ही समय में ये दोनों काम करते हैं)।
  • स्तर 2 (दूसरी मंजिल): पहली मंजिल का आउटपुट यहाँ दूसरे दौर की सोच के लिए जाता है। यह वह जगह है जहाँ सिस्टम यह समझने की कोशिश करता है कि पहली मंजिल ने क्या पाया।

3. गुप्त नुस्खा: "फ्यूजन" (सामग्री को मिलाना)

यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है। लेखकों ने दो शेफों और दो मंजिलों से जानकारी मिलाने के दो तरीकों का परीक्षण किया।

  • लेट फ्यूजन (The "Wait Until the End" Strategy - अंत तक प्रतीक्षा करने की रणनीति):
    कल्पना करें कि शेफ A और शेफ B अलग-अलग व्यंजन बनाते हैं। वे खाना बनाना समाप्त करते हैं, अपनी प्लेटें मेज पर रखते हैं, और फिर एक मैनेजर दोनों का स्वाद लेता है और तय करता है कि भोजन क्या है।

    • परिणाम: यह ठीक-ठातः काम करता है, लेकिन मैनेजर उन सूक्ष्म सुरागों को मिस कर सकता है जो अलग-अलग खाना बनाने की प्रक्रिया के दौरान खो गए थे।
  • इंटरमीडिएट फ्यूजन (The "Cooking Together" Strategy - साथ मिलकर खाना पकाने की रणनीति):
    यह वह है जिसे लेखकों ने विजेता पाया। कल्पना करें कि शेफ A और शेफ B रसोई में एक साथ हैं। खाना पकाने के बीच में ही, वे एक-दूसरे के साथ सामग्री बदलते हैं और एक-दूसरे के बर्तनों का स्वाद लेते हैं। वे अपने स्वादों को मिलाते हैं जबकि वे अभी भी खाना बना रहे होते हैं। फिर, वे उस मिश्रित, सुपर-फ्लेवरफुल व्यंजन को मैनेजर के पास ले जाते हैं।

    • परिणाम: मैनेजर को गतिविधि की बहुत अधिक समृद्ध और पूर्ण तस्वीर मिलती है। शोध पत्र इसे "इंटरमीडिएट फीचर फ्यूजन" कहता है।

4. प्रयोग: व्यंजनों का परीक्षण

शोधकर्ताओं ने दो प्रसिद्ध डेटासेट्स (जैसे दो अलग-अलग टेस्ट किचन) पर 15 अलग-अलग व्यंजनों (CNNs, LSTMs और CLSTMs के संयोजन) का परीक्षण किया:

  1. USC-HAD: लोग 12 अलग-अलग गतिविधियाँ (चलना, कूदना आदि) कर रहे हैं, जिसमें सेंसर कूल्हों पर लगे हैं।
  2. UCI-HAR: लोग 6 गतिविधियाँ (बैठना, खड़ा होना, चलना) कर रहे हैं, जिसमें फोन कमर पर लगा है।

बड़ी खोज:

  • 1D, 2D से बेहतर है: उन्होंने पाया कि इस प्रकार के डेटा के लिए (जो मूल रूप से समय के साथ बदलने वाली संख्याओं की एक रेखा है), 1D फिल्टर (जैसे डोमिनोज़ की एक सीधी रेखा गिरना) का उपयोग करना 2D फिल्टर (जैसे डोमिनोज़ का एक ग्रिड) की तुलना में बेहतर था। यह एक सीधी रेखा को मापने के लिए सीधे रूलर का उपयोग करने जैसा है, न कि एक वर्गाकार मानचित्र का।
  • जल्दी मिलाना जीतता है: जिन मॉडलों ने इंटरमीडिएट फ्यूजन (खाना पकाने के बीच में डेटा को मिलाना) का उपयोग किया, वे लगभग हमेशा उन मॉडलों से अधिक सटीक थे जिन्होंने अंत तक प्रतीक्षा की।
  • विजेता: सबसे अच्छा मॉडल एक दो-स्तरीय सिस्टम था जिसमें 1D कनवल्शनल न्यूरल नेटवर्क (CNNs) का उपयोग किया गया था और इसमें इंटरमीडिएट फ्यूजन था। इसने एक डेटासेट पर 94.4% सटीकता और दूसरे पर 96.75% प्राप्त की, जो उनके द्वारा तुलना किए गए लगभग हर अन्य तरीके को पीछे छोड़ दिया।

5. यह क्यों मायने रखता है?

इसे एक सुरक्षा गार्ड को प्रशिक्षित करने की तरह समझें।

  • पुराना तरीका: आप गार्ड को चलते हुए व्यक्ति की एक फोटो दिखाते हैं, फिर दौड़ते हुए व्यक्ति की एक फोटो दिखाते हैं, और उनसे अनुमान लगाने को कहते हैं।
  • इस पेपर का तरीका: आप गार्ड को एक वीडियो दिखाते हैं, लेकिन आपके पास दो कैमरे हैं। आप उन्हें कैमरा A और कैमरा B को एक साथ देखने देते हैं और उन्हें वीडियो देखते समय एक-दूसरे से बात करने देते हैं, बजाय इसके कि वे उन्हें अलग-अलग देखें और फिर सारांश पूछें।

कैमरों (सेंसर्स) और सोचने वाली परतों (न्यूरल नेटवर्क) को सोचने की प्रक्रिया के शुरुआती चरण में ही एक-दूसरे से बात करने की अनुमति देकर, कंप्यूटर वास्तविक दुनिया में वास्तव में क्या हो रहा है, इसे समझने में बहुत बेहतर हो जाता है।

एक वाक्य में सारांश

लेखकों ने मानव गतिविधियों को पहचानने के लिए एक स्मार्ट कंप्यूटर मस्तिष्क बनाया है, जिसमें एक दो-चरणीय प्रक्रिया बनाई गई है जहाँ विभिन्न प्रकार के डेटा को सोचने की प्रक्रिया के अंत तक प्रतीक्षा करने के बजाय, शुरुआत में ही मिला दिया जाता है, जिसके परिणामस्वरूप पिछले तरीकों की तुलना में अधिक सटीक और कुशल प्रणाली प्राप्त होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →