← नवीनतम पेपर
💻 computer science

Hybrid 3D-CNN, Bi-LSTM, and Transformer-Based Framework for Anomaly Detection of Human Behaviour in Video Surveillance with Adaptive Error Minimization

यह शोध पत्र एक नवीन हाइब्रिड डीप लर्निंग फ्रेमवर्क प्रस्तावित करता है जो विविध पर्यावरणीय परिस्थितियों में फॉल्स अलार्म को महत्वपूर्ण रूप से कम करके वीडियो निगरानी में अत्याधुनिक, रियल-टाइम विसंगति का पता लगाने के लिए 3D-CNN, Bi-LSTM और ट्रांसफॉर्मर आर्किटेक्चर को एक एडेप्टिव थ्रेशोल्ड मॉड्यूल और मल्टी-ऑब्जेक्टिव लॉस ऑप्टिमाइजेशन के साथ एकीकृत करता है।

मूल लेखक: Sameera yasam, Syed Ali Hussain, Vijaya Kumar Koppula

प्रकाशित 2026-08-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sameera yasam, Syed Ali Hussain, Vijaya Kumar Koppula

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक दुनिया में, सुरक्षा कैमरे हमारी सड़कों, स्टेशनों और इमारतों पर नज़र रखते हैं, जो दृश्य डेटा का एक ऐसा सैलाब पैदा करते हैं जिसे कोई भी मानव टीम संभवतः मॉनिटर नहीं कर सकती। सुरक्षा प्रणालियों के लिए चुनौती केवल देखने की नहीं है, बल्कि यह समझने की है कि वे क्या देख रहे हैं। उन्हें साधारण, हानिरहित गतिविधियों और दुर्लभ, खतरनाक घटनाओं, जैसे कि लड़ाई शुरू होने या चोरी होने के बीच अंतर करना होता है। यह कार्य अत्यंत कठिन है क्योंकि "सामान्य" व्यवहार दिन के समय, रोशनी, भीड़ के घनत्व और कैमरे के कोण के आधार पर लगातार बदलता रहता है। एक प्रणाली जो बहुत संवेदनशील होगी, वह हर छाया या हवा के अचानक झोंके के लिए अलार्म बजा देगी, जिससे झूठी चेतावनियों का एक सैलाब उमड़ पड़ेगा जो मानव ऑपरेटरों को थका देगा। इसके विपरीत, एक प्रणाली जो बहुत सख्त होगी, वह वास्तविक खतरे को पूरी तरह से मिस कर सकती है। वर्षों से, शोधकर्ताओं ने ऐसे कंप्यूटर प्रोग्राम बनाने की कोशिश की है जो साधारण और खतरनाक के बीच अंतर करना सीख सकें, लेकिन अधिकांश मौजूदा समाधान इन दोनों जोखिमों के बीच संतुलन बनाने में संघर्ष करते हैं, और अक्सर वीडियो की गुणवत्ता गिरने या दृश्य अराजक होने पर विफल हो जाते हैं।

एसआर यूनिवर्सिटी और कोनेरू लक्ष्मिआ एजुकेशन फाउंडेशन, भारत के शोधकर्ताओं की एक टीम ने इस निरंतर समस्या को हल करने के लिए एक नया दृष्टिकोण प्रस्तावित किया है। उन्होंने एक हाइब्रिड कंप्यूटर सिस्टम डिजाइन किया है जो इस तरह नकल करता है जैसे मानव मस्तिष्क के विभिन्न भाग किसी दृश्य को प्रोसेस करते हैं, जिसमें एक एकल सहयोगी ढांचे में तीन अलग-अलग प्रकार के कृत्रिम बुद्धिमत्ता (AI) को संयोजित किया गया है। केवल एक विधि पर निर्भर रहने के बजाय, उनका सिस्टम समानांतर में काम करने वाले तीन विशिष्ट "द्रष्टाओं" (viewers) का उपयोग करता है। पहला द्रष्टा स्थानीय विवरणों और गति के छोटे विस्फोटों को पकड़ने के लिए बनाया गया है, ठीक वैसे ही जैसे किसी त्वरित हाथ के इशारे या अचानक कदम को नोटिस करना। दूसरा द्रष्टा समय के साथ घटनाओं के क्रम पर ध्यान केंद्रित करता है, यह समझने के लिए कि एक क्रिया कैसे शुरू होती है, विकसित होती है और समाप्त होती है, जिससे यह सुनिश्चित होता है कि गति के ठहराव या उलटने को महत्वपूर्ण माना जाए। तीसरा द्रष्टा पूरे दृश्य को एक संपूर्ण इकाई के रूप में देखता है, जो व्यापक संदर्भ को समझने के लिए वीडियो के दूरस्थ हिस्सों को जोड़ता है, जैसे कि लोगों का एक समूह एक असामान्य पैटर्न में एक साथ चलना।

इस नए ढांचे की बुद्धिमत्ता इस बात में निहित है कि ये तीन द्रष्टा एक साथ कैसे काम करते हैं। उन्हें एक एकल कठोर नियम पर सहमत होने के लिए मजबूर करने के बजाय, सिस्टम उनके विचारों को गतिशील रूप से वजन देने (weighing) के बारे में सीखता है। यदि दृश्य एक भीड़भाड़ वाली सड़क है जहाँ लोगों का समग्र प्रवाह सबसे अधिक मायने रखता है, तो सिस्टम "ग्लोबल" (वैश्विक) द्रष्टा की बात अधिक सुनता है। यदि दृश्य में एक विशिष्ट, तेज़ गति वाली क्रिया शामिल है, तो यह "लोकल" (स्थानीय) द्रष्टा पर अधिक भरोसा करता है। यह लचीलापन सिस्टम को प्रत्येक नए स्थान के लिए पुन: प्रोग्राम किए बिना विभिन्न वातावरणों के अनुकूल होने की अनुमति देता है। इसके अलावा, शोधकर्ताओं ने वीडियो गुणवत्ता के बदलने के मुद्दे को भी संबोधित किया है, जैसे कि रात के शॉट का दानेदार होना या बारिश का धुंधलापन। उन्होंने एक फीडबैक तंत्र बनाया है जो लगातार छवि की स्पष्टता की जांच करता है। यदि वीडियो धुंधला या शोर युक्त (noisy) हो जाता है, तो सिस्टम स्वचालित रूप से अलार्म के लिए अपने मानकों को कड़ा कर देता है, जिससे खराब इमेज क्वालिटी के कारण गलत चेतावनी देने से बचा जा सके। यदि छवि बिल्कुल स्पष्ट है, तो यह और भी अधिक संवेदनशील हो जाता है, जो परेशानी के सूक्ष्म संकेतों को पकड़ने के लिए तैयार रहता है।

जब शोधकर्ताओं ने वास्तविक दुनिया के निगरानी फुटेज के तीन प्रमुख संग्रहों पर इस प्रणाली का परीक्षण किया, तो परिणाम आश्चर्यजनक थे। सिस्टम ने उच्च स्तर की सटीकता के साथ विसंगतियों (anomalies) की सफलतापूर्वक पहचान की, और मौजूदा सर्वोत्तम तरीकों से काफी आगे निकल गया। सबसे चुनौतीपूर्ण डेटासेट पर, जिसमें तेरह विभिन्न प्रकार के अपराधों को कवर करने वाले एक हजार घंटों से अधिक के अनट्रिम्ड वीडियो शामिल थे, नए सिस्टम ने लगभग नब्बे प्रतिशत की सफलता दर हासिल की। एक कैंपस डेटासेट पर, जिसमें विस्तृत, फ्रेम-दर-फ्रेम लेबल थे, इसने लगभग अट्ठानवे प्रतिशत की सटीकता प्राप्त की। शायद वास्तविक दुनिया की सुरक्षा के लिए सबसे महत्वपूर्ण बात यह है कि इस प्रणाली ने झूठी चेतावनियों की संख्या को काफी कम कर दिया। इसने पिछले सर्वोत्तम तकनीक की तुलना में 'फॉल्स पॉजिटिव' (झूठी सकारात्मक) की दर को लगभग चालीस प्रतिशत कम कर दिया, जिसका अर्थ है कि सुरक्षा गार्डों को हानिरहित घटनाओं के कारण बहुत कम बार बाधित किया जाएगा। साथ ही, इसने वास्तविक खतरों को कम करके 'फॉल्स नेगेटिव' (झूठी नकारात्मक) की दर को तीस प्रतिशत से अधिक कम कर दिया।

यह प्रणाली वास्तविक समय (real time) में संचालित करने में भी सक्षम सिद्ध हुई, जो प्रति सेकंड बत्तीस फ्रेम की गति से वीडियो को प्रोसेस करती है, जो लाइव निगरानी फीड के साथ तालमेल बिठाने के लिए पर्याप्त तेज़ है। शोधकर्ताओं ने पुष्टि की कि सुधार तीनों घटकों के एक साथ मिलकर काम करने से आया है; किसी एक को हटाने से सिस्टम के प्रदर्शन में उल्लेखनीय गिरावट आती है। उन्होंने यह भी सत्यापित किया कि वीडियो गुणवत्ता को संभालने के लिए अनुकूलन तंत्र (adaptive mechanism) त्रुटियों को कम करने की कुंजी थी, क्योंकि इसने सिस्टम को प्रकाश बदलने या कैमरा हिलने पर भी विश्वसनीय बनाए रखा। हालांकि इस प्रणाली को एक छोटा क्लिप प्रोसेस करने के लिए एक संक्षिप्त क्षण की आवश्यकता होती है, जिससे एक सेकंड के कुछ अंश का विलंब (delay) उत्पन्न होता है, लेकिन इस समझौते को सटीकता और विश्वसनीयता के विशाल लाभ के लिए स्वीकार्य माना जाता है।

यह कार्य स्वचालित निगरानी को वास्तव में व्यावहारिक बनाने की दिशा में एक महत्वपूर्ण कदम है। कठोर, एक-समान नियमों से हटकर एक लचीले, बहु-परिप्रेक्ष्य दृष्टिकोण की ओर बढ़ते हुए, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो खतरों के प्रति संवेदनशील भी है और वास्तविक दुनिया के वीडियो की अपरिहार्य खामियों के विरुद्ध मजबूत भी है। निष्कर्ष बताते हैं कि वीडियो सुरक्षा का भविष्य एक एकल, पूर्ण पर्यवेक्षक बनाने में नहीं, बल्कि विशेष पर्यवेक्षकों की एक ऐसी टीम बनाने में है जो एक-दूसरे से सीख सके और दुनिया के बदलते स्वरूप के साथ खुद को ढाल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →