← नवीनतम पेपर
💻 computer science

Efficient Residual YOLOv12-L Atrous Squeeze LightGBM Optimized Fuzzy CatBoost Network for Vehicle Identification in Traffic Environments

यह शोध पत्र RYAS-LOFCN फ्रेमवर्क का प्रस्ताव करता है, जो दूर स्थित और दृष्टिगत रूप से समान यातायात वस्तुओं का पता लगाने की सीमाओं को दूर करने के लिए FPN के साथ एक रेजिडुअल एट्रस स्क्वीज़ अटेंशन नेटवर्क और YOLOv12-L आधारित लाइटजीबीएम-अनुकूलित फजी कैटबूस्ट नेटवर्क को एकीकृत करता है, जिससे वाहन पहचान में 98.63% सटीकता और 98.56% परिशुद्धता प्राप्त होती है।

मूल लेखक: R Kiranmai, R Deeptha

प्रकाशित 2026-09-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: R Kiranmai, R Deeptha

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

ट्रैफिक कैमरे दुनिया को चलते हुए देखते हैं, जो शहर की सड़कों और राजमार्गों के माध्यम से गुजरते वाहनों, पैदल यात्रियों और साइकिल चालकों की एक निरंतर धारा को कैद करते हैं। कंप्यूटरों के लिए इस दृश्य को समझने हेतु, उन्हें पहले चलते हुए पिंडों (objects) को स्थिर पृष्ठभूमि (background) से अलग करना होता है, जिसे सेगमेंटेशन (segmentation) कहा जाता है, और फिर यह पहचानना होता है कि प्रत्येक पिंड वास्तव में क्या है। यह कार्य तब अविश्वसनीय रूप से कठिन हो जाता है जब दृश्य भीड़भाड़ वाला हो, रोशनी तेज धूप से गहरे साये में बदल रही हो, या जब वस्तुएं बहुत दूर हों। उन दूरस्थ स्थानों में, कारें और लोग छोटे दिखाई देते हैं और संकुचित हो जाते हैं, और सड़क की जटिलता के कारण उनका विवरण धुंधला हो जाता है। पारंपरिक कंप्यूटर विजन सिस्टम अक्सर यहाँ संघर्ष करते हैं, जिससे वे छोटी आकृतियों का पता खो देते हैं या अलग-अलग लोगों को एक ही भ्रमित समूह (blob) में मिला देते हैं। वे प्रकाश परिवर्तन के समय भी विफल हो जाते हैं, जिससे ऐसे साये बन जाते हैं जो किसी व्यक्ति या वाहन के हिस्से जैसे दिखते हैं, या जब पृष्ठभूमि टूटी हुई और खंडित होती है।

इन निरंतर समस्याओं को हल करने के लिए, चेन्नई, भारत में एसआरएम इंस्टीट्यूट ऑफ साइंस एंड टेक्नोलॉजी के शोधकर्ताओं ने एक नई प्रणाली विकसित की है, जिसे पहले से कहीं अधिक स्पष्ट रूप से ट्रैफिक देखने के लिए डिज़ाइन किया गया है। उनका दृष्टिकोण, जिसका हाल ही में एक अध्ययन में वर्णन किया गया है, दो शक्तिशाली चरणों को जोड़ता है: एक जो पृष्ठभूमि से वस्तुओं के आकार को सावधानीपूर्वक काटता है, और दूसरा जो उन आकारों की पहचान करता है। टीम ने एक ऐसी प्रणाली बनाई है जो उन सूक्ष्म, दूरस्थ विवरणों पर विशेष ध्यान देती है जिन्हें अन्य विधियाँ छोड़ देती हैं, और साथ ही छाया और भीड़भाड़ वाली सड़कों से उत्पन्न होने वाले भ्रमित करने वाले शोर (noise) को अनदेखा करना सीखती है। वास्तविक दुनिया के ट्रैफिक वीडियो के एक बड़े संग्रह पर अपने निर्माण का परीक्षण करके, उन्होंने पाया कि उनकी विधि अत्यधिक सटीकता के साथ एक कार, चलते व्यक्ति और एक साइकिल चालक के बीच अंतर कर सकती है, भले ही स्थितियां कितनी भी प्रतिकूल क्यों न हों।

इस नई प्रणाली का मूल आधार इस बात में निहित है कि यह वस्तुओं को नाम देने का प्रयास करने से पहले ही दृश्य जानकारी को कैसे संभालती है। शोधकर्ताओं ने महसूस किया कि मानक विधियाँ अक्सर दूर की वस्तुओं को देखने में विफल रहती हैं क्योंकि छवि को सरल बनाने की प्रक्रिया दूर की चीजों के सूक्ष्म विवरणों को मिटा देती है। इसे ठीक करने के लिए, उन्होंने छवि की तीक्ष्णता (sharpness) को खोए बिना कैमरे के "दृश्य" (view) को विस्तारित करने की एक तकनीक पेश की। कल्पना कीजिए कि आप एक दूर स्थित पर्वत श्रृंखला को देख रहे हैं; एक मानक लेंस चोटियों को धुंधला कर सकता है, लेकिन यह नई विधि आसपास के विशाल स्थान को समझते हुए भी किनारों को स्पष्ट रखती है। यह प्रणाली को सड़क के अंत में चल रहे एक पैदल यात्री को ठीक उसी स्पष्टता के साथ पहचानने की अनुमति देता है जैसे कि कैमरे के ठीक सामने खड़े एक ट्रक को। इसके अलावा, प्रणाली एक ही समय में विभिन्न आकारों पर दृश्य देखने के लिए एक बहु-स्तरीय (multi-layered) दृष्टिकोण का उपयोग करती है, यह सुनिश्चित करती है कि एक छोटी साइकिल और एक बड़े बस दोनों को आवश्यक ध्यान दिया जाए। यह एक फ़िल्टरिंग तंत्र का भी उपयोग करती है जो पेड़ों या सड़क के निशानों जैसे पृष्ठभूमि के शोर को अनदेखा करना सीखता है, और केवल महत्वपूर्ण चलते हुए हिस्सों पर ध्यान केंद्रित करता है।

एक बार जब प्रणाली सफलतापूर्वक वस्तुओं को पृष्ठभूमि से अलग कर लेती है, तो वह दूसरे चरण की ओर बढ़ती है: पहचान। यहीं पर प्रणाली को अपनी अगली चुनौती का सामना करना पड़ता है, क्योंकि भीड़भाड़ वाला ट्रैफिक अक्सर अलग-अलग लोगों या वाहनों की रूपरेखा को आपस में छूते या ओवरलैप होते हुए दिखाता है, जिससे यह बताना कठिन हो जाता है कि एक कहाँ समाप्त होता है और दूसरा कहाँ शुरू होता है। यह मॉडल पहचाने गए पिंडों के आकार और संरचना को देखने के लिए बुद्धिमान जांच (intelligent checks) की एक श्रृंखला का उपयोग करके इस समस्या का समाधान करता है। यह एक व्यक्ति और एक साइकिल चालक के बीच अंतर कर सकता है, भले ही वे दिखने में बहुत समान हों, और यह उन छायाओं से होने वाले भ्रम को भी संभाल सकता है जो एक व्यक्ति को दो अलग-अलग संस्थाओं जैसा दिखा सकते हैं। प्रणाली प्रकाश के परिवर्तनों के अनुकूल भी होती है, यह सुनिश्चित करती है कि सुरंग से निकलकर धूप में आती हुई गाड़ी को भी सही ढंग से पहचाना जाए। इन उन्नत जांचों को जोड़कर, मॉडल अलग-अलग लोगों को एक समूह में मिलाने या किसी छोटी वस्तु को पूरी तरह से मिस करने की सामान्य गलती से बचता है।

जब शोधकर्ताओं ने सैकड़ों ट्रैफिक परिदृश्यों, जिसमें घनी भीड़ और बदलते मौसम की स्थिति शामिल थी, वाले डेटासेट पर अपने सिस्टम का परीक्षण किया, तो परिणाम आश्चर्यजनक थे। उनके सिमुलेशन में, मॉडल ने 98.63% की सटीकता दर हासिल की, जिसका अर्थ है कि उसने वाहनों, पैदल यात्रियों और साइकिल चालकों में से अधिकांश की सही पहचान की और उन्हें स्थित किया। इसने उच्च स्तर की शुद्धता (precision) भी बनाए रखी, जिसका स्कोर 98.56% था, जो दर्शाता है कि इसने शायद ही कभी किसी छाया को व्यक्ति या पेड़ को कार समझकर गलती की। सिस्टम ने मौजूद वस्तुओं को खोजने में बेहतर प्रदर्शन किया, जिसकी रिकॉल दर 98.6% थी, जो दर्शाता है कि इसने बहुत कम लक्ष्यों को छोड़ा। ये संख्याएँ अन्य अग्रणी मॉडलों की तुलना में काफी अधिक थीं जो वर्तमान में उपयोग में हैं, जो अक्सर इन्हीं जटिल स्थितियों के साथ संघर्ष करते हैं। नया सिस्टम कुशल भी साबित हुआ, जिसे अपने प्रतिस्पर्धियों की तुलना में कम कंप्यूटिंग शक्ति की आवश्यकता होती है, जो यह सुझाव देता है कि यह अंततः स्वायत्त कारों या ट्रैफिक मॉनिटरिंग स्टेशनों में पाए जाने वाले छोटे, तेज़ उपकरणों पर चल सकता है।

यह अध्ययन इस बात पर प्रकाश डालता है कि इस सफलता की कुंजी केवल एक शक्तिशाली उपकरण का उपयोग करना नहीं था, बल्कि कई विशिष्ट तकनीकों को बुनना था जो एक-दूसरे की कमजोरियों को ढक सकें। "परिप्रेक्ष्य संपीड़न" (perspective compression) और "मास्क कोलेसेंस" (mask coalescence) को संभालने की प्रणाली की क्षमता यह दर्शाती है कि मशीनों द्वारा ट्रैफिक को समझने के तरीके में यह एक महत्वपूर्ण प्रगति है। हालांकि शोधकर्ता नोट करते हैं कि उनका कार्य सिमुलेशन के माध्यम से किया गया था और एज डिवाइसेस (edge devices) पर वास्तविक दुनिया में तैनाती एक भविष्य का लक्ष्य है, परिणाम अधिक विश्वसनीय ट्रैफिक मॉनिटरिंग के लिए एक मजबूत आधार प्रदान करते हैं। कंप्यूटर को अराजक वातावरण में सूक्ष्म विवरणों को देखने में सक्षम बनाकर, यह कार्य हमें उस भविष्य के करीब लाता है जहाँ ट्रैफिक सिस्टम लोगों और वाहनों के जटिल प्रवाह के प्रति तुरंत और सटीक रूप से प्रतिक्रिया कर सकेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →