← नवीनतम पेपर
💻 computer science

Design of an Efficient Object Detection Algorithm for Traffic Accident Recognition

यह शोध पत्र SDD-YOLO11n का प्रस्ताव करता है, जो यातायात दुर्घटना पहचान के लिए एक हल्का ऑब्जेक्ट डिटेक्शन मॉडल है जो ShuffleNetV2 बैकबोन, एक DW_ADown मॉड्यूल और एक DS_SENetV2 मॉड्यूल को एकीकृत करता है ताकि मूल YOLO11n और अन्य मुख्यधारा के मॉडलों की तुलना में सटीकता और रियल-टाइम प्रदर्शन में सुधार करते हुए कम्प्यूटेशनल जटिलता को महत्वपूर्ण रूप से कम किया जा सके।

मूल लेखक: Yongping Zheng, Dianzheng Xu, Feng Li, Bingqiang Huang, Haoyu Pei, Zhihua Huang, Xinjian Xiang

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yongping Zheng, Dianzheng Xu, Feng Li, Bingqiang Huang, Haoyu Pei, Zhihua Huang, Xinjian Xiang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुरक्षा कैमरे का उपयोग करके एक व्यस्त राजमार्ग पर कार दुर्घटना को होते हुए देखना चाहते हैं। आपको चाहिए कि कैमरा इतना तेज़ हो कि घटना होते ही उसे तुरंत (रियल-टाइम में) पकड़ सके और इतना स्मार्ट हो कि वह बारिश, अंधेरे या अन्य कारों की भीड़ के बीच भी देख सके (सटीकता)।

समस्या यह है कि वर्तमान "सबसे स्मार्ट" कैमरे (जो YOLO11n नामक मॉडल पर आधारित हैं) एक बहुत ही बुद्धिमान लेकिन भारी जासूस की तरह हैं। वे बहुत सटीक हैं, लेकिन वे कारों या सड़क के खंभों के अंदर मौजूद छोटे, सस्ते कंप्यूटरों (एज डिवाइसेस) पर चलाने के लिए बहुत भारी और धीमे हैं। वे कभी-कभी तब भी दुर्घटनाओं को मिस कर देते हैं जब स्थितियाँ जटिल होती हैं, जैसे कि रात के समय या भारी ट्रैफिक में।

यह पेपर एक नए, हल्के जासूस SDD-YOLO11n से परिचित कराता है। लेखकों ने कैमरे के "दिमाग" को फिर से डिज़ाइन किया है ताकि इसे तेज़, छोटा और उतना ही स्मार्ट, या शायद उससे भी अधिक स्मार्ट बनाया जा सके। उन्होंने इसे तीन मुख्य अपग्रेडों का उपयोग करके किया है:

1. हल्का बैकबोन: ShuffleNetV2

उपमा: कल्पना कीजिए कि मूल कैमरे का दिमाग एक विशाल पुस्तकालय है जहाँ हर किताब को एक अकेले लाइब्रेरियन द्वारा पढ़ा जाता है। यह विस्तृत है, लेकिन धीमा है। लेखकों ने इसे ShuffleNetV2 से बदल दिया है, जो छोटे समूहों में काम करने वाली विशेषज्ञ लाइब्रेरियन की एक टीम की तरह है।

  • यह कैसे काम करता है: एक व्यक्ति द्वारा सब कुछ पढ़ने के बजाय, काम को विभाजित कर दिया जाता है। महत्वपूर्ण रूप से, वे एक "शफल" ट्रिक (चैनल शफल) का उपयोग करते हैं ताकि यह सुनिश्चित हो सके कि लाइब्रेरियन एक-दूसरे के साथ नोट्स साझा करें ताकि कोई भी जानकारी खो न जाए।
  • परिणाम: कैमरा बहुत तेज़ हो जाता है और बहुत कम ऊर्जा का उपयोग करता है, लेकिन यह दुर्घटना को खोजने की अपनी क्षमता नहीं खोता है।

2. स्मार्ट डाउनलोडर: DW_ADown

उपमा: जब एक कैमरा किसी दृश्य को देखता है, तो उसे अक्सर तेजी से प्रोसेस करने के लिए इमेज को सिकोड़ने की आवश्यकता होती है। पुराना तरीका एक फोटो की फोटोकॉपी करने और फिर उसके आधे पिक्सल को फेंक देने जैसा था, जिससे विवरण धुंधले हो जाते थे। नया DW_ADown मॉड्यूल एक स्मार्ट स्कैनर की तरह है जो महत्वपूर्ण विवरणों को फेंके बिना इमेज को कंप्रेस करता है।

  • यह कैसे काम करता है: यह एक विशेष प्रकार के फिल्टर (डेप्थवाइज कन्वोल्यूशन) का उपयोग करता है जो इमेज को बहुत ही कुशल तरीके से देखता है, जिससे डेटा का आकार छोटा करते हुए भी वस्तुओं के आकार और स्थान को सुरक्षित रखा जाता है।
  • परिणाम: इमेज को प्रोसेस करते समय कैमरा कम जानकारी खोता है, जिसका अर्थ है कि यह भारी ट्रैफिक या खराब मौसम जैसी कठिन स्थितियों में दुर्घटनाओं को पहचानने में बेहतर है।

3. फोकस एनहांसर: DS_SENetV2

उपमा: कल्पना कीजिए कि आप एक शोर वाले कमरे में एक व्यक्ति को बोलने की कोशिश कर रहे हैं। पुराना कैमरा सभी को समान रूप से सुन रहा था। नया DS_SENetV2 मॉड्यूल एक नॉइज़-कैंसलिंग हेडसेट की तरह है जो तुरंत पहचान लेता है कि कौन बोल रहा है और बैकग्राउंड के शोर को शांत करते हुए उनकी आवाज़ को बढ़ा देता है।

  • यह कैसे काम करता है: यह एक पुराने "पूलिंग" टूल को एक नई प्रणाली से बदल देता है जो यह सीखती है कि इमेज के कौन से हिस्से महत्वपूर्ण हैं (जैसे कि दुर्घटनाग्रस्त कार) और कौन से केवल बैकग्राउंड शोर (जैसे पेड़ या आकाश) हैं। यह दृश्य को एक साथ विभिन्न "कोणों" से देखने के लिए मल्टी-ब्रांच संरचना के साथ मिलकर काम करता है।
  • परिणाम: कैमरा जटिल दृश्यों में, विशेष रूप से बैकग्राउंड से दुर्घटना को अलग करने में बहुत बेहतर हो जाता है।

अंतिम स्कोरकार्ड

लेखकों ने इस नए "लाइटवेट डिटेक्टिव" का परीक्षण मूल भारी मॉडल और अन्य प्रसिद्ध मॉडलों के विरुद्ध किया। यहाँ उन्हें क्या मिला:

  • छोटा और हल्का: नया मॉडल मूल मॉडल की तुलना में आकार में 69% छोटा है और 65% कम कंप्यूटिंग पावर का उपयोग करता है। यह एक फुल-साइज़ SUV को कॉम्पैक्ट कार में बदलने जैसा है बिना उसके इंजन की शक्ति खोए।
  • तेज़ और स्मार्ट: छोटा होने के बावजूद, यह दुर्घटनाओं को पहचानने में वास्तव में 1.3% अधिक सटीक रहा।
  • रियल-टाइम के लिए तैयार: यह अभी भी लगभग 71 फ्रेम्स प्रति सेकंड प्रोसेस कर सकता है, जो दुर्घटनाओं को होते ही रियल-टाइम में पकड़ने के लिए पर्याप्त तेज़ है।

संक्षेप में: लेखकों ने एक शक्तिशाली लेकिन भारी ट्रैफिक एक्सीडेंट डिटेक्टर लिया, उसमें से अनावश्यक वजन हटा दिया, महत्वपूर्ण विवरणों को बनाए रखने के लिए स्मार्ट फिल्टर जोड़े, और इसे एक बेहतर फोकस तंत्र दिया। परिणाम एक ऐसा सिस्टम है जो छोटे उपकरणों (जैसे कारों में) पर फिट बैठता है लेकिन बड़े, भारी संस्करणों से बेहतर प्रदर्शन करता है, जो इसे दुर्घटनाओं को तेज़ी से और सटीकता से पहचानने के लिए एकदम सही बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →