← नवीनतम पेपर
💻 computer science

A Lightweight Small Object Detection Framework Based on Enhanced BiFPN and Attention Mechanisms

यह शोध पत्र ESW-YOLO का प्रस्ताव करता है, जो YOLO11n पर आधारित एक हल्का लघु-वस्तु पहचान ढांचा (lightweight small-object detection framework) है, जो डायनेमिक स्नेक कन्वोल्यूशन (Dynamic Snake Convolution), एक अतिरिक्त उच्च-रिज़ॉल्यूशन हेड और iEMA अटेंशन के साथ एक उन्नत BiFPN, और WIoU लॉस को एकीकृत करता है ताकि समान पैरामीटर संख्या बनाए रखते हुए छोटे और लंबे लक्ष्यों की पहचान सटीकता में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Kunpeng Feng, Weihua Bao

प्रकाशित 2026-09-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kunpeng Feng, Weihua Bao

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कंप्यूटर विज़न के विशाल परिदृश्य में, जहाँ मशीनें दुनिया को देखना सीखती हैं, एक निरंतर और जिद्दी चुनौती मौजूद है: छोटी चीजों को पहचानना। जबकि आधुनिक प्रणालियाँ किसी तस्वीर में कार या व्यक्ति को आसानी से पहचान सकती हैं, वे अक्सर तब लड़खड़ा जाती हैं जब लक्ष्य धूल का एक कण, बाल जैसी महीन दरार, या कोई दूर उड़ता हुआ विमान हो। यह कठिनाई इसलिए उत्पन्न होती है क्योंकि डीप लर्निंग सिस्टम, जो पैटर्न पहचानने के लिए मानव मस्तिष्क की क्षमता की नकल करते हैं, व्यापक आकृतियों को खोजने के लिए छवियों को क्रमिक रूप से छोटा करके काम करते हैं। सरलीकरण की इस प्रक्रिया में, एक छोटे ऑब्जेक्ट को बनाने वाले कुछ ही पिक्सेल गायब हो जाते हैं या इतने धुंधले हो जाते हैं कि वे उपयोगी नहीं रह जाते। इसके अलावा, ये सिस्टम किसी वस्तु को कितनी अच्छी तरह खोज पाए हैं, इसका निर्णय लेने के लिए जिन गणितीय नियमों का उपयोग करते हैं, वे अक्सर बड़ी और अधिक नियमित आकृतियों के लिए ट्यून किए जाते हैं, जिससे वे एक छोटे, लंबे धब्बे के मामले में अविश्वसनीय हो जाते हैं। इस समस्या को हल करना वास्तविक दुनिया की सुरक्षा और दक्षता के लिए महत्वपूर्ण है, चाहे वह निर्मित सर्किट बोर्डों की संरचनात्मक अखंडता सुनिश्चित करना हो या दूरस्थ परिदृश्यों में खतरों की निगरानी करना हो।

शंघाई यूनिवर्सिटी ऑफ इलेक्ट्रिक पावर के शोधकर्ताओं कुनपेंग फेंग और वेइहुआ बाओ ने इस समस्या के लिए एक नया दृष्टिकोण प्रस्तावित किया है, एक ऐसा सिस्टम बनाया है जिसे वे ESW-YOLO कहते हैं। YOLO11 के रूप में ज्ञात एक लोकप्रिय और कुशल डिटेक्शन फ्रेमवर्क पर आधारित, उनका कार्य विशेष रूप से इन मायावी छोटी वस्तुओं को पकड़ने के लिए डिज़ाइन किया गया है, जिसके लिए भारी कंप्यूटिंग शक्ति की आवश्यकता नहीं है। टीम ने केवल मौजूदा सेटिंग्स में बदलाव नहीं किया; उन्होंने मशीन के "दृष्टि" के तीन मुख्य हिस्सों को फिर से तैयार किया ताकि यह छोटे लक्ष्यों की अनूठी प्रकृति के अनुकूल हो सके। सबसे पहले, उन्होंने सिस्टम के छवि स्कैन करने के मानक तरीके को 'डायनामिक स्नेक कन्वोल्यूशन' नामक तकनीक से बदल दिया। एक पारंपरिक कैमरा लेंस के विपरीत जो पिक्सेल के एक निश्चित ग्रिड को देखता है, यह नई विधि सिस्टम को अपने फोकस को लचीला बनाने और मोड़ने की अनुमति देती है, जैसे कोई सांप किसी पथ का अनुसरण करता है, वस्तु की रूपरेखा (contours) का पता लगाता है। यह विशेष रूप से छोटे, पतले दोषों के लिए उपयोगी है जिन्हें एक कठोर, बॉक्स-नुमा स्कैन द्वारा अनदेखा किया जा सकता है।

दूसित, शोधकर्ताओं ने उस आंतरिक नेटवर्क को फिर से डिज़ाइन किया जो विभिन्न दृश्य सूचनाओं की परतों को जोड़ता है। मानक प्रणालियों में, उच्च-स्तरीय विवरणों को अक्सर निम्न-स्तरीय विवरणों के साथ इस तरह मिला दिया जाता है कि वे छोटे ऑब्जेक्ट्स के धुंधले संकेतों को मिटा सकते हैं। टीम ने एक नई संरचना पेश की, जिसे उन्होंने EBPN नाम दिया, जो विशेष रूप से छोटे लक्ष्यों के लिए एक समर्पित, उच्च-रिज़ॉल्यूशन वाली 'व्यूइंग लेयर' जोड़ता है। यह लेयर एक विशेष 'अटेंशन मैकेनिज्म' के साथ जुड़ी हुई है जो एक स्पॉटलाइट की तरह कार्य करती है, जिससे सिस्टम को बैकग्राउंड शोर को अनदेखा करते हुए सबसे प्रासंगिक विशेषताओं पर अधिक ध्यान केंद्रित करने के लिए मजबूर किया जाता है। अंत में, उन्होंने उस स्कोरिंग सिस्टम को बदल दिया जिसका उपयोग मशीन अपनी गलतियों से सीखने के लिए करती है। मूल सिस्टम एक ऐसे नियम का उपयोग करता था जो आकार के अनुपात के आधार पर त्रुटियों को दंडित करता था, एक ऐसा नियम जो अक्सर छोटे, खींचे हुए ऑब्जेक्ट्स के मामले में मशीन को भ्रमित कर देता था। शोधकर्ताओं ने इसे एक नए स्कोरिंग तरीके से बदल दिया जो इस बात पर ध्यान केंद्रित करता है कि पहचाना गया ऑब्जेक्ट उसके वास्तविक केंद्र से कितनी दूर है, जिससे सिस्टम को अपनी सटीकता सुधारने के लिए एक स्पष्ट और अधिक स्थिर मार्गदर्शन मिलता है।

जब दो अलग-अलग इमेज सेट पर परीक्षण किया गया—एक जिसमें सर्किट बोर्डों पर सूक्ष्म दोष थे और दूसरा जिसमें हवाई रिमोट सेंसिंग फोटो में छोटे मानव निर्मित ऑब्जेक्ट्स थे—तो नए सिस्टम ने प्रदर्शन में एक महत्वपूर्ण उछाल दिखाया। सर्किट बोर्ड डेटासेट पर, जहाँ दोष अक्सर एक दर्जन पिक्सेल से भी कम चौड़े थे, नए मॉडल ने अपने आधार मॉडल की तुलना में वस्तुओं को सही ढंग से पहचानने की क्षमता में 12.7 प्रतिशत अंक का सुधार किया। यह 20 प्रतिशत से अधिक के सापेक्ष सुधार का प्रतिनिधित्व करता है, जो एक ऐसा क्षेत्र है जहाँ प्रगति अक्सर एक प्रतिशत के अंशों में मापी जाती है। सिस्टम ने आंतरिक पैरामीटर्स की एक समान संख्या भी बनाए रखी, जिसका अर्थ है कि यह काफी भारी या चलाने के लिए जटिल नहीं हुआ, हालांकि अतिरिक्त उच्च-रिज़ॉल्यूशन विवरणों को प्रोसेस करने के लिए इसे थोड़ी अधिक कंप्यूटिंग शक्ति की आवश्यकता थी।

अध्ययन ने आगे खुलासा किया कि ये सुधार केवल अधिक भाग जोड़ने का परिणाम नहीं थे, बल्कि इस बात का परिणाम थे कि वे भाग एक साथ कैसे काम करते हैं। जब शोधकर्ताओं ने घटकों का व्यक्तिगत रूप से परीक्षण किया, तो उन्होंने पाया कि नया स्कोरिंग तरीका अकेले केवल एक मामूली बढ़ावा प्रदान करता है, और लचीली स्कैनिंग विधि वास्तव में अन्य अपग्रेड के बिना अकेले खराब प्रदर्शन करती है। यह केवल तभी हुआ जब लचीली स्कैनिंग, उच्च-रिज़ॉल्यूशन व्यूइंग लेयर और नई स्कोरिंग पद्धति को संयोजित किया गया, जब सिस्टम वास्तव में उत्कृष्ट प्रदर्शन करने लगा, और उसने उन बहुत बड़े और अधिक जटिल मॉडलों को भी पीछे छोड़ दिया जिनमें तीन से चार गुना अधिक आंतरिक पैरामीटर्स थे। रिमोट सेंसिंग परीक्षणों में, सिस्टम हवाई छवियों में 'प्लेग्राउंड्स' (खेल के मैदानों) की पहचान करने में विशेष रूप से सक्षम साबित हुआ, एक ऐसी श्रेणी जहाँ इसने अपने निकटतम प्रतिस्पर्धियों को बड़े अंतर से पछाड़ दिया, जो संभवतः उन विविध बनावटों और आकृतियों को संभालने की इसकी क्षमता के कारण था।

हालाँकि नया फ्रेमवर्क छोटे ऑब्जेक्ट्स को खोजने के लिए एक शक्तिशाली समाधान प्रदान करता है, शोधकर्ता एक समझौते (trade-off) को स्वीकार करते हैं। उच्च-रिज़ॉल्यूशन व्यूइंग लेयर को जोड़ने से कम्प्यूटेशनल लागत बढ़ गई, जिससे सिस्टम मोबाइल फोन या ड्रोन जैसे सीमित संसाधनों वाले उपकरणों पर चलाने में थोड़ा धीमा हो गया। हालाँकि, परिणाम बताते हैं कि उन अनुप्रयोगों के लिए जहाँ एक छोटे से दोष को चूकना महंगा या खतरनाक हो सकता है, यह अतिरिक्त लागत एक सार्थक निवेश है। यह कार्य मशीन विज़न को उन छोटे विवरणों के प्रति संवेदनशील बनाने के लिए एक स्पष्ट मार्ग प्रदान करता है जो मायने रखते हैं, यह सिद्ध करते हुए कि दुनिया को देखने के तरीके को अनुकूलित करके, हम उन चीजों को देख सकते हैं जो पहले अदृश्य थीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →