← नवीनतम पेपर
💻 computer science

YOLO-MAG: An edge-preserving and bilateral dual-gated YOLO11 network for small object detection in UAV aerial imagery

यह शोध पत्र YOLO-MAG का प्रस्ताव करता है, जो एक उन्नत YOLO11-आधारित नेटवर्क है जिसमें एज-प्रिजर्विंग मॉड्यूल, हाइब्रिड अटेंशन मैकेनिज्म और एक द्विपक्षीय ड्यूल-गेटेड फ्यूजन पिरामिड शामिल है, जो कम रिज़ॉल्यूशन और जटिल पृष्ठभूमि जैसी चुनौतियों को कम करके UAV हवाई इमेजरी में छोटे ऑब्जेक्ट डिटेक्शन की सटीकता और रियल-टाइम प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Ruiqing Zhang, Hongtian Zhang, Tiezhu Li

प्रकाशित 2026-09-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruiqing Zhang, Hongtian Zhang, Tiezhu Li

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

ड्रोन ने ऊपर से दुनिया को देखने के हमारे तरीके को बदल दिया है, जिससे आकाश अवलोकन के लिए एक नया मोर्चा बन गया है। चाहे यातायात की निगरानी करना हो, वन्यजीवों को ट्रैक करना हो, या संकट में फंसे लोगों की तलाश करना हो, ये उड़ने वाले कैमरे कैप्चर की गई छवियों में वस्तुओं की पहचान करने के लिए कंप्यूटर पर निर्भर करते हैं। हालांकि, ऊंचाई से छोटी चीजों को देखना एक कठिन कार्य है। जब कोई कार या व्यक्ति एक विशाल परिदृश्य में पिक्सेल के एक छोटे से समूह के रूप में दिखाई देता है, तो कंप्यूटर उन्हें पृष्ठभूमि (बैकग्राउंड) से अलग करने में संघर्ष करता है। जब छवि को प्रोसेस किया जाता है, तो इन छोटी वस्तुओं के किनारे अक्सर धुंधले हो जाते हैं, और आकारों की अत्यधिक विविधता और वातावरण की अव्यवस्था मानक पहचान प्रणालियों को भ्रमित कर सकती है। ड्रोन के वास्तव में प्रभावी होने के लिए, उनकी "आंखें" शोर (नॉइज़) में खोए बिना इन सूक्ष्म विवरणों को पहचानने के लिए पर्याप्त तेज होनी चाहिए।

शोधकर्ताओं ने इस समस्या को हल करने के लिए एक नया दृष्टिकोण विकसित किया है, जो विशेष रूप से ड्रोन फुटेज में छोटी वस्तुओं को खोजने के लिए डिज़ाइन किया गया एक सिस्टम बनाया है। टीम ने, जिसका नेतृत्व येलो रिवर कंजर्वेंसी टेक्निकल यूनिवर्सिटी और हेनान यूनिवर्सिटी के वैज्ञानिकों ने किया था, YOLO11 नामक एक मौजूदा, अत्यधिक कुशल डिटेक्शन फ्रेमवर्क पर काम किया। जबकि मूल प्रणाली तेज़ और सक्षम है, यह छवि का विश्लेषण करते समय छोटे लक्ष्यों की नाजुक रूपरेखाओं को खो देती है, ठीक वैसे ही जैसे एक स्केच बहुत तेज़ी से बनाए जाने पर अपनी महीन रेखाओं को खो सकता है। शोधकर्ताओं का लक्ष्य उन महत्वपूर्ण किनारों को सुरक्षित रखना था और साथ ही उस दृश्य अव्यवस्था को फ़िल्टर करना था जो अक्सर छोटे लक्ष्यों को छिपा देती है। उन्होंने नेटवर्क की संरचना में तीन विशिष्ट सुधारों को बुनकर इसे हासिल किया, जिसके परिणामस्वरूप एक नया मॉडल बना जिसे वे YOLO-MAG कहते हैं।

पहला प्रमुख परिवर्तन वस्तुओं के किनारों की सुरक्षा पर केंद्रित है। मानक इमेज प्रोसेसिंग में, जैसे-जैसे कंप्यूटर बड़े चित्र को समझने के लिए ज़ूम आउट करता है, छोटी वस्तुओं के सूक्ष्म विवरण अक्सर फीके पड़ जाते हैं। नया सिस्टम एक विशेष मॉड्यूल पेश करता है जो इन सीमाओं के लिए एक सुरक्षा कवच की तरह कार्य करता है। किनारे की जानकारी को कम होने देने के बजाय, यह मॉड्यूल विश्लेषण के प्रत्येक चरण में वस्तुओं की रूपरेखा को सक्रिय रूप से निकालता और मजबूत करता है। यह सुनिश्चित करता है कि भले ही कोई वस्तु बहुत छोटी और दूर हो, उसका आकार कंप्यूटर के लिए स्पष्ट और पहचानने योग्य बना रहे, जिससे उसे आसपास की पृष्ठभूमि द्वारा निगला न जा सके।

दृश्य की जटिलता को संभालने के लिए, शोधकर्ताओं ने यह भी सुधार किया कि सिस्टम छवि के विभिन्न हिस्सों पर कैसे ध्यान देता है। छोटी वस्तुएं अक्सर समूहों में दिखाई देती हैं या भ्रमित करने वाले पैटर्न से घिरी होती हैं, जिससे यह बताना मुश्किल हो जाता है कि एक वस्तु कहाँ समाप्त होती है और दूसरी कहाँ शुरू होती है। नया डिज़ाइन छवि को देखने के दो अलग-अलग तरीकों को जोड़ता है: एक जो तत्काल स्थानीय विवरणों पर ध्यान केंद्रित करता है और दूसरा जो व्यापक संदर्भ को समझता है। इन दोनों दृष्टिकोणों को मिलाकर, सिस्टम वस्तुओं और उनके परिवेश के बीच के संबंध को बेहतर ढंग से समझ सकता है। यह इसे बिना अधिक कंप्यूटिंग शक्ति की आवश्यकता के, भीड़भाड़ वाली सड़क में एक छोटे वाहन या खेत में एक व्यक्ति को अधिक सटीकता से पहचानने की अनुमति देता है।

पहेली का अंतिम हिस्सा इसमें शामिल है कि सिस्टम उसके विश्लेषण के विभिन्न स्तरों से जानकारी को कैसे जोड़ता है। कल्पना कीजिए कि एक नेटवर्क को एक ही समय में एक दृश्य का धुंधला, विस्तृत दृश्य और एक स्पष्ट, क्लोज-अप दृश्य प्राप्त होता है। नया आर्किटेक्चर यह तय करने के लिए एक 'डुअल-गेटिंग मैकेनिज्म' का उपयोग करता है कि इस जानकारी के कौन से हिस्से उपयोगी हैं। यह एक परिष्कृत फिल्टर की तरह कार्य करता है जो स्पष्ट, महत्वपूर्ण विवरणों के लिए द्वार खोलता है और बैकग्राउंड शोर और अप्रासंगिक अव्यवस्था के लिए द्वार बंद करता है। यह सुनिश्चित करता है कि किसी वस्तु के क्या होने और उसके स्थान पर अंतिम निर्णय सबसे मजबूत, सबसे प्रासंगिक साक्ष्य पर आधारित हो, न कि वातावरण की दृश्य अराजकता से भ्रमित होकर।

वास्तविक दुनिया के डेटासेट पर परीक्षण किया गया जिसमें हजारों ड्रोन छवियां शामिल थीं, नए सिस्टम ने प्रदर्शन में एक महत्वपूर्ण उछाल प्रदर्शित किया। ड्रोन विजन का मूल्यांकन करने के लिए उपयोग किए जाने वाले एक मानक बेंचमार्क पर, बेहतर मॉडल ने मूल, बिना संशोधित प्रणाली की तुलना में लगभग सात प्रतिशत अधिक सफलता दर के साथ छोटी वस्तुओं का पता लगाया। इसने उच्च स्तर की सटीकता भी बनाए रखी, भले ही सही पहचान के मानदंड सख्त किए गए थे। इन लाभों के बावजूद, सिस्टम वास्तविक समय में छवियों को प्रोसेस करने के लिए पर्याप्त तेज़ बना रहा, जो आधुनिक हार्डवेयर पर प्रति सेकंड एक सौ से अधिक फ्रेम का विश्लेषण करने में सक्षम है। यह गति ड्रोनों के लिए अत्यंत महत्वपूर्ण है, जिन्हें अक्सर उड़ान के दौरान पलक झपकते ही निर्णय लेने की आवश्यकता होती है।

शोधकर्ताओं ने सिस्टम का परीक्षण छवियों के एक अलग सेट पर भी किया ताकि यह सुनिश्चित किया जा सके कि यह व्यस्त शहर की सड़कों से लेकर खुले रास्तों तक विभिन्न वातावरणों को संभाल सके। परिणाम सुसंगत थे, जिससे पता चला कि सुधारों ने सिस्टम को नई स्थितियों में अच्छी तरह से ढलने में मदद की। अध्ययन बताता है कि किनारों के विवरणों को संरक्षित करने, अटेंशन मैकेनिज्म को मिलाने और शोर को अधिक प्रभावी ढंग से फ़िल्टर करने पर ध्यान केंद्रित करके, ड्रोन विजन को बहुत अधिक विश्वसनीय बनाना संभव है। यह प्रगति उन अनुप्रयोगों के लिए एक आशाजनक मार्ग प्रदान करती है जहाँ छोटी, दूर की वस्तुओं को पहचानना महत्वपूर्ण है, जैसे कि आपातकालीन बचाव कार्यों से लेकर स्वचालित यातायात निगरानी तक, यह सुनिश्चित करते हुए कि ऊपर से दिखने वाला दृश्य यथासंभव स्पष्ट और उपयोगी हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →