← नवीनतम पेपर
💻 computer science

GHD-DETR: Gated Hierarchical Dynamic Architecture for Object Detection Under Complex Imaging Conditions

यह शोध पत्र GHD-DETR का प्रस्ताव करता है, जो एक नवीन डिटेक्शन ट्रांसफार्मर आर्किटेक्चर है जिसमें GatedNestStage, BDB और HAGF मॉड्यूल शामिल हैं, जो जटिल इमेजिंग स्थितियों के तहत छोटे, अवरुद्ध और कम कंट्रास्ट वाले ऑब्जेक्ट्स के लिए ऑब्जेक्ट डिटेक्शन की मजबूती को महत्वपूर्ण रूप से बढ़ाने के लिए डिज़ाइन किया गया है, जिससे RTTS, HazyDet और DUO जैसे चुनौतीपूर्ण डेटासेट्स पर पर्याप्त प्रदर्शन सुधार प्राप्त हुआ है।

मूल लेखक: Zidian Wei, Wei Feng, Linghan Jiang, Zunwang Ke

प्रकाशित 2026-09-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zidian Wei, Wei Feng, Linghan Jiang, Zunwang Ke

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

स्वायत्त वाहन (ऑटोनॉमस व्हीकल) दुनिया को नेविगेट करने के लिए डिजिटल आँखों की एक जोड़ी पर निर्भर करते हैं, जो कारों, पैदल यात्रियों और साइकिल चालकों की पहचान करने के लिए लगातार सड़क को स्कैन करती रहती हैं। इन प्रणालियों को सुरक्षित रूप से कार्य करने के लिए, उन्हें पूर्ण सटीकता के साथ वस्तुओं को पहचानना चाहिए, भले ही दृश्य (व्यू) दोषपूर्ण हो। हालाँकि, वास्तविक दुनिया में, कैमरे का दृश्य अक्सर कोहरे, भारी बारिश या मटमैले पानी से बाधित होता है, जो प्रकाश को बिखेर देते हैं और रंगों को धुंधला कर देते हैं। जब कोई छवि धुंधली या अस्पष्ट हो जाती है, तो वाहन या व्यक्ति को परिभाषित करने वाले सूक्ष्म किनारे (एजेस) मिटने लगते हैं, जिससे मानक कंप्यूटर विज़न सॉफ़्टवेयर के लिए यह बताना कठिन हो जाता है कि एक वस्तु कहाँ समाप्त होती है और पृष्ठभूमि कहाँ से शुरू होती है। यह केवल खराब पिक्चर क्वालिटी का मामला नहीं है; यह एक गंभीर सुरक्षा विफलता है। यदि एक स्वयं-चालित कार कोहरे के ढेर से पैदल यात्री के बीच अंतर नहीं कर पाती है, तो इसके परिणाम विनाशकारी हो सकते हैं। शोधकर्ता लंबे समय से ऐसे डिटेक्शन सिस्टम बनाने की कोशिश कर रहे हैं जो न केवल बेहतर देख सकें, बल्कि बेहतर समझ भी सकें, भले ही दृश्य जानकारी विकृत और अधूरी हो।

झिंजियांग विश्वविद्यालय के शोधकर्ताओं की एक टीम ने विशेष रूप से इस समस्या को हल करने के लिए एक नया सिस्टम विकसित किया है जो धुंधलेपन के माध्यम से स्पष्ट देखने में सक्षम है। वे अपनी इस रचना को GHD-DETR कहते हैं, जो एक परिष्कृत आर्किटेक्चर है जो विजुअल डेटा के लिए एक मजबूत फिल्टर के रूप में कार्य करता है, जिससे कंप्यूटर उन स्थितियों में वस्तुओं का पता लगा पाता है जहाँ पारंपरिक तरीके अक्सर विफल हो जाते हैं। इस सिस्टम का परीक्षण तीन अलग-अलग और चुनौतीपूर्ण वातावरणों के विरुद्ध किया गया था: वास्तविक दुनिया के कोहरे वाले ट्रैफिक दृश्य, ड्रोन द्वारा कैप्चर किए गए घने शहरी कोहरे, और मटमैले पानी के फुटेज जहाँ दृश्यता गंभीर रूप से सीमित है। हर मामले में, नए सिस्टम ने मौजूदा तरीकों को पछाड़ दिया, जिससे उन वस्तुओं के आकार और स्थिति को पुनः प्राप्त करने की महत्वपूर्ण क्षमता प्रदर्शित हुई जो पहले धुंध में खो गए थे।

इस सफलता का मूल आधार यह है कि सिस्टम सूचना को कैसे संसाधित (प्रोसेस) करता है। मानक डिटेक्शन टूल्स अक्सर छवि के सभी हिस्सों के साथ समान व्यवहार करते हैं, जिससे शोर (नॉइज़) और धुंधलेपन की उपस्थिति में वे भ्रमित हो जाते हैं। हालाँकि, नया दृष्टिकोण एक विशेष संरचना का उपयोग करता है जो एक बहु-स्तरीय छलनी की तरह कार्य करती है। यह पहले छवि को विभिन्न आकारों में तोड़ देता है ताकि बड़े आकार और सूक्ष्म विवरण दोनों को पकड़ा जा सके। इस संरचना के भीतर, 'GatedNestStage' नामक एक घटक एक द्वारपाल (गेटकीपर) के रूप में कार्य करता है। यह आने वाले विजुअल डेटा का परीक्षण करता है और निर्णय लेता है कि कौन से हिस्से उपयोगी हैं और कौन से केवल मौसम के कारण उत्पन्न हुआ शोर हैं। विजुअल स्टैटिक को फ़िल्टर करके और वस्तु के महत्वपूर्ण किनारों को सुरक्षित रखकर, यह सुनिश्चित करता है कि सिस्टम केवल उस जानकारी पर ध्यान केंद्रित करे जो पहचान के लिए आवश्यक है।

एक बार जब सिस्टम उपयोगी विशेषताओं (फीचर्स) को अलग कर लेता है, तो उसे दृश्य की एक पूर्ण तस्वीर बनाने के लिए उन्हें संयोजित करना होता है। यहीं पर दूसरा नवाचार काम आता है। शोधकर्ताओं ने एक मॉड्यूल पेश किया है जो प्रोसेसिंग को दो समानांतर पथों (पैरेलल पाथ) में विभाजित करता है। एक पथ सामान्य संदर्भ को समझने के लिए बड़े चित्र (बिग पिक्चर) को देखता है, जबकि दूसरा पथ सूक्ष्म, स्थानीय विवरणों को पकड़ने के लिए ज़ूम इन करता है जो अक्सर कोहरे में खो जाते हैं। सूचना के ये दो स्ट्रीम फिर इस तरह से आपस में मिला दिए जाते हैं जो यह सुनिश्चित करता है कि सिस्टम वस्तु की सीमा की तीक्ष्णता (शार्पनेस) को खोए बिना उसके समग्र आकार को समझ सके। यह द्वि-पथ दृष्टिकोण सिस्टम को कम कंट्रास्ट और धुंधलेपन से भ्रमित होने से रोकता है जो आमतौर पर कोहरे वाले या पानी के नीचे के चित्रों में व्याप्त होता है।

पहेली का अंतिम हिस्सा एक तंत्र (मैकेनिज्म) है जो यह तय करता है कि इन विभिन्न परतों की सूचना को एक साथ कैसे मिलाया जाए। कई प्रणालियों में, केवल डेटा की परतों को स्टैक करने से एक धुंधला परिणाम मिल सकता है जहाँ महत्वपूर्ण विवरण दब जाते हैं। नया सिस्टम एक डायनेमिक फ्यूजन विधि का उपयोग करता है जो संयोजन के दौरान प्रत्येक सूचना के महत्व को तौलता है। यह एक कुशल संपादक की तरह कार्य करता है, जो ठीक जानता है कि कब कार के उच्च-स्तरीय आकार पर जोर देना है और कब पैदल यात्री के कपड़ों की विशिष्ट बनावट (टेक्सचर) को उजागर करना है। यह सुनिश्चित करता है कि अंतिम आउटपुट, मूल छवि कितनी भी विकृत क्यों न रही हो, वस्तु की एक स्पष्ट और आत्मविश्वासपूर्ण पहचान हो।

शोधकर्ताओं ने अपनी प्रणाली की सार्थकता सिद्ध करने के लिए तीन कठिन डेटासेट्स पर परीक्षण किया। पहले सेट में भारी कोहरे में ट्रैफिक की 4,000 से अधिक वास्तविक दुनिया की छवियां शामिल थीं, जहाँ दृश्यता अक्सर कुछ मीटर तक ही सीमित होती है। दूसरे सेट में घने कोहरे से ढके शहरों की हजारों ड्रोन-कैप्चर की गई छवियां शामिल थीं, जिनमें छोटे वाहन शामिल थे जिन्हें पहचानना विशेष रूप से कठिन होता है। तीसरे सेट में पानी के नीचे की छवियां शामिल थीं, जहाँ पानी स्वयं रंगों को विकृत करता है और सीमाओं को अस्पष्ट करता है। कोहरे वाले ट्रैफिक टेस्ट में, नए सिस्टम ने पिछले सर्वश्रेष्ठ तरीके की तुलना में कारों का पता लगाने की सटीकता में 12 प्रतिशत अंकों से अधिक का सुधार किया। बसों के लिए, सुधार और भी नाटकीय था, जो लगभग 30 प्रतिशत अंक उछल गया। घने कोहरे वाले परिदृश्यों में, सिस्टम ने 9 प्रतिशत अंकों से अधिक का समग्र सुधार दिखाया, और पानी के नीचे के परीक्षणों में, इसने अभी भी सटीकता में 4 प्रतिशत से अधिक का सुधार किया।

ये परिणाम संकेत देते हैं कि यह सिस्टम केवल एक मामूली सुधार नहीं है, बल्कि तनावपूर्ण स्थितियों में मशीनों के दुनिया को समझने के तरीके में एक मौलिक बदलाव है। कोहरे और पानी प्रकाश को किस तरह विकृत करते हैं, इसे विशेष रूप रूप से संभालने के लिए अपने आर्किटेक्चर को डिजाइन करके, शोधकर्ताओं ने एक ऐसा उपकरण बनाया है जो अपने पूर्ववर्तियों की तुलना में कहीं अधिक लचीला है। सिस्टम कोहरे को साफ करने या पानी को साफ करने की कोशिश नहीं करता है; इसके बजाय, यह दृश्य के भीतर वस्तुओं की संरचनात्मक अखंडता (स्ट्रक्चरल इंटीग्रिटी) पर ध्यान केंद्रित करके विरूपण के माध्यम से देखना सीखता है। यह दृष्टिकोण सुझाव देता है कि प्रतिकूल मौसम में स्वायत्त ड्राइविंग का भविष्य बेहतर कैमरों पर नहीं, बल्कि उन अपूर्ण छवियों की व्याख्या करने के स्मार्ट तरीकों पर निर्भर करेगा जिन्हें वे कैमरे कैप्चर करते हैं। यह कार्य पुष्टि करता है कि सही डिज़ाइन के साथ, मशीनें अपनी स्थितिजन्य जागरूकता (सिचुएशनल अवेयरनेस) बनाए रख सकती हैं, भले ही उनके आसपास की दुनिया को देखना कठिन हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →