← नवीनतम पेपर
💻 computer science

DMFNet: Dual-Backbone Multiscale Fusion Network for Urban Scene Classification

यह शोध पत्र DMFNet को प्रस्तुत करता है, जो रेसिडुअल प्रोपेगेशन और स्पेशियल अटेंशन द्वारा संवर्धित एक डुअल-बैकबोन मल्टीस्केल फ्यूजन नेटवर्क है, जो शहरी दृश्य वर्गीकरण में इंट्रा-क्लास वेरिएबिलिटी और इंटर-क्लास सिमिलैरिटी की चुनौतियों को प्रभावी ढंग से संबोधित करके AID डेटासेट पर अत्याधुनिक सटीकता प्राप्त करता है।

मूल लेखक: Anamitra Ghosh, Abhiroop Chatterjee, Susmita Ghosh

प्रकाशित 2026-07-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anamitra Ghosh, Abhiroop Chatterjee, Susmita Ghosh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विमान से शहर की एक विशाल, उच्च-रिज़ॉल्यूशन वाली तस्वीर देख रहे हैं। एक इंसान के लिए, एक व्यस्त हवाई अड्डे, एक शांत जंगल या घरों के समूह के बीच अंतर पहचानना आसान है। लेकिन एक कंप्यूटर के लिए, यह एक अराजक पहेली है। कंप्यूटर लाखों छोटे रंगीन बिंदुओं को देखता है, लेकिन उसे "बड़ी तस्वीर" समझने में संघर्ष करना पड़ता है। यही रिमोट सेंसिंग सीन क्लासिफिकेशन (दूरस्थ संवेदन दृश्य वर्गीकरण) की दुनिया है: कंप्यूटर को हवाई तस्वीरों को देखना और यह कहना सिखाना कि, "आह, वह एक जंगल है!" या "वह एक औद्योगिक क्षेत्र है!"

लंबे समय तक, कंप्यूटरों ने केवल एक "लेंस" के माध्यम से छवि को देखकर या सब कुछ समझने के लिए एक एकल, विशाल मस्तिष्क (एक न्यूरल नेटवर्क) का उपयोग करके इसे हल करने की कोशिश की। लेकिन वास्तविक जीवन अव्यवly (messy) है। एक जंगल सुबह में दोपहर की तुलना में अलग दिखता है; एक आवासीय क्षेत्र दूर से देखने पर एक पार्क जैसा लग सकता है। एक एकल लेंस अक्सर सूक्ष्म विवरणों (जैसे छत का आकार) या बड़े संदर्भ (जैसे पूरे पड़ोस का लेआउट) को चूक जाता है। वैज्ञानिकों के लिए चुनौती एक ऐसा कंप्यूटर सिस्टम बनाने की है जो एक ही समय में कई कोणों से एक छवि को देख सके, उन दृश्यों को संयोजित कर सके, और सही उत्तर प्राप्त करने के लिए भ्रमित करने वाले बैकग्राउंड शोर को अनदेखा कर सके।

यहाँ DMFNet आता है, जो जादवपुर विश्वविद्यालय के शोधकर्ताओं अनमित्रा घोष, अभिरूप चटर्जी और सुस्मिता घोष द्वारा प्रस्तावित एक नया दृष्टिकोण है। आप DMFNet को एक अकेले अन्वेषक के बजाय एक जासूसी टीम के रूप में देख सकते हैं। एक एकल मस्तिष्क पर निर्भर रहने के बजाय, यह प्रणाली समानांतर में काम करने वाले दो अलग-अलग "बैकबोन" (या विशेषज्ञ मस्तिष्क) का उपयोग करती है। एक विशेषज्ञ, जिसे ConvNeXt-Tiny कहा जाता है, दृश्य की बड़ी कहानी और सामान्य संदर्भ को समझने में माहिर है। दूसरा विशेषज्ञ, EfficientNet-B1, एक पैनी नज़र रखने वाला पर्यवेक्षक है जो सड़क की बनावट या इमारत के विशिष्ट आकार जैसे सूक्ष्म, बारीक विवरणों को नोटिस करता है।

जादू तब होता है जब ये दोनों विशेषज्ञ एक-दूसरे से बात करते हैं। कई पुराने सिस्टमों में, विशेषज्ञ अलग-थलग काम करते थे, या वे अपने नोट्स को अनाड़ी तरीके से मिलाने की कोशिश करते थे। DMFNet एक चतुर मल्टीस्केल फ्यूजन (बहु-स्तरीय संलयन) रणनीति का उपयोग करता है। कल्पना कीजिए कि दो विशेषज्ञ विवरण के विभिन्न स्तरों पर नोट्स एक-दूसरे को पास कर रहे हैं। वे एक "रेसिड्यूअल प्रोपेगेशन" (अवशिष्ट प्रसार) विधि का उपयोग करते हैं, जो एक रिले रेस की तरह है जहाँ बैटन (सूचना) को लाइन में नीचे की ओर पास किया जाता है, लेकिन धावक जो उसने अभी देखा है उसकी एक प्रति भी अपने पास रखता है ताकि कुछ भी खो न जाए। यह सुनिश्चित करता है कि पैनी नज़र वाले विशेषज्ञ के सूक्ष्म विवरण और संदर्भ विशेषज्ञ की बड़ी तस्वीर आपस में पूरी तरह से मिल जाएं।

लेकिन दो विशेषज्ञों के होने के बावजूद, अभी भी बहुत अधिक शोर है। हवाई तस्वीरों में अक्सर भ्रमित करने वाले बैकग्राउंड होते हैं जो कंप्यूटर को विचलित करते हैं। इसे ठीक करने के लिए, DMFNet एक स्पेशियल अटेंशन मॉड्यूल (स्थानिक ध्यान मॉड्यूल) जोड़ता है। इसे एक स्पॉटलाइट की तरह समझें। एक बार जब दोनों विशेषज्ञ अपने नोट्स को संयोजित कर लेते हैं, तो यह स्पॉटलाइट छवि के सबसे महत्वपूर्ण हिस्सों पर—जैसे कि हवाई अड्डे के केंद्र या जंगल के घने पेड़ों पर—चमकती है और बाकी हिस्सों को धुंधला कर देती है। यह कंप्यूटर को बताता है, "धुंधले किनारों को अनदेखा करें; बस यहाँ ध्यान केंद्रित करें।"

यह सुनिश्चित करने के लिए कि यह टीम प्रभावी ढंग से सीखे, शोधकर्ताओं ने एक विशेष दो-चरणीय प्रशिक्षण रणनीति का उपयोग किया। पहले, उन्होंने दोनों विशेषज्ञ मस्तिष्क को "फ्रीज" कर दिया (उनके मूल ज्ञान को बरकरार रखते हुए), और केवल उस नए "गोंद" (glue) को प्रशिक्षित किया जो उन्हें एक साथ जोड़ता है। यह सिस्टम को शुरुआत में ही भ्रमित होने से रोकता है। एक बार जब गोंद सेट हो गया, तो उन्होंने विशेषज्ञों की गहरी परतों को विशेष रूप से इन हवाई तस्वीरों के लिए उनकी समझ को बेहतर बनाने के लिए धीरे से "अनफ्रीज" कर दिया। यह दो अनुभवी शेफ को काम पर रखने जैसा है, उन्हें पहले सामग्री का स्वाद लेने देना, और फिर उनके विशिष्ट व्यंजनों को ट्यून करना जब वे उस फ्लेवर प्रोफाइल को जान जाते हैं जिसका वे लक्ष्य रख रहे हैं।

जब टीम ने AID डेटासेट पर DMFNet का परीक्षण किया, जो 30 विभिन्न प्रकार के दृश्यों (हवाई अड्डों से लेकर कृषि भूमि तक) को कवर करने वाली 10,000 उच्च-रिज़ॉल्यूशन वाली हवाई छवियों का एक प्रसिद्ध संग्रह है), तो परिणाम प्रभावशाली थे। एक विभाजन का उपयोग करते हुए जहाँ आधी छवियां प्रशिक्षण के लिए थीं और आधी परीक्षण के लिए, सिस्टम ने 97.46% ± 0.14% की औसत सटीकता हासिल की। इसका मतलब है कि इसने लगभग हर एक परीक्षण मामले में दृश्य प्रकार की सही पहचान की, और विभिन्न रन के बीच बहुत कम भिन्नता देखी गई।

शोधकर्ताओं ने यह साबित करने के लिए प्रयोगों की एक श्रृंखला भी चलाई कि उनके डिज़ाइन का प्रत्येक हिस्सा मायने रखता है। उन्होंने पाया कि केवल एक बैकबोन (या तो अकेले ConvNeXt या EfficientNet) का उपयोग करने से सटीकता काफी गिर जाती है (क्रमशः लगभग 95.12% और 94.85% तक)। मल्टीस्केल फ्यूजन जोड़ने से यह बढ़कर 96.91% हो गई, और स्पेशियल अटेंशन स्पॉटलाइट जोड़ने से यह 97.24% तक पहुँच गई। पूर्ण सिस्टम, जिसमें सभी घटक और डेटा ट्रिक्स शामिल थे, शीर्ष स्कोर तक पहुँचा। जबकि GMFANet नामक एक अन्य विधि ने एक अलग अध्ययन में थोड़ा अधिक अंक दिखाया, लेखक नोट करते हैं कि DMFNet बहुत स्थिर और विश्वसनीय प्रदर्शन प्रदान करता है, जिससे यह जटिल दृश्य पहेलियों को हल करने के लिए एक मजबूत दावेदार बन जाता है।

संक्षेप में, DMFNet सुझाव देता है कि दो अलग-अलग प्रकार के AI विशेषज्ञों को जोड़कर, उन्हें कई स्तरों पर जानकारी साझा करने देकर, और महत्वपूर्ण चीज़ों पर ध्यान केंद्रित करने के लिए एक स्पॉटलाइट का उपयोग करके, हम कंप्यूटर को ऊपर से हमारे विश्व को उल्लेखनीय सटीकता के साथ समझने में सक्षम बना सकते हैं। लेखक निष्कर्ष निकालते हैं कि हालांकि यह एक मजबूत कदम है, फिर भी भविष्य के उपयोग के लिए इन प्रणालियों को और अधिक हल्का और तेज़ बनाने की गुंजाइश है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →