← नवीनतम पेपर
💻 computer science

AI for Maritime Security: Comparative Evaluation of Convolutional Neural Network and Vision Transformer Architectures for Maritime Object Detection

यह अध्ययन विविध मौसम की स्थितियों में समुद्री वस्तु पहचान के लिए छह डीप लर्निंग आर्किटेक्चर का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि विजन ट्रांसफॉर्मर (ViT) मॉडल सीएनएन-आधारित विकल्पों की तुलना में 100% सटीकता, सबसे कम त्रुटि दर और सबसे तेज़ प्रसंस्करण गति प्राप्त करके बेहतर प्रदर्शन करता है, जिससे एआई-संचालित समुद्री सुरक्षा और निगरानी को बढ़ाने की इसकी क्षमता उजागर होती है।

मूल लेखक: Ismet Gocer, Zakirul Bhuiyan, Shakeel Ahmad, Raza Hasan

प्रकाशित 2026-06-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ismet Gocer, Zakirul Bhuiyan, Shakeel Ahmad, Raza Hasan

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि महासागर एक विशाल, व्यस्त हाईवे है जहाँ जहाज कारों की तरह हैं। कभी-कभी, बुरे तत्व कोहरे में छिपकर या संदिग्ध व्यवहार करके चुपके से निकलने की कोशिश करते हैं। इस हाईवे को सुरक्षित रखने के लिए, हमें ऐसी आँखों की आवश्यकता है जो कभी पलकें न झपकाएं। यह शोध पत्र उन "सुपर-आँखों" को बनाने के बारे में है जो आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करके जहाजों को स्वचालित रूप से पहचान सकें, यहाँ तक कि खराब मौसम, बारिश या कोहरे में भी।

साउथैम्प्टन सोलेंट यूनिवर्सिटी के शोधकर्ताओं ने एक सुरक्षा कैमरा सिस्टम के लिए अलग-अलग ब्लूप्रिंट का परीक्षण करने वाले वास्तुकारों (Architects) की तरह काम किया। उन्होंने केवल एक कैमरा नहीं बनाया; उन्होंने छह अलग-अलग "मस्तिष्क" प्रणालियाँ (जिन्हें मॉडल कहा जाता है) बनाईं ताकि यह देख सकें कि 6,468 तस्वीरों के समुद्र में से जहाज खोजने में सबसे अच्छा कौन है।

यहाँ उनके प्रयोग का सरल उपमाओं (analogies) के साथ विवरण दिया गया है:

छह दावेदार (मस्तिष्क)

शोधकर्ताओं ने छह अलग-अलग प्रकार के AI मस्तिष्क का परीक्षण किया यह देखने के लिए कि कौन जहाजों को सबसे अच्छी तरह खोज सकता है:

  1. DIY कस्टम बिल्ड (Base CNN): कल्पना कीजिए कि एक छात्र अपने स्वयं के निर्देशों का उपयोग करके शून्य से एक रोबोट बनाता है। यह लचीला है और वे जानते हैं कि उसका हर गियर कैसे काम करता है, लेकिन यह कारखाने में बनी मशीन की तरह बहुत अधिक पॉलिश किया हुआ नहीं हो सकता है।
  2. "ग्रेजुएट स्टूडेंट" टीम (ट्रांसफर लर्निंग मॉडल्स): शून्य से शुरुआत करने के बजाय, शोधकर्ताओं ने चार पूर्व-प्रशिक्षित विशेषज्ञों को लिया जिन्होंने पहले ही लाखों वस्तुओं (जैसे बिल्ली, कुत्ते और कारों) को पहचानना सीख लिया था और उन्हें जहाजों को देखने के लिए सिखाया।
    • Xception और VGG16: ये हेवीवेट बॉक्सर की तरह हैं। वे बहुत मजबूत और विस्तृत हैं लेकिन बहुत अधिक वजन (डेटा) ले जाते हैं, जिससे वे थोड़े धीमे हो जाते हैं।
    • MobileNetV2: यह एक मैराथन धावक है। यह बहुत हल्का और तेज़ है, छोटे उपकरणों (जैसे ड्रोन या छोटी नाव के कंप्यूटर) पर चलने के लिए एकदम सही है, लेकिन यह बहुत अधिक सुव्यवस्थित होने के कारण सूक्ष्म विवरणों को मिस कर सकता है।
    • EfficientNetV2L: यह एक विशालकाय (Giant) है। इसके पास सबसे अधिक मांसपेशियां और मेमोरी है, लेकिन यह इतना भारी है कि इसे शुरू होने में काफी समय लगता है।
  3. "सुपर-रीडर" (विज़न ट्रांसफार्मर या ViT): यह शो का नया सितारा है। अन्य मॉडल्स के विपरीत जो एक छवि को टुकड़ों में देखते हैं (जैसे एक बार में एक शब्द पढ़ते हुए किताब पढ़ना), ViT पूरी तस्वीर को एक साथ देखता है। यह पूरे महासागर के दृश्य के संदर्भ को तुरंत समझ लेता है, जैसे कि एक जासूस जो पूरे अपराध स्थल को देख सकता है और तुरंत जान सकता है कि संदिग्ध कहाँ छिपा है।

टेस्ट ड्राइव

शोधकर्ताओं ने सभी छह मस्तिष्कों को एक कठोर परीक्षण से गुजारा:

  • प्रशिक्षण (Training): उन्होंने उन्हें जहाजों और खाली पानी की हजारों तस्वीरें खिलाईं।
  • रियल-वर्ल्ड स्ट्रेस टेस्ट: उन्होंने केवल स्थिर तस्वीरों का परीक्षण नहीं किया; उन्होंने जहाजों के माध्यम से चलते हुए महासागर का एक 37 सेकंड का वीडियो चलाया। उन्होंने प्रत्येक मस्तिष्क द्वारा पूरे वीडियो को देखने और जहाजों को गिनने में लगने वाले समय को मापा।

परिणाम: कौन जीता?

परिणामों को एक दौड़ के रूप में सोचें जहाँ लक्ष्य तेज़, सटीक होना और सबसे कम गलतियाँ करना है।

  • हल्का धावक (MobileNet): यह तेज़ और छोटा था, लेकिन इसने दूसरों की तुलना में कुछ अधिक गलतियाँ कीं। छोटे गैजेट्स के लिए अच्छा है, लेकिन पूर्ण सुरक्षा के लिए सर्वश्रेष्ठ नहीं है।
  • हेवीवेट्स (VGG16, Xception, EfficientNet): वे सटीक थे, लेकिन "विशालकाय" (EfficientNet) इतना धीमा था कि उसे 37 सेकंड के वीडियो को देखने में 3 मिनट से अधिक का समय लगा! यह एक फिल्म को स्लो मोशन में देखने जैसा है।
  • विजेता (विज़न ट्रांसफार्मर / ViT): ViT चैंपियन था।
    • सटीकता (Accuracy): इसने अभ्यास परीक्षणों और वास्तविक वीडियो दोनों में 100% स्कोर किया। इसने एक भी जहाज मिस नहीं किया, और न ही किसी लहर को जहाज समझकर गलती की।
    • गति (Speed): एक बड़ा मॉडल होने के बावजूद, इसने लगभग सभी से तेज़ गति से वीडियो को प्रोसेस किया (लगभग 31 सेकंड में)।
    • गलतियाँ: इसने किसी भी मॉडल की तुलना में सबसे कम त्रुटियाँ कीं।

बड़ा सबक

शोध पत्र निष्कर्ष निकालता है कि कोई "एक आकार सभी के लिए उपयुक्त" (one size fits all) समाधान नहीं है, लेकिन उच्च-सुरक्षा वाले कामों के लिए जहाँ आप जहाज को मिस नहीं कर सकते, विज़न ट्रांसफार्मर (ViT) सबसे अच्छा उपकरण है।

  • यदि आपके पास एक छोटा, बैटरी से चलने वाला ड्रोन है: तो आप हल्के धावक (MobileNet) को चुनना चाह सकते हैं क्योंकि यह बैटरी बचाता है।
  • यदि आप एक प्रमुख सुरक्षा कमांड सेंटर चला रहे हैं: तो आपको ViT का उपयोग करना चाहिए। यह "सुपर-रीडर" है जो एक साथ पूरे महासागर को देखता है, सब कुछ पकड़ लेता है, और ऐसा तेज़ी से करता है।

"रेसिपी" पर एक नोट

शोधकर्ताओं ने एक बहुत ही महत्वपूर्ण विवरण की ओर भी इशारा किया: तैयारी मायने रखती है।
ठीक वैसे ही जैसे एक शेफ को रेसिपी के आधार पर सब्जियों को अलग-अलग तरीके से काटने की आवश्यकता होती है, इन AI मॉडल्स को भी उनके खाने से पहले छवियों को विशिष्ट तरीकों से "तैयार" (resize और color-correct) करने की आवश्यकता होती है। शोध पत्र ने विस्तार से बताया कि प्रत्येक विशिष्ट मॉडल के लिए छवियों को कैसे काटा (resize और color-correct) जाए। यदि आप सही मॉडल के लिए सही रेसिपी का पालन नहीं करते हैं, तो AI भ्रमित हो जाता है और खराब प्रदर्शन करता है। उन्होंने एक स्पष्ट "कुकबुक" प्रदान की है ताकि अन्य वैज्ञानिक भी वही शानदार परिणाम प्राप्त कर सकें।

संक्षेप में: उन्होंने AI आँखों का एक बेड़ा बनाया, एक तूफानी समुद्र में उनका परीक्षण किया, और पाया कि "सुपर-रीडर" (ViT) हमारे महासागरों के लिए सबसे तेज, सबसे विश्वसनीय और सबसे सटीक गार्ड है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →