← नवीनतम पेपर
💻 computer science

Dynamic Lightweight YOLO for UAV-Based Forest Fire Detection\

यह शोध पत्र एक हल्का, उन्नत YOLOv8n मॉडल प्रस्तावित करता है जो यूएवी (UAV) आधारित वन अग्नि का पता लगाने के लिए डायनेमिक कन्वेल्शन, एक मल्टी-अवेयर डिटेक्शन हेड और क्रॉस-स्पेशियल अटेंशन को एकीकृत करता है, ताकि वास्तविक समय में ऑनबोर्ड परिनियोजन के लिए उपयुक्त एक कॉम्पैक्ट आकार बनाए रखते हुए छोटे लक्ष्यों की सटीकता को महत्वपूर्ण रूप से बढ़ाया जा सके और गलत अलार्म को कम किया जा सके।

मूल लेखक: Xiang Yin, Yinxia Xu, Ruofan Zhang

प्रकाशित 2026-08-10
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xiang Yin, Yinxia Xu, Ruofan Zhang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: UAV-आधारित वन अग्नि का पता लगाने के लिए डायनेमिक लाइटवेट YOLO

1. समस्या विवरण (Problem Statement)

अनमैन्ड एरियल व्हीकल (UAV) आधारित वन अग्नि का पता लगाने को ऑनबोर्ड कंप्यूटेशनल संसाधनों की सीमाओं और अग्नि परिदृश्यों की अंतर्निहित जटिलता के कारण महत्वपूर्ण बाधाओं का सामना करना पड़ता है। पारंपरिक पहचान विधियाँ, जैसे कि मैनुअल गश्त, ग्राउंड सेंसर और सैटेलाइट रिमोट सेंसिंग, कवरेज, प्रतिक्रिया समय या रिज़ॉल्यूशन के संबंध में समस्याओं से ग्रस्त हैं। जबकि डीप लर्निंग एक आशाजनक विकल्प प्रदान करती है, मौजूदा ऑब्जेक्ट डिटेक्शन मॉडल निम्नलिखित चुनौतियों से जूझ रहे हैं:

  • लघु लक्ष्य पहचान (Small Target Detection): धुआं और लपटें अक्सर छोटे, धुंधले या अनियमित लक्ष्यों के रूप में दिखाई देते हैं, जिससे मिस डिटेक्शन (छूट जाने) की दर बढ़ जाती है।
  • जटिल पृष्ठभूमि (Complex Backgrounds): प्रकाश व्यवस्था, मौसम और स्थलाकृति (जैसे वनस्पति, इमारतें) में बदलाव के कारण उच्च फाल्स डिटेक्शन (गलत पहचान) दर होती है।
  • संसाधन संबंधी बाधाएं (Resource Constraints): UAVs में सीमित प्रोसेसिंग पावर और मेमोरी होती है, जिसके लिए ऐसे हल्के मॉडलों की आवश्यकता होती है जो वास्तविक समय के प्रदर्शन से समझौता न करें।
  • गतिशील प्रकृति (Dynamic Nature): लपटों और धुएं की तीव्र गति और विरूपण (deformation) स्टेटिक फीचर एक्सट्रैक्शन विधियों को चुनौती देते हैं।

2. कार्यप्रणाली (Methodology)

लेखक YOLOv8n आर्किटेक्चर पर आधारित एक उन्नत हल्के वजन वाले ऑब्जेक्ट डिटेक्शन एल्गोरिदम का प्रस्ताव करते हैं। यह मॉडल उपरोक्त चुनौतियों से निपटने के लिए एक कॉम्पैक्ट फुटप्रिंट बनाए रखते हुए चार विशिष्ट संशोधनों को एकीकृत करता है:

A. डायनेमिक कन्वोल्यूशन बैकबोन (Dynamic Convolution Backbone)

असमान चमक और गतिशील लक्ष्य आकृतियों को संभालने के लिए, बैकबोन में मानक कन्वोल्यूशन परतों को डायनेमिक कन्वोल्यूशन (DynamicConv) मॉड्यूल के साथ बदल दिया गया है।

  • तंत्र (Mechanism): फिक्स्ड कर्नेल का उपयोग करने के बजाय, यह मॉड्यूल इनपुट फीचर्स के आधार पर डायनेमिक रूप से वेट्स (weights) और बायस (biases) उत्पन्न करता है। यह कई कन्वोल्यूशन कर्नेल (KK) को πk(x)\pi_k(x) द्वारा भारित करके चुनने और संयोजित करने के लिए एक अटेंशन मैकेनिज्म का उपयोग करता है।
  • लाभ: यह नेटवर्क को विभिन्न इनपुट नमूनों के लिए अपने मापदंडों को अनुकूल रूप से समायोजित करने की अनुमति देता है, जिससे बिना फ्लोटिंग पॉइंट ऑपरेशन्स (FLOPs) में उल्लेखनीय वृद्धि किए, अनियमित धुएं और लपटों की सीमाओं के लिए फीचर एक्सट्रैक्शन बेहतर होता है।

B. मल्टी-डायमेंशनल डायनेमिक डिटेक्शन हेड (DyHead)

ऑब्जेक्ट के आकार, स्थानिक जानकारी और कार्य विशेषताओं की धारणा में सुधार करने के लिए मूल डिटेक्शन हेड को DyHead मॉड्यूल से बदल दिया गया है।

  • तंत्र: यह हेड तीन समानांतर अटेंशन मैकेनिज्म का उपयोग करता है:
    1. स्केल-अवेयर अटेंशन (πL\pi_L): अनियमित लौ की सीमाओं को बेहतर ढंग से संभालने के लिए पोजीशनल जानकारी को मॉडल करता है।
    2. स्पेशियल-अवेयर अटेंशन (πS\pi_S): आग को पत्तियों या सूर्य के प्रकाश के परावर्तन जैसे बैकग्राउंड तत्वों से अलग करने के लिए स्थानिक संबंधों को अनुकूलित करता है।
    3. टास्क-अवेयर अटेंशन (πC\pi_C): हाई-ब्राइटनेस फ्लेम क्षेत्रों पर ध्यान केंद्रित करने और बैकग्राउंड शोर को दबाने के लिए चैनल वेट्स को समायोजित करता है।
  • लाभ: यह समन्वित प्रसंस्करण जटिल वन वातावरण में लोकलाइजेशन सटीकता में काफी सुधार करता है और फाल्स पॉजिटिव को कम करता है।

C. नेक (Neck) में एफिशिएंट मल्टी-स्केल अटेंशन (EMA)

फीचर फ्यूजन नेक में क्रॉस-स्पेशियल लर्निंग पर आधारित एक EMA मॉड्यूल पेश किया गया है।

  • तंत्र: पारंपरिक अटेंशन मैकेनिज्म (जैसे SENet, CBAM) के विपरीत, जो ग्लोबल एवरेज पूलिंग के माध्यम से चैनल जानकारी को संकुचित करते हैं, EMA चैनल और स्थानिक दोनों आयामों में ग्लोबल कॉन्टेक्स्टुअल जानकारी को एनकोड करता है। यह प्रत्येक समानांतर शाखा के लिए चैनल वेट्स को डायनेमिक रूप से पुनर्गठित करता है।
  • लाभ: यह मल्टी-स्केल फीचर्स के प्रतिनिधित्व को मजबूत करता है, विशेष रूप से छोटे फ्लेम और शुरुआती चरण के धुएं का पता लगाने में मदद करता है और अप्रासंगिक बैकग्राउंड जानकारी को दबाता है।

D. लाइटवेट फीचर फ्यूजन (Slim-neck)

मॉडल के आकार और कंप्यूटेशनल लागत को और कम करने के लिए, Slim-neck मॉड्यूल लागू किया गया है।

  • तंत्र: यह संरचना VoV-GSCSP और GSConv (ग्रुप शफल कन्वोल्यूशन) परतों का उपयोग करती है। यह स्ट्रक्चरल रीपैरामीट्राइजेशन और चैनल शफलिंग के साथ डेप्थवाइज सेपरेबल कन्वोल्यूशन को जोड़ती है।
  • लाभ: यह फीचर विविधता और फ्यूजन दक्षता को बनाए रखते हुए पैरामीटर्स और FLOPs की संख्या को कम करता है, जिससे मॉडल संसाधन-सीमित UAV पर तैनाती के लिए उपयुक्त हो जाता है।

3. मुख्य योगदान (Key Contributions)

पेपर निम्नलिखित प्राथमिक योगदानों का दावा करता है:

  1. डायनेमिक रिसोर्स एलोकेशन: डायनेमिककॉनवोल्यूशन का एकीकरण कंप्यूटेशनल रिसोर्स के उपयोग को अनुकूलित करता है, जिससे कम FLOPs की स्थिति में प्रदर्शन में सुधार होता है।
  2. उन्नत मल्टी-स्केल परसेप्शन: DyHead मॉड्यूल लक्ष्य के आकार और स्थानिक संदर्भ के आधार पर डिटेक्शन रणनीतियों के लचीले समायोजन को सक्षम बनाता है, जो विविध फ्लेम स्केल के लिए महत्वपूर्ण है।
  3. मजबूत फीचर रिप्रेजेंटेशन: EMA मैकेनिज्म जटिल, गतिशील वातावरण में सूक्ष्म अग्नि फीचर्स को कैप्चर करने की मॉडल की क्षमता में सुधार करता है।
  4. लाइटवेट आर्किटेक्चर: Slim-neck डिज़ाइन सफलतापूर्वक डिटेक्शन सटीकता और कॉम्पैक्ट मॉडल साइज के बीच संतुलन बनाता है, जिससे UAVs पर रियल-टाइम इन्फरेंस सुलभ होता है।

4. प्रयोगात्मक परिणाम (Experimental Results)

प्रस्तावित मॉडल का मूल्यांकन C4-AI पब्लिक डेटासेट (9,848 इमेज जिसमें आग और धुआं शामिल है) पर किया गया, जिसे ट्रेनिंग, वैलिडेशन और टेस्ट सेट में विभाजित किया गया था। प्रयोग NVIDIA RTX4060 GPU पर किए गए।

  • परफॉरमेंस मेट्रिक्स:
    • प्रिसिजन (Precision): 75.7% (बेसलाइन YOLOv8n की तुलना में 5.1% की वृद्धि)।
    • mAP50: 69.5% (YOLOv8n की तुलना में 2.7% का सुधार)।
    • mAP50-95: 39.3%।
    • मॉडल साइज: 10.6 MB।
    • पैरामीटर्स: 5.4 मिलियन।
    • FLOPs: 13.0 G।
  • तुलनात्मक विश्लेषण:
    • प्रस्तावित मॉडल ने सटीकता और मॉडल साइज के बीच संतुलन के मामले में अन्य YOLO वेरिएंट्स (YOLOv5n, YOLOv7t, YOLOv9t, YOLOv10n, YOLOv11n) को पछाड़ दिया।
    • YOLOv7t (6.0M params) की तुलना में, प्रस्तावित मॉडल ने कम पैरामीटर्स (5.4M) के साथ 7.9% अधिक mAP50-95 प्राप्त किया।
    • एब्लेशन स्टडीज ने पुष्टि की कि चारों मॉड्यूल्स का संयोजन इष्टतम प्रदर्शन देता है, जिसमें EMA मॉड्यूल का सटीकता पर सबसे महत्वपूर्ण व्यक्तिगत प्रभाव देखा गया।
  • गुणात्मक परिणाम (Qualitative Results): विजुअल तुलनाओं ने प्रदर्शित किया कि बेहतर मॉडल ने लपटों के चारों ओर टाइट बाउंडिंग बॉक्स बनाए, गैर-अग्नि क्षेत्रों में गलत डिटेक्शन को कम किया, और बिना मर्ज हुए या छोड़े कई छोटे फायर पॉइंट्स की सफलतापूर्वक पहचान की।

5. महत्व और दावे (Significance and Claims)

लेखक का दावा है कि यह शोध UAVs का उपयोग करके रीयल-टाइम फॉरेस्ट फायर मॉनिटरिंग के लिए एक किफायती और विश्वसनीय तकनीकी समाधान प्रदान करता है। इस कार्य का महत्व निम्नलिखित में निहित है:

  • सिनर्जिस्टिक ऑप्टिमाइजेशन: मल्टी-डायमेंशनल ऑप्टिमाइजेशन रणनीतियों के माध्यम से डिटेक्शन सटीकता और कंप्यूटेशनल दक्षता में एक साथ सुधार प्राप्त करना।
  • एज डिप्लॉयमेंट व्यवहार्यता: यह प्रदर्शित करना कि सीमित स्टोरेज (10.6 MB) और कंप्यूटिंग पावर वाले उपकरणों पर उच्च-सटीक अग्नि का पता लगाना संभव है, जो पारंपरिक भारी मॉडलों की बाधाओं को दूर करता है।
  • व्यावहारिक प्रभाव: यह मॉडल जटिल बैकग्राउंड में फाल्स डिटेक्शन रेट को काफी कम करता है (37% तक) और छोटे लक्ष्यों के लिए रिकॉल (21% तक) बढ़ाता है, जो प्रारंभिक अग्नि चेतावनी प्रणालियों के लिए महत्वपूर्ण है।

सीमाएं और भविष्य का कार्य:
लेखक विनम्रतापूर्वक नोट करते हैं कि हालांकि मॉडल C4-AI डेटासेट पर अच्छा प्रदर्शन करता है, लेकिन चरम प्रकाश स्थितियों (जैसे कि तेज बैकलाइटिंग, नाइटटाइम इन्फ्रारेड) में चुनौतियां बनी हुई हैं। वे सुझाव देते हैं कि भविष्य के कार्य में इन्फ्रारेड स्पेक्ट्रल डेटा को फ्यूज करना और एडेप्टिव एक्सपोजर कंपनसेशन विकसित करना शामिल हो सकता है। इसके अतिरिक्त, वर्तमान मॉडल स्टैटिक फ्लेम डिटेक्शन पर केंद्रित है, और तेजी से फैलती आग की रेखाओं को ट्रैक करना आगे के सत्यापन का क्षेत्र बना हुआ है। भविष्य के अनुसंधान दिशाओं में चरम वातावरण के लिए फ्यूजन मैकेनिज्म विकसित करना और अग्नि प्रसार भविष्यवाणी मॉडल बनाना शामिल है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →