← नवीनतम पेपर
💻 computer science

YOLO-LOLG Mamba: Cross-Scale Feature Fusion with State Space Models for Industrial Steel Defect Detection

यह शोध पत्र YOLO-LOLG Mamba का प्रस्ताव करता है, जो एक नवीन स्टील सतह दोष पहचान ढांचा है जो क्रॉस-स्केल फीचर फ्यूजन और ग्लोबल कॉन्टेक्स्ट मॉडलिंग को बढ़ाने के लिए LODConv, LDAM और MsGroupMamba मॉड्यूल को एकीकृत करता है, जिससे YOLOv8n की तुलना में औद्योगिक डेटासेट पर बेहतर सटीकता और सामान्यीकरण प्राप्त होता है।

मूल लेखक: Wei Niu, Qinghua Zhang, Yunfei Jiang, Zhongbin Wei

प्रकाशित 2026-07-20
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wei Niu, Qinghua Zhang, Yunfei Jiang, Zhongbin Wei

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

स्टील के सागर में अदृश्य दोषों की खोज

कल्पना कीजिए कि आप एक विशाल फैक्ट्री में गुणवत्ता निरीक्षक (quality inspector) हैं जो स्टील बनाती है। यह स्टील हमारी आधुनिक दुनिया की रीढ़ है, जिसका उपयोग कारों से लेकर उन गगनचुंबी इमारतों तक सब कुछ बनाने में किया जाता है जिनमें हम रहते हैं। लेकिन यहाँ एक पेंच है: स्टील पूर्ण नहीं होता। जैसे-जैसे इसे बनाया जाता है, इसकी सतह पर सूक्ष्म दरारें, खरोंच और गड्ढे आ सकते हैं। यदि ये दोष नग्न आंखों से देखने के लिए बहुत छोटे हैं, तो वे बाद में स्टील को तोड़ सकते हैं, जिससे खतरनाक दुर्घटनाएं या महंगे मरम्मत कार्य हो सकते हैं।

इन अदृश्य समस्या पैदा करने वालों को पकड़ने के लिए, फैक्ट्रियां "कंप्यूटर आंखों" का उपयोग करती हैं—आर्टिफिशियल इंटेलिजेंस (AI) द्वारा संचालित स्मार्ट कैमरे। इन AI सिस्टम को स्टील की तस्वीरें देखने और खराब स्थानों को पहचानने के लिए प्रशिक्षित किया जाता है। लंबे समय तक, इस काम के लिए सबसे अच्छे AI उपकरण YOLO (जिसका अर्थ है "You Only Look Once") नामक एल्गोरिदम के एक प्रसिद्ध परिवार पर आधारित थे। YOLO को एक सुपर-फास्ट, सुपर-अवलोकन करने वाले सुरक्षा गार्ड के रूप में सोचें जो किसी विशिष्ट व्यक्ति को खोजने के लिए भीड़ को स्कैन करता है। हालाँकि, जिस तरह एक मानव गार्ड चमकदार फर्श पर धूल के एक छोटे से कण को अनदेखा कर सकता है, वैसे ही ये AI गार्ड कभी-कभी स्टील पर बहुत छोटी कमियों या अजीब आकार की दरारों को देखने में संघर्ष करते हैं। वे बड़ी चीजों को खोजने में बेहतरीन हैं, लेकिन जब छवि को ज़ूम आउट या प्रोसेस किया जाता है, तो वे अक्सर बारीक विवरण खो देते हैं। यह शोध उस विशिष्ट समस्या को हल करता है: कंप्यूटर की आंखों को इतना तेज कैसे बनाया जाए कि वे कारखाने की गति को धीमा किए बिना सबसे छोटे, सबसे खतरनाक दोषों को देख सकें।

शोध की कहानी: AI को "अदृश्य" देखना सिखाना

इस अध्ययन में, शिजिंग विश्वविद्यालय (Xijing University) और चीन की एक स्थानीय ऊर्जा कंपनी के शोधकर्ताओं की एक टीम ने मानक YOLO AI गार्ड को अपग्रेड करने का निर्णय लिया। उन्होंने देखा कि पुराने मॉडल "छोटी चीजों" को मिस कर रहे थे—जैसे कि सूक्ष्म खरोंच और अनियमित दरारें जो पतली रेखाओं या धुंधले किनारों जैसी दिखती हैं। समस्या यह थी कि AI बहुत अधिक बड़े चित्र (big picture) पर ध्यान केंद्रित कर रहा था और अपने स्कैनिंग प्रक्रिया के दौरान बारीक विवरण खो रहा था। इसे ठीक करने के लिए, उन्होंने एक नया, स्मार्ट संस्करण बनाया जिसे YOLO-LOLG Mamba कहा जाता है।

पुराने AI मॉडल को एक फोटोग्राफर के रूप में सोचें जो एक विशाल बिलबोर्ड पर एक छोटे से चींटी की तस्वीर लेने की कोशिश कर रहा है। फोटोग्राफर पूरे बिलबोर्ड को देखने के लिए ज़ूम आउट करता रहता है, लेकिन ऐसा करने में, चींटी एक धुंधली आकृति बन जाती है। शोधकर्ताओं ने महसूस किया कि उन्हें फोटोग्राफर की मदद के लिए दो नए उपकरणों की आवश्यकता है:

  1. "सुपर-मैग्निफाइंग ग्लास" (LODConv): पहला उपकरण LODConv नामक एक विशेष मॉड्यूल है। कल्पना कीजिए कि यह एक आवर्धक लेंस (magnifying glass) है जो न केवल ज़ूम करता है, बल्कि यह भी जानता है कि कहाँ देखना है। यह AI को छोटे दोषों के सूक्ष्म, नाजुक विवरणों को थामे रखने में मदद करता है ताकि वे धुंधलेपन में खो न जाएं। यह सुरक्षा गार्ड को ऐसे चश्मे देने जैसा है जो स्टील की बनावट (texture) को उभारते हैं, जिससे सबसे छोटी खरोंच भी स्पष्ट दिखाई देने लगती है।
  2. "लाइन-ट्रेसर" (LDAM): स्टील के दोष अक्सर लंबी, पतली रेखाओं (जैसे एक खरोंच) या अजीब, टेढ़े-मेढ़े आकारों के रूप में होते हैं। मानक AI उपकरण इन रेखाओं का पीछा करने में खराब होते हैं क्योंकि वे आमतौर पर छवि के छोटे, वर्गाकार टुकड़ों को देखते हैं। शोधकर्ताओं ने एक "लाइन-ट्रेसर" मॉड्यूल (LDAM) जोड़ा है जो विशेष रूप से इन लंबी, घुमावदार राहों का पीछा करने के लिए डिज़ाइन किया गया है। यह गार्ड को कमरे में बिखरे हुए ऊन के ढेर को देखने के बजाय, ऊन के एक अकेले धागे का पीछा करने के लिए प्रशिक्षित करने जैसा है।

लेकिन विवरण देखना ही काफी नहीं था। AI को यह भी समझने की आवश्यकता थी कि पूरी तस्वीर आपस में कैसे जुड़ती है। यहीं तीसरा उपकरण आता है: MsGroupMamba

कल्पना कीजिए कि आप एक पहेली (puzzle) सुलझाने की कोशिश कर रहे हैं। यदि आप एक बार में केवल एक टुकड़े को देखते हैं, तो आपको एहसास नहीं होगा कि वह आकाश का हिस्सा है। लेकिन यदि आप पीछे हटकर देख सकते हैं कि पूरे पहेली के टुकड़े आपस में कैसे जुड़ते हैं, तो आप इसे तेजी से हल कर लेंगे। MsGroupMamba मॉड्यूल एक "पहेली सुलझाने वाले" की तरह कार्य करता है जो सूक्ष्म विवरणों (मैग्निफाइंग ग्लास से प्राप्त) को बड़े चित्र (पूरी स्टील शीट) के साथ जोड़ता है। यह पूरी छवि को एक साथ देखने के लिए "स्टेट स्पेस मॉडल्स" नामक एक विशेष प्रकार के गणित का उपयोग करता है, जिससे यह समझ आता कि एक कोने में छोटी खरोंच शेष सतह के साथ कैसे संबंधित है। यह AI को दोष के केवल आकार को ही नहीं, बल्कि उसके "कथानक" को समझने में मदद करता है।

उन्होंने क्या पाया

शोधकर्ताओं ने अपने नए YOLO-LOLG Mamba सिस्टम का परीक्षण स्टील दोषों के दो प्रसिद्ध संग्रहों पर किया: NEU-DET डेटासेट (छह प्रकार के दोषों के साथ 1,800 छवियां) और GC10-DET डेटासेट (दस अलग-अलग प्रकार के दोषों के साथ 2,300 छवियां)।

परिणाम उत्साहजनक थे। NEU-DET डेटासेट पर, नए मॉडल ने 80.55% का स्कोर प्राप्त किया (विशेष रूप से mAP@0.5 80.55%)। इसे समझने के लिए, मानक YOLOv8 मॉडल (जो "पहले वाला" संस्करण था) ने केवल 76.61% स्कोर किया था। इसका मतलब है कि नए सिस्टम ने लगभग 3.94% अधिक दोषों को सही ढंग से पहचाना। इससे भी अधिक प्रभावशाली बात यह है कि नया मॉडल पुराने वाले की तुलना में वास्तव में छोटा और तेज था। इसने मानक YOLOv8 (जिसमें 2.69 मिलियन पैरामीटर्स और 6.9 GFLOPs की गणना शक्ति थी) की तुलना में कम कंप्यूटर संसाधनों (केवल 2.36 मिलियन पैरामीटर्स और 6.1 GFLOPs) का उपयोग किया।

टीम ने "एब्लेशन प्रयोग" (ablation experiments) भी चलाए, जो एक फैंसी तरीका है यह कहने का कि उन्होंने अपने नए मॉडल के हिस्सों को अलग करके देखा कि कौन सा हिस्सा क्या काम करता है। उन्होंने पाया कि:

  • केवल "सुपर-मैग्निफाइंग ग्लास" (LODConv) जोड़ने से मदद मिली।
  • केवल "लाइन-ट्रेसर" (LDAM) जोड़ने से मदद मिली।
  • केवल "पहेली सुलझाने वाले" (MsGroupMamba) जोड़ने से मदद मिली।
  • लेकिन जब उन्होंने इन तीनों को एक साथ रखा, तो मॉडल सबसे अच्छा काम कर रहा था, जो कम वजन (lightweight) बनाए रखते हुए अधिक दोषों को ढूंढ रहा था।

उन्होंने अपने नए अटेंशन मैकेनिज्म (लाइन-ट्रेसर) की तुलना LKAttention और MSCA जैसे अन्य लोकप्रिय तरीकों से भी की। उनके नए तरीके, LDAM ने लगातार अधिक दोषों को खोजा और कम गलतियाँ कीं, जिससे यह साबित हुआ कि यह बैकग्राउंड शोर को अनदेखा करने और वास्तविक दरारों पर ध्यान केंद्रित करने में बेहतर था।

मुख्य निष्कर्ष

यह शोध पत्र यह दावा नहीं करता कि इसने स्टील निरीक्षण की दुनिया की हर समस्या को हल कर दिया है। लेखक सावधानी बरतते हुए नोट करते हैं कि उनके मॉडल का परीक्षण सार्वजनिक डेटासेट पर किया गया था और इसे बदलती रोशनी या धातु के विभिन्न प्रकारों जैसे वास्तविक दुनिया की अराजकता को संभालने के लिए और अधिक काम की आवश्यकता हो सकती है। हालाँकि, वे सुझाव देते हैं कि सूक्ष्म विवरणों के लिए "मैग्निफाइंग ग्लास", अजीब आकारों के लिए "लाइन-ट्रेसर", और बड़े चित्र के लिए "पहेली सुलझाने वाले" को जोड़कर, उन्होंने एक बहुत ही सटीक और कुशल AI टूल बनाया है।

सरल शब्दों में, उन्होंने कंप्यूटर गार्ड को केवल "एक बार देखने" के बजाय उन सूक्ष्म, खतरनाक दोषों को वास्तव में "देखना" सिखाया है जो पहले आसानी से छिपे रहते थे। यह सुझाव देता है कि भविष्य में, कारखाने दोषों को समस्या बनने से पहले पकड़ पाएंगे, जिससे हमारे स्टील के ढांचे अधिक सुरक्षित और मजबूत रहेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →