← नवीनतम पेपर
💻 computer science

MFil-Mamba: Multi-Filter Scanning for Spatial Redundancy-Aware Visual State Space Models

MFil-Mamba एक नवीन विजुअल स्टेट स्पेस आर्किटेक्चर है जो एक मल्टी-फिल्टर स्कैनिंग बैकबोन और एडेप्टिव वेटिंग मैकेनिज्म का उपयोग करके मौजूदा SSM-आधारित विजन मॉडल्स की सीमाओं को संबोधित करता है ताकि न्यूनतम रेडंडेंसी के साथ अद्वितीय स्थानिक जानकारी को कैप्चर किया जा सके, जिससे विविध कंप्यूटर विजन बेंचमार्क्स पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Puskal Khadka, KC Santosh

प्रकाशित 2026-03-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Puskal Khadka, KC Santosh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को "देखना" और समझना सिखाने की कोशिश कर रहे हैं, जैसे किसी फोटो में बिल्ली को पहचानना या व्यस्त सड़क पर स्टॉप साइन (stop sign) को ढूंढना।

लंबे समय तक, हमने रोबोट को सिखाने के दो मुख्य तरीके इस्तेमाल किए:

  1. "लोकल" तरीका (CNNs): एक छोटी चाबी के छेद (keyhole) के माध्यम से फोटो को देखने जैसा। आप एक छोटा सा हिस्सा स्पष्ट रूप से देखते हैं, फिर अगले हिस्से को देखने के लिए उस छेद को थोड़ा सा खिसकाते हैं। यह बारीकियों के लिए बहुत अच्छा है लेकिन पूरी तस्वीर को जोड़ने में धीमा है।
  2. "ग्लोबल" तरीका (Transformers): एक सुपर-पावरफुल दिमाग की तरह जो पूरी फोटो को एक साथ देखता है और तुरंत समझ जाता है कि हर पिक्सेल दूसरे पिक्सेल से कैसे संबंधित है। यह शक्तिशाली तो है, लेकिन अविश्वसनीय रूप से महंगा और धीमा है, जैसे कि एक साथ लाइब्रेरी की हर किताब को पढ़ने की कोशिश करना।

हाल ही में, Mamba नामक एक नई तकनीक आई है। यह एक बहुत ही कुशल पाठक की तरह है जो एक लंबी कहानी को बहुत तेज़ी से (linear speed) पढ़ सकता है और संदर्भ (context) को भी याद रख सकता है। समस्या यह है कि Mamba को टेक्स्ट (जो एक सीधी रेखा है) पढ़ने के लिए बनाया गया था, लेकिन इमेज (चित्र) 2D ग्रिड (जैसे शतरंज का बोर्ड) होते हैं।

पुराना समाधान: "ज़िग-ज़ैग" की समस्या

इमेज को Mamba के लिए पढ़ने योग्य बनाने के लिए, पिछले शोधकर्ताओं ने इमेज को एक 1D लाइन में बदलने की कोशिश की। उन्होंने इसे विशिष्ट पैटर्न में स्कैन करके किया: बाएँ-से-दाएँ, ऊपर-से-नीचे, या यहाँ तक कि एक सर्पिल (spiral) या "Z" आकार में।

उपमा (Analogy): कल्पना कीजिए कि आपके पास एक जिग्सॉ पहेली (jigsaw puzzle) है। अपने उस दोस्त को दिखाने के लिए जो केवल एक सीधी रेखा वाली व्याख्या ही समझता है, आप टुकड़ों पर एक विशिष्ट पथ (path) का अनुसरण करके उसका वर्णन करने की कोशिश करते हैं।

  • समस्या: यदि आप "Z" पैटर्न का पालन करते हैं, तो आप ऊपर-बाएँ कोने का वर्णन करेंगे, फिर नीचे-दाएँ पर कूदेंगे, फिर वापस बीच में आएंगे। आप तस्वीर के स्वाभाविक प्रवाह को खो देते हैं। आप एक ही चीज़ के संबंधों को बार-बार बताते हैं (redundancy) और इस तरह चीजों को विकृत (distort) कर देते हैं कि वे वास्तव में कैसे फिट होती हैं। यह एक मुड़ी हुई स्ट्रॉ (straw) के माध्यम से पेंटिंग को देखने जैसा है।

नया समाधान: MFil-Mamba

इस पेपर के लेखकों, पुस्कल खादके (Puskal Khadka) और केसी संतोष (KC Santosh) ने कहा, "इमेज को जबरदस्ती एक लाइन में क्यों बदलना? आइए इसे अलग तरह से देखते हैं।"

उन्होंने MFil-Mamba (Multi-Filter Mamba) बनाया। यह कैसे काम करता है, इसके सरल रूपक यहाँ दिए गए हैं:

1. "मल्टी-लेंस कैमरा" (Multi-Filter Scanning)

इमेज को एक ही मुड़ी हुई लाइन में बदलने के बजाय, MFil-Mamba एक ही समय में चार अलग-अलग "लेंस" या फिल्टर के माध्यम से इमेज को देखता है:

  • लेंस 1 (मूल/Original): बस तस्वीर को वैसा ही देखता है जैसी वह है।
  • लेंस 2 (क्षैतिज किनारा/Horizontal Edge): क्षैतिज रेखाओं (जैसे क्षितिज या मेज) को उभारता है।
  • लेंस 3 (लंबवत किनारा/Vertical Edge): लंबवत रेखाओं (जैसे पेड़ का तना या इमारत) को उभारता है।
  • लेंस 4 (स्मार्ट फिल्टर/Smart Filter): एक विशेष लेंस जो कार्य-विशिष्ट अद्वितीय पैटर्न (जैसे बिल्ली के कान का घुमाव) खोजने के लिए सीखता है।

उपमा: कल्पना कीजिए कि आप एक जटिल मशीन को समझने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप उसके चारों ओर ज़िग-ज़ैग पैटर्न में घूमते हैं, और टुकड़ों को एक विशिष्ट क्रम में बताने की कोशिश करते हैं।
  • MFil-Mamba का तरीका: आप एक साथ चार अलग-अलग चश्मे पहन लेते हैं। एक जोड़ा बोल्ट को उभारता है, दूसरा तारों को, तीसरा बाहरी आवरण (casing) को, और चौथा चलते हुए हिस्सों को। आपको इस बात की एक समृद्ध, पूर्ण तस्वीर मिलती है कि हिस्से एक-दूसरे से कैसे संबंधित हैं, बिना उन्हें एक सीधी रेखा में बदलने की आवश्यकता के।

2. "स्मार्ट मिक्सर" (Adaptive Weighting)

एक बार जब रोबोट इन चार लेंसों के माध्यम से देखता है, तो उसके पास इमेज के चार अलग-अलग संस्करण होते हैं। यह उन्हें कैसे जोड़ता है?

  • पुराना तरीका: यह बस उन्हें औसत (average) कर देता है (50% यह, 50% वह)।
  • MFil-Mamba का तरीका: इसके पास एक स्मार्ट मिक्सर है। यह यह सीखने में सक्षम है कि, "इस इमेज के इस विशिष्ट भाग के लिए, 'Vertical Edge' वाला लेंस सबसे महत्वपूर्ण है, इसलिए मैं उसे अधिक महत्व दूँगा। इस दूसरे भाग के लिए, 'Original' लेंस सबसे अच्छा है।"
  • उपमा: यह एक DJ द्वारा संगीत मिक्स करने जैसा है। चार गानों को बिल्कुल एक ही वॉल्यूम पर चलाने के बजाय, DJ (AI) जानता है कि बेस (vertical lines) को कब बढ़ाना है और वोकल्स (original details) को कब बढ़ाना है ताकि एक बेहतरीन ट्रैक तैयार हो सके।

यह एक बड़ी बात क्यों है?

पेपर दिखाता है कि यह नई विधि पिछले "ज़िग-ज़ैग" तरीकों की तुलना में तेज़, सस्ती और स्मार्ट है।

  • बेहतर सटीकता (Better Accuracy): प्रसिद्ध ImageNet टेस्ट (एक विशाल फोटो क्विज़) पर, उनके छोटे से मॉडल ने 83.2% का स्कोर प्राप्त किया, जो कई बड़े और महंगे मॉडलों को पीछे छोड़ देता है।
  • बेहतर दृष्टि (Better Vision): जब वस्तुओं को खोजने (जैसे पार्किंग में कारें) या दृश्य को भागों में विभाजित करने (जैसे सड़क को फुटपाथ से अलग करना) के लिए परीक्षण किया गया, तो इसने वर्तमान अत्याधुनिक (state-of-the-art) मॉडलों से बेहतर प्रदर्शन किया।
  • कोई विरूपण नहीं (No Distortion): क्योंकि यह इमेज को एक अजीब सी लाइन में नहीं बदलता, इसलिए यह दुनिया के "आकार" को बहुत बेहतर तरीके से समझता है। इसका "प्रभावी रिसेप्टिव फील्ड" (Effective Receptive Field - यानी रोबोट एक बार में कितना देख सकता है) सहज और प्राकृतिक है, न कि पुराने तरीकों की तरह टेढ़ा-मेढ़ा और कृत्रिम।

निष्कर्ष (The Bottom Line)

MFil-Mamba रोबोट की दृष्टि को "टनल विजन" दृष्टिकोण (एक समय में एक मुड़ी हुई रेखा के माध्यम से देखना) से अपग्रेड करने जैसा है, जो "मल्टी-परस्पेक्टिव" दृष्टिकोण (विशेष लेंसों के माध्यम से देखना जो किनारों, आकारों और संदर्भ को एक साथ समझते हैं) में बदल देता है।

यह साबित करता है कि टेक्स्ट-आधारित AI (Mamba) को काम करने के लिए चौकोर खांचों (इमेज) को गोल छेदों (टेक्स्ट-आधारित AI) में जबरदस्ती फिट करने की ज़रूरत नहीं है। इसके बजाय, आप एक नया टूल बना सकते हैं जो दुनिया के प्राकृतिक 2D आकार का सम्मान करता है, जिससे AI तेज़, अधिक कुशल और वास्तव में क्या मौजूद है उसे देखने में बेहतर बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →