← नवीनतम पेपर
💻 computer science

Vision Non-Causal Trapezoidal Mamba: Eliminating Directional Scanning in Vision SSMs with Second-Order Dynamics

यह शोध पत्र विज़न नॉन-कॉज़ल ट्रैपेज़ॉइडल मम्बा (VNCT) प्रस्तुत करता है, जो एक द्वितीय-क्रम का नॉन-कॉज़ल स्टेट स्पेस मॉडल है जो ओरिएंटेशन-रोबस्ट रिप्रजेंटेशन प्राप्त करने के लिए डायरेक्शनल टोकन स्कैनिंग को समाप्त करता है और कम इन्फरेंस लेटेंसी बनाए रखते हुए विभिन्न विज़न कार्यों में उत्कृष्ट प्रदर्शन करता है।

मूल लेखक: Anvitha Ramachandran, Dhruv Parikh, Haoyang Fan, Rajgopal Kannan, Viktor Prasanna

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anvitha Ramachandran, Dhruv Parikh, Haoyang Fan, Rajgopal Kannan, Viktor Prasanna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल पहेली को समझने की कोशिश कर रहे हैं जो हज़ारों छोटे-छोटे चित्र के टुकड़ों (टोकन) से बनी है। लंबे समय तक, कंप्यूटर विज़न मॉडल एक बहुत ही सख्त, एकतरफा रास्ते की तरह काम करते रहे। उन्हें टुकड़ों को एक विशिष्ट क्रम में देखना पड़ता था: बाएं से दाएं, ऊपर से नीचे, या किसी अन्य निश्चित पथ पर। इसे डायरेक्शनल स्कैनिंग (directional scanning) कहा जाता है। यह एक किताब पढ़ने जैसा है जहाँ आप आगे नहीं देख सकते या पीछे नहीं पलट सकते; आपको अगली पंक्ति पर जाने से पहले हर शब्द को पढ़ना ही होगा।

यह शोध पत्र एक नया मॉडल पेश करता है जिसे विज़न नॉन-कॉज़ल ट्रैपेज़ॉइडल मामा (Vision Non-Causal Trapezoidal Mamba - VNCT) कहा जाता है। इसकी मुख्य खोज यह है कि अच्छी तरह से देखने के लिए यह "एकतरफा सड़क" वाला सख्त नियम वास्तव में अनावश्यक है। वास्तव में, इस नियम को हटाने से मॉडल तेज़ और अधिक स्मार्ट बन जाता है।

पुराना तरीका बनाम नया तरीका

पुराने मॉडलों (जैसे कई विज़न ट्रांसफॉर्मर या शुरुआती "मामा" मॉडल) को उन जासूसों की टीम के रूप में सोचें जिन्हें एक संग्रहालय के कमरे में एक कतार में चलना पड़ता है। वे केवल अपने सामने वाली पेंटिंग को देख सकते हैं, फिर अगली, और इसी तरह। यदि वे दाईं ओर ध्यान केंद्रित करने के कारण बाईं ओर के विवरण को मिस कर देते हैं, तो वे इसे तब तक नहीं पकड़ पाएंगे जब तक वे वापस चक्कर नहीं काट लेते, जिसमें अतिरिक्त समय लगता है। यह एक पूर्वाग्रह (bias) पैदा करता है; मॉडल एक विशिष्ट दिशा में देखने का "अभ्यस्त" हो जाता है।

VNCT नियम पुस्तिका को फेंक देता है। एक लाइन में चलने के बजाय, यह हर एक चित्र के टुकड़े को एक ही बार में एक साथ दूसरे टुकड़े से बात करने की अनुमति देता है। यह एक विशाल, तत्काल स्पॉटलाइट चालू करने जैसा है जो पूरे संग्रहालय के कमरे को एक साथ रोशन कर देता है। हर जासूस तुरंत हर पेंटिंग को देख सकता है, बिना किसी के बारी का इंतज़ार किए। शोध पत्र दिखाता है कि यह "एक साथ" वाला दृष्टिकोण लाइन में चलने से होने वाले अजीब पूर्वाग्रहों को समाप्त कर देता है।

असली सीक्रेट सॉस: सेकंड-ऑर्डर डायनेमिक्स (Second-Order Dynamics)

लेकिन यह बिना भ्रमित हुए इतनी तेज़ी से सबसे कैसे बात करता है? लेखक एक चतुर गणितीय ट्रिक का उपयोग करते हैं जिसे सेकंड-ऑर्डर डायनेमिक्स (विशेष रूप से, "ट्रैपेज़ॉइडल" डायनेमिक्स) कहा जाता है।

कल्पना कीजिए कि आप कमरे के तापमान का अनुमान लगाने की कोशिश कर रहे हैं।

  • फर्स्ट-ऑर्डर (पुराना तरीका): आप थर्मामीटर को एक बार देखते हैं और उस एकल रीडिंग के आधार पर अनुमान लगाते हैं।
  • सेकंड-ऑर्डर (VNCT का तरीका): आप थर्मामीटर देखते हैं, लेकिन आप यह भी देखते हैं कि एक पल पहले तापमान कितनी तेज़ी से बदल रहा था। आप "अभी" और "अभी से ठीक पहले" के औसत को लेते हैं।

यह "ट्रैपेज़ॉइडल" विधि (एक चरण के शुरू और अंत के बिंदुओं का औसत लेना) मॉडल को छवि की अधिक समृद्ध, अधिक विस्तृत समझ प्रदान करती है। शोध पत्र सुझाव देता है कि विवरण की यह अतिरिक्त परत मॉडल को पिछले मॉडलों द्वारा उपयोग की जाने वाली सरल, एकल-चरण विधियों की तुलना में आकृतियों और सीमाओं को बेहतर ढंग से समझने में मदद करती है।

यह पेपर क्या खारिज करता है

यह पेपर स्पष्ट रूप से इस विचार के खिलाफ तर्क देता है कि विज़न मॉडलों को अच्छा काम करने के लिए डायरेक्शनल स्कैनिंग की आवश्यकता होती है। कई पिछले मॉडलों ने "एकतरफा सड़क" की समस्या को ठीक करने के लिए अधिक जटिल पथ (जैसे ज़िग-ज़ैग या स्पाइरल में चलना) जोड़ने की कोशिश की, लेकिन लेखक दिखाते हैं कि आपको पथ को ठीक करने की आवश्यकता नहीं है—आपको बस पथ को पूरी तरह से हटाने की आवश्यकता है। वे उच्च-प्रदर्शन विज़न के लिए अनुक्रमिक स्कैनिंग (sequential scanning) की आवश्यकता को खारिज करते हैं।

परिणाम: तेज़, मज़बूत और अधिक सक्षम

लेखकों ने कई बड़ी चुनौतियों पर अपने मॉडल को मापा, और परिणाम काफी स्पष्ट थे:

  • गति (Speed): क्योंकि इसे लाइन बनने का इंतज़ार नहीं करना पड़ता, इसलिए VNCT तेज़ है। एक एकल छवि पर, "माइक्रो" संस्करण को भविष्यवाणी करने में 5.25 मिलीसेकंड और "टाइनी" संस्करण को 7.31 मिलीसेकंड लगे। यह पिछले नॉन-कॉज़ल मॉडल (VSSD) से तेज़ था, जिसे क्रमशः 5.80 ms और 8.01 ms लगे।
  • सटीकता (Accuracy): इसने मानक परीक्षणों पर बेहतर स्कोर प्राप्त किया। ImageNet-1K टेस्ट पर, "टाइनी" संस्करण ने 84.2% सटीकता हासिल की, जिसने पिछले सर्वश्रेष्ठ नॉन-कॉज़ल मॉडल (VSSD-Tiny) को पछाड़ दिया जो 83.7% प्राप्त कर रहा था।
  • मुड़ना और पलटना (Turning and Flipping): सबसे दिलचस्प खोजों में से एक "ओरिएंटेशन रोबस्टनेस" के बारे में है। यदि आप किसी छवि को उल्टा कर देते हैं या घुमा देते हैं, तो पुराने मॉडल थोड़े भ्रमित हो जाते हैं और उनकी सटीकता गिर जाती है। VNCT इसके प्रति बहुत सहज है। जब छवि को घुमाया या पलटा गया, तो औसत सटीकता में गिरावट केवल 0.3% थी, जबकि VSSD के लिए यह 0.9% और डायरेक्शनल स्कैनिंग मॉडल के लिए 1.6% थी। यह बताता है कि मॉडल वस्तु को एक संपूर्ण इकाई के रूप में देखता है, न कि केवल पिक्सेल के एक अनुक्रम के रूप में।
  • सीमाएं (Boundaries): वस्तुओं की रूपरेखा खींचते समय (जैसे कार को सड़क से अलग करना), VNCT अधिक सटीक था। इसने VSSD की तुलना में सिटीस्केप्स (Cityscapes) डेटासेट पर "बाउंड्री IoU" (किनारों के मिलान की एक स्कोर) में 3.7 अंक तक सुधार किया।

निचोड़

यह पेपर केवल यह सुझाव नहीं देता कि यह काम कर सकता है; इसने वर्गीकरण (classification), ऑब्जेक्ट डिटेक्शन और सेगमेंटेशन कार्यों में इसे मापा है। लेखक निष्कर्ष निकालते हैं कि डायरेक्शनल स्कैनिंग का "एकतरफा रास्ता" छवियों पर सीक्वेंस मॉडल्स को थोपने का एक अवशेष है, और एक सेकंड-ऑर्डर, नॉन-कॉज़ल दृष्टिकोण विज़न AI बनाने का एक सरल, अधिक कुशल और अधिक मजबूत तरीका है। उन्होंने केवल पुराने सिस्टम को सुधारा नहीं है; उन्होंने यातायात के नियमों को पूरी तरह से बदल दिया है, और कारें अब तेज़ चल रही हैं और सीधी दिशा में दौड़ रही हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →