← नवीनतम पेपर
💻 computer science

Mask-aware inference with State-Space Models

यह शोधपत्र 'पार्शियल विजन मंबा' (PVM) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चरल घटक है जो मास्क-अवेयर ऑपरेशन्स के माध्यम से मनमाने आकार के अमान्य डेटा को संभालने के लिए मंबा जैसे स्टेट स्पेस मॉडल्स को अनुकूलित करता है, और डेप्थ कम्प्लीशन, इमेज इनपेंटिंग और क्लासिफिकेशन कार्यों में इसकी प्रभावशीलता को प्रदर्शित करता है।

मूल लेखक: Ignasi Mas, Ramon Morros, Javier-Ruiz Hidalgo, Ivan Huerta

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ignasi Mas, Ramon Morros, Javier-Ruiz Hidalgo, Ivan Huerta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पहेली सुलझाने की कोशिश कर रहे हैं, लेकिन किसी ने तस्वीर के यादृच्छिक (random), ऊबड़-खाबड़ टुकड़ों को काट दिया है और उनकी जगह खाली सफेद कागज लगा दिया है। आपको पूरी तस्वीर को समझने या गायब हिस्सों को भरने के लिए अभी भी पूरी छवि को देखने की आवश्यकता है।

यह ठीक वही समस्या है जिसका सामना कंप्यूटर विजन सिस्टम वास्तविक दुनिया के डेटा के साथ करते हैं। सेंसर (जैसे कि सेल्फ-ड्राइविंग कारों पर लगे सेंसर) के पास अक्सर "ब्लाइंड स्पॉट्स" (अंधे धब्बे) होते हैं, या गोपनीयता के लिए छवियों के कुछ हिस्सों को ब्लॉक कर दिया जाता है।

यह पेपर AI के लिए इन "खाली स्थानों" को बिना भ्रमित हुए संभालने का एक नया तरीका पेश करता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

समस्या: "अंधा" AI

अधिकांश आधुनिक AI मॉडल (जैसे लोकप्रिय Mamba आर्किटेक्चर) एक बहुत ही तेज़, कुशल पाठक की तरह हैं जो पन्ने दर पन्ने किताब पढ़ता है।

  • समस्या: यदि पाठक को एक खाली पन्ना या ऐसे पन्ने का सामना करना पड़ता है जिसमें अर्थहीन शब्द (gibberish) हों (यानी "अमान्य डेटा"), तो वह फिर भी उसे पढ़ने की कोशिश करता है। वह खाली स्थान को ऐसे मानता है जैसे उसमें कोई महत्वपूर्ण जानकारी हो।
  • परिणाम: पाठक भ्रमित हो जाता है, उसकी समझ खराब हो जाती है, और वह गलतियाँ करता है। अतीत में, इसे पुराने AI मॉडल (CNNs) के लिए इस तरह हल किया गया था कि उन्हें बताया जाए, "खाली स्थानों को अनदेखा करें और केवल उन्हीं शब्दों को पढ़ें जो वहाँ मौजूद हैं।" लेकिन नए, तेज़ Mamba मॉडल्स में यह "अनदेखा करने वाला" बटन पहले से बना हुआ नहीं था।

समाधान: पार्शियल विज़न माम्बा (PVM)

लेखकों ने पार्शियल विज़न माम्बा (PVM) नामक एक नया टूल बनाया है। PVM को एक AI को स्मार्ट चश्मा और एक विशेष हाइलाइटर देने के रूप में समझें।

यह यहाँ कैसे काम करता है, चरण-दर-चरण देखें:

1. "स्मार्ट चश्मा" (द मास्क)

AI के इमेज देखने से पहले ही, वह ऐसा चश्मा पहन लेता है जो हर खाली या टूटे हुए स्थान पर एक लाल "X" और हर वैध स्थान पर एक हरा टिक मार्क दिखाता है। इसे मास्क (Mask) कहा जाता है। अब AI को ठीक-ठीक पता है कि डेटा कहाँ गायब है।

2. "पार्शियल पैच" (पहेली का टुकड़ा)

AI इमेज को प्रोसेस करने के लिए उसे छोटे वर्गाकार टाइल्स (patches) में तोड़ देता है।

  • पुराना तरीका: यदि एक टाइल में एक भी पिक्सेल "खाली कागज" जैसा होता, तो AI उस पूरी टाइल को कचरा मानकर फेंक देता, या उससे भी बुरा, वह अनुमान लगाने की कोशिश करता कि वहाँ क्या था और गलत हो जाता।
  • PVM का तरीका: AI टाइल को देखता है। यदि इसमें कुछ वैध पिक्सेल हैं, तो वह कहता है, "ठीक है, यह टाइल उपयोगी है!" वह एक विशेष तकनीक (जिसे पार्शियल लीनियर प्रोजेक्शन कहा जाता है) का उपयोग करता है ताकि खाली स्थानों का औसत निकाला जा सके ताकि वे गणित को बिगाड़ न सकें। यह प्रभावी रूप से कहता है, "मैं केवल उन्हीं आवाजों को सुनूँगा जिन्हें मैं सुन सकता हूँ, और सन्नाटे को अनदेखा कर दूँगा।"

3. "गुप्त कोड" (लर्नड टोकन्स)

क्या होता है अगर पूरी टाइल ही खाली कागज हो? AI उसे बस छोड़ नहीं सकता, वरना वह कहानी का प्रवाह खो देगा।

  • समाधान: PVM खाली टाइल को एक विशेष "प्लेसहोल्डर टोकन" से बदल देता है। इसे एक लाइब्रेरियन द्वारा टूटी हुई किताब पर लगाए गए विशिष्ट "आउट ऑफ ऑर्डर" (काम नहीं कर रहा) साइन की तरह समझें। AI सीखता है कि यह साइन का मतलब है "इसे अनदेखा करें, लेकिन प्रवाह बनाए रखें।" यह टूटे हुए हिस्से को बाकी कहानी को दूषित नहीं करने देता।

यह एक बड़ी बात क्यों है?

लेखकों ने इस "स्मार्ट चश्मा" सिस्टम का परीक्षण तीन बहुत अलग कार्यों पर किया:

  1. डेप्थ कम्पलीशन (3D मैप): कल्पना कीजिए कि एक सेल्फ-ड्राइविंग कार सड़क का 3D मैप बनाने की कोशिश कर रही है, लेकिन उसके लेजर स्कैनर के बीच में डेटा गायब है।

    • PVM के बिना: कार सोचती है कि गायब डेटा एक सपाट सड़क या दीवार है, जिससे दुर्घटना हो सकती है।
    • PVM के साथ: कार गायब स्थानों को अनदेखा करती है और केवल उसी डेटा का उपयोग करके एक सटीक मैप बनाती है जो उसके पास वास्तव में उपलब्ध है। पेपर में दिखाया गया कि इससे सटीकता में 23% का सुधार हुआ।
  2. इमेज इनपेंटिंग (आर्ट रिस्टोरर): कल्पना कीजिए कि एक प्रसिद्ध पेंटिंग के बीच में एक छेद है। आप चाहते हैं कि AI उस छेद को बाकी चित्र से मेल खाने के लिए भर दे।

    • PVM के बिना: AI छेद से भ्रमित हो जाता है और एक धुंधला सा या अजीब दिखने वाला चित्र बनाता है।
    • PVM के साथ: AI पेंटिंग के केवल वैध हिस्सों पर ध्यान केंद्रित करता है ताकि वह अनुमान लगा सके कि छेद में क्या होना चाहिए, जिससे अधिक यथार्थवादी परिणाम मिलता है।
  3. इमेज क्लासिफिकेशन (सिक्योरिटी गार्ड): कल्पना कीजिए कि एक सुरक्षा कैमरा एक व्यक्ति की पहचान करने की कोशिश कर रहा है, लेकिन उनके चेहरे पर एक बड़ा स्टिकर लगा है।

    • PVM के बिना: AI उस स्टिकर को देखता है और सोचता है, "मुझे नहीं पता कि यह क्या है," या गलत अनुमान लगाता है।
    • PVM के साथ: AI दिखाई देने वाले हिस्सों (कंधे, शर्ट, बाल) को देखता है और स्टिकर को पूरी तरह से अनदेखा करते हुए व्यक्ति की सही पहचान करता है। इससे सटीकता में 36% का सुधार हुआ।

निचोड़ (The Bottom Line)

यह पेपर एक खेल के लिए नया नियम बनाने जैसा है: "यदि बोर्ड का कोई हिस्सा गायब है, तो यह अनुमान लगाने की कोशिश न करें कि उसके नीचे क्या है; बस उन टुकड़ों के साथ खेलें जो आपके पास हैं।"

नए, तेज़ AI मॉडल्स (Mamba) को टूटे हुए डेटा को समझने के बजाय उसे अनदेखा करना सिखाकर, लेखकों ने इन मॉडल्स को बहुत अधिक मजबूत, सटीक और वास्तविक, अपूर्ण दुनिया के लिए तैयार कर दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →