← नवीनतम पेपर
⚡ electrical engineering

On the Generalization Properties of Selective State-Space Models for Filtering Tasks for Unknown Systems

यह शोध पत्र अज्ञात प्रणालियों के लिए ऑनलाइन फ़िल्टरिंग करने की सेलेक्टिव स्टेट-स्पेस मॉडल्स (SSMs) की क्षमता का सैद्धांतिक विश्लेषण और अनुभवजन्य प्रदर्शन करता है, जो सामान्यीकरण सीमाएं (generalization bounds) प्रदान करता है और ट्रांसफॉर्मर आर्किटेक्चर के विरुद्ध उनके प्रदर्शन की तुलना करता है।

मूल लेखक: Alex Tang, M. Emrullah Ildiz, Batin Kurt, Samet Oymak, Necmiye Ozay

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Alex Tang, M. Emrullah Ildiz, Batin Kurt, Samet Oymak, Necmiye Ozay

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पेंडुलम की गति का अनुमान लगाना सीख रहे हैं, लेकिन आपके पास इसके लिए गणितीय सूत्र नहीं हैं। आपके पास केवल इसका एक वीडियो है जो झूल रहा है। आपको वीडियो देखते हुए, वास्तविक समय (real-time) में, यह अनुमान लगाना है कि अगला एक सेकंड में पेंडुलम कहाँ होगा।

यह शोध पत्र इस बात पर चर्चा करता है कि कंप्यूटर वास्तव में यह कैसे कर सकते हैं। यह दो "मस्तिष्क" (AI आर्किटेक्चर) की तुलना करता है ताकि यह देखा जा सके कि रहस्यमय, अज्ञात प्रणालियों के लिए "अगली चाल का अनुमान लगाने" का यह खेल खेलने में कौन बेहतर है।

दो प्रतिस्पर्धी

1. ट्रांसफॉर्मर (द "लाइब्रेरी के साथ गोल्डफिश" दृष्टिकोण):
ट्रांसफॉर्मर (जैसे ChatGPT के पीछे की तकनीक) अविश्वसनीय रूप से स्मार्ट हैं, लेकिन उनके सोचने का एक विशिष्ट तरीका है। वर्तमान में क्या हो रहा है, इसे समझने के लिए वे देखते हैं कि पहले क्या हुआ था। कल्पना कीजिए कि एक व्यक्ति अब तक किए गए हर एक मूव की तस्वीरों के एक विशाल ढेर को देखकर अगले डांस स्टेप का अनुमान लगाने की कोशिश कर रहा है।

  • समस्या: जैसे-जैसे डांस लंबा होता जाता है, तस्वीरों का वह ढेर बहुत भारी होता जाता है। यदि डांस बहुत लंबा चलता है, तो ट्रांसफॉर्मर की "याददाश्त खत्म" हो जाती है या वह इतिहास को बार-बार फिर से पढ़ने के बोझ से दब जाता है।

2. सिलेक्टिव एसएसएम (द "अनुभवी एथलीट" दृष्टिकोण):
सिलेक्टिव स्टेट-स्पेस मॉडल (SSM), विशेष रूप से माम्बा (Mamba) नामक एक संस्करण, अलग तरह से काम करता है। पूरी हिस्ट्री का विशाल ढेर उठाने के बजाय, यह गति का एक "मानसिक सारांश" (mental summary) बनाए रखता है। यह एक ऐसे एथलीट की तरह है जिसे लय को समझने के लिए पूरा गेम दोबारा देखने की जरूरत नहीं है; वे बस अपनी मांसपेशियों में गति (momentum) को महसूस करते हैं।

  • लाभ: क्योंकि यह केवल एक "सारांश" (एक हिडन स्टेट) लेकर चलता है न कि पूरी हिस्ट्री को, इसलिए यह कभी भी अभिभूत (overwhelmed) नहीं होता। यह घंटों या दिनों तक चलने वाले डांस को बिना थके देख सकता है।

शोधकर्ताओं ने क्या पाया

शोधकर्ताओं ने इन दोनों "मस्तिष्कों" को चार अलग-अलग परीक्षणों के माध्यम से परखा ताकि यह देखा जा सके कि वे "अज्ञात" प्रणालियों को कैसे संभालते हैं:

  • परीक्षण 1: सुगम यात्रा (लीनियर-गौसियन): सब कुछ अनुमानित और साफ है।
    • परिणाम: दोनों ने अच्छा प्रदर्शन किया, लेकिन SSM ने ट्रांसफॉर्मर की तुलना में बहुत कम "मस्तिष्क शक्ति" (कम पैरामीटर्स) का उपयोग करके इसे किया।
  • परीक्षण 2: अचानक मोड़ (डायनेमिक्स स्विच): आधे रास्ते में, खेल के नियम अचानक बदल जाते हैं (जैसे पेंडुलम अचानक भारी हो गया हो)।
    • परिणाम: ट्रांसफॉर्मर भ्रमित हो गया। हालाँकि, SSM ने लय में बदलाव को "महसूस" किया और बहुत तेज़ी से खुद को अनुकूलित कर लिया।
  • परीक्षण 3: स्टैटिक/शोर (कलर्ड नॉइज़): "वीडियो" बहुत दानेदार और हिलता हुआ है।
    • परिणाम: SSM, असली पैटर्न को खोजने के लिए उस "धुंधलेपन" के पार देखने में बेहतर था।
  • परीक्षण 4: लंबी दौड़ (लेंथ जनरलाइजेशन): मॉडल्स को छोटे वीडियो पर प्रशिक्षित किया गया था लेकिन फिर उन्हें बहुत लंबे वीडियो का अनुमान लगाने के लिए कहा गया।
    • परिणाम: जैसे-जैसे सीक्वेंस लंबा होता गया, ट्रांसफॉर्मर अपना रास्ता भटक गया। SSM शांत रहा और सटीक बना रहा।

"सीक्रेट सॉस" (गणित वाला भाग)

इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा केवल यह नहीं है कि SSM काम कर गया, बल्कि यह है कि लेखकों ने गणित का उपयोग करके यह साबित किया कि यह क्यों काम करता है।

उन्होंने सिद्ध किया कि क्योंकि SSM "स्थिर" (stable) है (यह पुराने, छोटे-छोटे एरर को बड़ी गलतियों में बदलने नहीं देता), इसकी सीखने की क्षमता अधिक डेटा देखते ही तेजी से (exponentially) बेहतर होती जाती है। उन्होंने एक गणितीय "गारंटी" प्रदान की कि SSM मौलिक रूप से चलते हुए, बदलते हुए सिस्टम को ट्रैक करने के लिए ट्रांसफॉर्मर की तुलना में बेहतर तरीके से सुसज्जित है।

मुख्य निष्कर्ष

यदि आप चाहते हैं कि एक AI कविता लिखे या आपसे चैट करे, तो एक ट्रांसफॉर्मर बेहतरीन है। लेकिन यदि आप चाहते हैं कि एक AI ड्रोन को उड़ाए, पावर ग्रिड की निगरानी करे, या वास्तविक समय में किसी जटिल मशीन की गति का अनुमान लगाए, तो SSM एक बेहतर उपकरण है क्योंकि यह तेज़ है, हल्का है, और "अतीत में खो" नहीं जाता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →