← नवीनतम पेपर
⚡ electrical engineering

Geometric SSM: LTI State Space Models for Selective Tasks

यह शोधपत्र 'जियोमेट्रिक एसएसएम' (Geometric SSM) को पेश करके इस प्रचलित धारणा को चुनौती देता है कि स्टेट स्पेस मॉडल्स (State Space Models) में चयनात्मकता के लिए समय-परिवर्तनीय गतिकी (time-varying dynamics) की आवश्यकता होती है, जो चयनात्मक पैटर्न पहचान और इंडक्शन कार्यों पर बेहतर प्रदर्शन प्राप्त करने के लिए ज्यामितिक नियंत्रण सिद्धांत (geometric control theory) का लाभ उठाता है और साथ ही कुशल लीनियर टाइम-इनवेरिएंट (LTI) गुणों को भी बनाए रखता है।

मूल लेखक: Umberto Casti, Giacomo Baggio, Sandro Zampieri, Fabio Pasqualetti

प्रकाशित 2026-03-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Umberto Casti, Giacomo Baggio, Sandro Zampieri, Fabio Pasqualetti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Geometric SSMs with LTI Dynamics for Selective Sequence Modeling" पेपर का एक सरल भाषा में अनुवाद दिया गया है, जिसमें रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।

मुख्य विचार: "नियम पुस्तिका" को तोड़ना

कल्पना कीजिए कि आप एक रोबट को कहानी पढ़ना सिखा रहे हैं। रोबट को यह जानने की जरूरत है कि उसे क्या याद रखना है और किसे अनदेखा करना है। यदि कोई पात्र कहता है "एक समय की बात है," तो रोबट को इसे याद रखना चाहिए। यदि कोई पात्र छींकता है, तो रोबट को शायद इसे तुरंत भूल जाना चाहिए।

AI की दुनिया में, चुनने और छोड़ने की इस क्षमता को Selectivity (चयनात्मकता) कहा जाता है।

हाल ही में, Mamba नामक एक लोकप्रिय AI मॉडल ने दावा किया कि इस "selectivity" को पाने के लिए, रोबोट के मस्तिष्क को अभी जो वह पढ़ रहा है, उसके आधार पर अपने आंतरिक नियमों को लगातार बदलना होगा। उन्होंने तर्क दिया कि यदि नियम स्थिर (एक "static" या LTI सिस्टम) रहते हैं, तो रोबोट शोर (noise) को छानने के लिए बहुत मंद होगा।

यह पेपर कहता है: "इतना भी जल्दी मत मानिए!"

लेखक, जो इंजीनियरों और गणितज्ञों की एक टीम है, का तर्क है कि स्मार्ट होने के लिए आपको अपनी नियम पुस्तिका को लगातार फिर से लिखने की आवश्यकता नहीं है। आपको बस शुरुआत से ही अपनी नियम पुस्तिका को बहुत चतुराई से डिजाइन करने की आवश्यकता है। उन्होंने एक नया मॉडल बनाया जिसे Geometric SSM कहा जाता है, जो यह सिद्ध करता है कि एक "स्थिर" मस्तिष्क एक "गतिशील" (dynamic) मस्तिष्क जितना ही चयनात्मक हो सकता है, लेकिन यह तेज़ और प्रशिक्षित करने में आसान है।


उपमा: बाउंसर बनाम स्मार्ट फिल्टर

अंतर को समझने के लिए, आइए एक नाइट क्लब की कल्पना करें।

1. Mamba का दृष्टिकोण (गतिशील बाउंसर - The Dynamic Bouncer)

Mamba मॉडल में, दरवाजे पर खड़ा बाउंसर हर सेकंड अपना मन बदल देता है कि उसके सामने कौन खड़ा है।

  • यह कैसे काम करता है: यदि कोई VIP आता है, तो बाउंसर अपनी लिस्ट चेक करता है, VIP को देखता है, और कहता है, "ठीक है, आप अंदर आ सकते हैं!" यदि कोई आम आदमी आता है, तो वह कहता है, "नहीं।"
  • समस्या: बाउंसर को हर एक व्यक्ति के लिए तुरंत रुकना, सोचना और अपना निर्णय फिर से कैलकुलेट करना पड़ता है। वह उस व्यक्ति के इतिहास या उनके समूह को नहीं देख सकता; वह केवल उसी व्यक्ति को देखता है जो अभी वहां खड़ा है।
  • खामी: यदि VIP ने वेश बदल रखा है और दोस्तों के समूह के साथ आया है, तो बाउंसर भ्रमित हो सकता है क्योंकि वह समूह के पैटर्न को याद नहीं रख पाता। उसे हर बार सब कुछ शून्य से फिर से जांचना पड़ता है।

2. Geometric SSM का दृष्टिकोण (स्मार्ट फिल्टर - The Smart Filter)

लेखक एक अलग प्रणाली का प्रस्ताव करते हैं। एक ऐसे बाउंसर के बजाय जो अपना मन बदलता रहता है, वे एक हाई-टेक सुरक्षा गेट का उपयोग करते हैं जिसमें एक पूर्व-निर्धारित, अपरिवर्तनीय नियम पुस्तिका होती है।

  • यह कैसे काम करता है: गेट को विशिष्ट "लेन" (गणितीय स्थान) के साथ डिजाइन किया गया है।
    • यदि आप लाल टोपी पहनकर आते हैं (डेटा), तो गेट स्वचालित रूप से एक लाल लेन खोल देता है।
    • यदि आप नीली टोपी पहनकर आते हैं (शोर/noise), तो गेट आपको स्वचालित रूप से एक डेड-एंड लेन की ओर निर्देशित कर देता है जहाँ आप गायब हो जाते हैं।
  • जादू: गेट स्वयं अपने नियम कभी नहीं बदलता। यह एक स्थिर मशीन है। हालाँकि, क्योंकि इस मशीन को Geometric Control Theory (गणित की एक उन्नत शाखा) का उपयोग करके डिजाइन किया गया है, यह जानता है कि विभिन्न पैटर्न को कैसे रूट (route) करना है।
  • याददाश्त: महत्वपूर्ण बात यह है कि इस गेट में एक "मेमोरी लेन" है। यदि कोई VIP एक समूह के साथ आता है, तो गेट पिछले कुछ सेकंड के समूह के पैटर्न को याद रखता है। यह केवल दरवाजे पर खड़े व्यक्ति को नहीं देखता; यह लोगों के अनुक्रम (sequence) को देखता है।

यह क्यों मायने रखता है?

यह पेपर AI के एक बड़े अनुमान को चुनौती देता है: "स्मार्ट होने के लिए, आपको अराजक/परिवर्तनशील होना चाहिए।"

लेखक दिखाते हैं कि व्यवस्था (LTI) उतनी ही शक्तिशाली हो सकती है जितनी कि अराजकता (Time-Varying), यदि आप ज्यामिति (geometry) का उपयोग करते हैं।

यहाँ उनके नए Geometric SSM की तीन मुख्य जीतें दी गई हैं:

  1. "मल्टी-टोकन" टेस्ट (विस्तारित इंडक्शन हेड):

    • चुनौती: एक गुप्त कोड की कल्पना करें जहाँ आपको दरवाजा खोलने के लिए 4-शब्दों वाले वाक्यांश (जैसे, "लाल सेब नीला आकाश") को याद रखना है।
    • Mamba की विफलता: क्योंकि Mamba केवल वर्तमान शब्द को देखता है, वह भटक जाता है। वह "लाल" देखता है, फिर "सेब", फिर "नीला", और फिर वह वाक्यांश की शुरुआत भूल जाता है। वह टेस्ट में विफल हो जाता है।
    • Geometric SSM की सफलता: क्योंकि इसमें एक अंतर्निहित "रेसिड्यूअल जनरेटर" (याद रखने वाला घटक) है, यह पूरे वाक्यांश को याद रखता है। यह पैटर्न को पहचान लेता है और दरवाजा पूरी तरह से खोल देता है।
  2. गति और दक्षता (FFT सुपरहाइवे):

    • Mamba के बदलते नियम डेटा को समानांतर (parallel) रूप से प्रोसेस करने की क्षमता को तोड़ देते हैं (जैसे एक फैक्ट्री असेंबली लाइन)। इसे चीजों को एक-एक करके प्रोसेस करना पड़ता है, जो धीमा है।
    • Geometric SSM अपने नियमों को स्थिर रखता है। यह इसे FFT (Fast Fourier Transform) का उपयोग करने की अनुमति देता है—एक गणितीय शॉर्टकट जो इसे पूरी कहानी को एक साथ प्रोसेस करने देता है, जैसे कि एक सुपर-फास्ट असेंबली लाइन। यह तेज़ है और कम कंप्यूटर मेमोरी का उपयोग करता है।
  3. सरलता:

    • इन कार्यों में कुशल होने के लिए Mamba को भारी मात्रा में पैरामीटर्स (मेमोरी) की आवश्यकता होती है।
    • Geometric SSM ने अपने टेस्ट पर 50 पैरामीटर्स के साथ लगभग सटीक स्कोर प्राप्त किया, जबकि Mamba को 700 की आवश्यकता थी और फिर भी वह कठिन टेस्ट में पीछे रह गया। यह 700 टुकड़ों के बजाय 50 टुकड़ों के साथ पहेली सुलझाने जैसा है।

निष्कर्ष (Takeaway)

यह पेपर मूल रूप से कह रहा है: "हमें AI को स्मार्ट बनाने के लिए पहिये का पुनरुद्धार करने की आवश्यकता नहीं है। हमें बस एक बेहतर पहिया बनाने की आवश्यकता है।"

पुराने स्कूल के, कठोर गणित (Geometric Control Theory) का उपयोग करके, बजाय इसके कि वे सिस्टम को लगातार बदलते रहने दें, उन्होंने एक ऐसा मॉडल बनाया जो:

  • पैटर्न को बेहतर तरीके से याद रखता है।
  • शोर (noise) को अधिक प्रभावी ढंग से छानता है।
  • तेज़ी से प्रशिक्षित होता है और कम ऊर्जा का उपयोग करता है।

यह एक अनुस्मारक है कि कभी-कभी, सबसे उन्नत समाधान एक अराजक, निरंतर बदलने वाली प्रणाली नहीं होता, बल्कि एक पूर्णतः इंजीनियर की गई, स्थिर प्रणाली होती है जो जानती है कि सूचना के प्रवाह को कैसे संभालना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →