← नवीनतम पेपर
🤖 machine learning

On Subquadratic Architectures: From Applications to Principles

यह शोध पत्र कोड और टाइम-सीरीज कार्यों में अग्रणी सबक्वाड्रेटिक आर्किटेक्चर (xLSTM, Mamba-2, और Gated DeltaNet) का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि xLSTM अपने गेटिंग स्कीम के कारण बेहतर प्रदर्शन प्राप्त करता है जो अधिक लचीले और स्थिर मेमोरी सुधार और स्टेट ट्रैकिंग को सक्षम बनाता है।

मूल लेखक: Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट असिस्टेंट बनाने की कोशिश कर रहे हैं जो एक विशाल किताब पढ़ सके, जटिल कंप्यूटर कोड लिख सके, या अगले सप्ताह के मौसम की भविष्यवाणी कर सके। सालों से, उद्योग का मानक एक विशिष्ट प्रकार का इंजन रहा है जिसे ट्रांसफॉर्मर (Transformer) कहा जाता है। यह अविश्वसनीय रूप से शक्तिशाली है, लेकिन इसमें एक बड़ी खामी है: जैसे-जैसे सूचना की मात्रा (यानी "अनुक्रम") बढ़ती है, यह इंजन तेजी से भारी और धीमा होता जाता है। यह ऐसा है जैसे आप एक बैकपैक ले जाने की कोशिश कर रहे हों जहाँ हर नई किताब जोड़ने पर आपका बैग पिछले वाले की तुलना में दोगुना भारी हो जाता है।

इसे ठीक करने के लिए, वैज्ञानिकों ने सबक्वाड्रेटिक आर्किटेक्चर (Subquadratic Architectures) का आविष्कार किया। ये नए इंजन डिजाइन हैं जिनका उद्देश्य हल्का और तेज़ होना है, जो सूचना की मात्रा के साथ केवल रैखिक (linearly) रूप से बढ़ते हैं। लेकिन कौन सा नया इंजन वास्तव में सबसे अच्छा है?

यह पेपर तीन शीर्ष दावेदारों के बीच एक दौड़ लगाता है: xLSTM, Mamba-2, और Gated DeltaNet। उन्होंने इन्हें तीन बहुत कठिन कार्यों पर परखा:

  1. कोड लिखना: एक कार्य जो सख्त नियमों और तर्क की लंबी श्रृंखलाओं से भरा है।
  2. एक शिक्षक से सीखना: एक बहुत ही स्मार्ट AI को लेकर एक छोटे, तेज़ AI को उसके कौशल की नकल करना सिखाना।
  3. टाइम सीरीज़ की भविष्यवाणी करना: स्टॉक की कीमतों या मौसम जैसी चीजों का पूर्वानुमान लगाना, जहाँ अतीत भविष्य को जटिल तरीकों से प्रभावित करता है।

दौड़ के परिणाम

हर क्षेत्र में, xLSTM विजेता रहा। यह सबसे सुसंगत और सटीक इंजन था, विशेष रूप से उन कार्यों के लिए जो जटिल थे और जिनमें लंबी घटनाओं की श्रृंखला को याद रखने की आवश्यकता थी। Mamba-2 और Gated DeltaNet अच्छे थे, लेकिन वे काम के सबसे कठिन हिस्सों पर अधिक लड़खड़ा गए।

xLSTM क्यों जीता? ("मेमोरी" का रूपक)

यह समझने के लिए कि ऐसा क्यों हुआ, लेखकों ने इसके आंतरिक कामकाज को देखा। उन्होंने महसूस किया कि ये सभी इंजन इस बात से काम करते हैं कि वे अब तक जो कुछ भी देखा है उसका एक "स्टेट" या "मेमोरी" (स्मृति) बनाए रखते हैं। उन्होंने तुलना की कि प्रत्येक इंजन इन दो महत्वपूर्ण स्मृति कौशलों को कैसे संभालता है:

  1. संचय (Accumulation - "काउंटर"): एक लंबी अवधि तक रनिंग टोटल या गिनती रखने की क्षमता (जैसे कि यह गिनना कि 100 पन्नों के दस्तावेज़ में एक विशिष्ट शब्द कितनी बार आया है)।
  2. स्टेट ट्रैकिंग (State Tracking - "ट्रैकर"): विशिष्ट, क्रमबद्ध विवरणों को याद रखने और बिना लय खोए उन्हें सही ढंग से अपडेट करने की क्षमता (जैसे कि यह याद रखना कि "यदि A होता है, तो B होना चाहिए, जब तक कि C पहले न हुआ हो")।

यहाँ बताया गया है कि ये तीनों इंजन इन कौशलों को कैसे संभालते हैं:

  • Mamba-2 एक बंधे हुए हाथ वाले सख्त लाइब्रेरियन की तरह है। इसके पास एक नियम है जो कहता है, "यदि मैं कुछ भूल जाता हूँ, तो मुझे नई चीजें लिखना भी बंद करना होगा।" क्योंकि इसके "भूलने" और "लिखने" के स्विच आपस में जुड़े हुए हैं, इसलिए इसे अपनी मेमोरी को लचीले ढंग से अपडेट करने में संघर्ष करना पड़ता है। यह कुछ चीजों में अच्छा है, लेकिन अक्सर गिनती खो देता है या कहानी बहुत लंबी होने पर भ्रमित हो जाता है।
  • Gated DeltaNet एक इरेज़र (मिटाने वाले) वाले व्हाइटबोर्ड की तरह है। यह पुरानी जानकारी को नई जानकारी से बदलने में बहुत अच्छा है। यदि कोई नया तथ्य आता है, तो यह पुराने को बोर्ड से मिटा देता है। यह सूचना खोजने (retrieval) के लिए तो बढ़िया है, लेकिन गिनती करने के लिए बहुत बुरा है। यदि आपको याद रखना है कि "A + B + C = 10," और बोर्ड नए तथ्यों के लिए जगह बनाने के लिए पुराने नंबरों को मिटाता रहता है, तो आप कुल योग खो देंगे।
  • xLSTM एक हाइलाइटर और कैलकुलेटर वाले स्मार्ट नोटबुक की तरह है। यह अपनी मेमोरी को दो भागों में विभाजित करता है:
    • एक भाग एक कैलकुलेटर की तरह कार्य करता है जो कुछ भी मिटाए बिना एक रनिंग टोटल (संचय) रख सकता है।
    • दूसरा भाग एक नोटबुक की तरह कार्य करता है जो विशिष्ट स्टेट्स को ट्रैक कर सकता है और उन्हें लचीले ढंग से अपडेट कर सकता है (स्टेट ट्रैकिंग)।
    • महत्वपूर्ण बात यह है कि xLSTM के पास एक विशेष "गेट" है जो एक सॉफ्ट इरेज़र की तरह काम करता है। केवल एक पेज को साफ करने (DeltaNet की तरह) या मिटाने में असमर्थ होने (Mamba की तरह) के बजाय, यह पुरानी जानकारी को धुंधला कर सकता है यदि नई जानकारी अधिक महत्वपूर्ण है, या पुरानी जानकारी को तब तक रख सकता है जब तक वह प्रासंगिक है। यह लचीलापन इसे एक ही समय में गिनती और ट्रैकिंग दोनों को पूरी तरह से करने की अनुमति देता है।

प्रमाण: "लॉन्ग स्ट्रिंग" टेस्ट

इस सिद्धांत को साबित करने के लिए, लेखकों ने काल्पनिक कार्यों के साथ एक सरल परीक्षण चलाया:

  • काउंटिंग टेस्ट: एक सूची में वस्तुओं को गिनने के लिए कहें जो उससे कहीं अधिक लंबी है जितने समय के लिए उसे प्रशिक्षित किया गया था।
  • ट्रैकिंग टेस्ट: एक लंबी अनुक्रम (sequence) में "विषम" (odd) और "सम" (even) के बदलावों के विशिष्ट पैटर्न को याद रखने के लिए कहें।

परिणाम:

  • Mamba-2 तुरंत विफल हो गया। जैसे-जैसे सूची लंबी होती गई, वह सब कुछ भूल गया।
  • Gated DeltaNet थोड़ी गिनती कर सका, लेकिन ट्रैकिंग कार्यों में भ्रमित हो गया। भले ही इसे बेहतर ट्रैकिंग के लिए ट्यून किया गया हो, फिर भी यह बहुत लंबी दूरी तक गिनती करने में संघर्ष करता रहा।
  • xLSTM एकमात्र ऐसा था जो दोनों कर सका। यह लंबी दूरी तक पूरी तरह से गिन सकता था और अपनी जगह खोए बिना जटिल पैटर्न को ट्रैक भी कर सकता था।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि जटिल कार्यों के लिए xLSTM वर्तमान में बेहतर विकल्प है क्योंकि यह दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है: एक रनिंग टोटल (संचय) रखने की क्षमता और विशिष्ट, बदलते विवरणों को ट्रैक करने की क्षमता, और इन दोनों के बीच चयन करने के लिए मजबूर हुए बिना। जबकि अन्य इंजन इनमें से एक में अच्छे हैं, xLSTM का लचीला "मेमोरी करेक्शन" तंत्र इसे वास्तविक दुनिया के कोड और डेटा में पाई जाने वाली जटिल, दीर्घकालिक निर्भरताओं को संभालने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →