← नवीनतम पेपर
🤖 machine learning

Adaptive Memory Decay for Log-Linear Attention

यह शोध पत्र 'एडैप्टिव मेमोरी डिके' (Adaptive Memory Decay) का प्रस्ताव करता है, जो एक हल्के एमएलपी (MLP) के माध्यम से लॉग-लीनियर अटेंशन में फिक्स्ड डिके पैरामीटर को एक इनपुट-डिपेंडेंट, लर्नबल मैकेनिज्म से बदलकर, मॉडल की लॉग-लीनियर कम्प्यूटेशनल कॉम्प्लेक्सिटी को बनाए रखते हुए लॉन्ग-रेंज मेमोरी परफॉरमेंस और फ्लेक्सिबिलिटी को बढ़ाता है।

मूल लेखक: Yaxita Amin, Helen Zichen Li, Mengfan Zhang, Samet Ayhan

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yaxita Amin, Helen Zichen Li, Mengfan Zhang, Samet Ayhan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी, जैसे कि कोई उपन्यास या फिल्म की कहानी, याद रखने की कोशिश कर रहे हैं। इसे अच्छी तरह से करने के लिए, आपको एक ऐसी स्मृति प्रणाली (memory system) की आवश्यकता है जो अभी-अभी हुई छोटी से छोटी जानकारी (जैसे किसी पात्र के चेहरे के भाव) और घंटों पहले हुई बड़ी घटना (जैसे मुख्य खलनायक की योजना) दोनों को संभाल सके।

यह शोध पत्र कंप्यूटर मॉडलों (AI) की एक समस्या पर काम करता है जो यही करने की कोशिश करते हैं: सूचना के लंबे अनुक्रमों (sequences) को याद रखना।

समस्या: "एक ही आकार सबके लिए" वाली स्मृति (The "One-Size-Fits-All" Memory)

वर्तमान AI मॉडल के पास एक कठिन विकल्प है:

  1. "परफेक्ट" मेमोरी (ट्रांसफॉर्मर्स - Transformers): वे सब कुछ पूरी तरह से याद रखते हैं लेकिन जैसे-जैसे कहानी लंबी होती जाती है, वे अविश्वसनीय रूप से धीमे और महंगे हो जाते हैं। यह ऐसा है जैसे हर बार पेज 50 के बारे में पूछने के लिए आपको 1,000 पन्नों की किताब का हर एक पन्ना फिर से पढ़ना पड़े।
  2. "तेज़" मेमोरी (लीनियर/स्टेट-स्पेस मॉडल्स - Linear/State-Space Models): ये बहुत तेज़ होते हैं क्योंकि ये पूरी कहानी को एक छोटे से सारांश नोट में संकुचित (compress) कर देते हैं। लेकिन, वे अक्सर विशिष्ट विवरण भूल जाते हैं। यह ऐसा है जैसे 1,000 पन्नों की किताब को केवल एक वाक्य के सारांश के माध्यम से याद रखने की कोशिश करना; आप कहानी का सार खो देते हैं।
  3. "मध्य मार्ग" (लॉग-लीनियर अटेंशन - Log-Linear Attention): एक नया तरीका जिसे लॉग-लीनियर अटेंशन कहा जाता है, यह दोनों दुनियाओं का सर्वश्रेष्ठ होने की कोशिश करता है। एक सारांश नोट के बजाय, यह एक फेनविक ट्री (Fenwick Tree) का उपयोग करता है (इसे नेस्टेड फाइलिंग कैबिनेट की तरह समझें)।
    • कैबिनेट 1: पिछले कुछ पन्नों को रखता है (बहुत विस्तृत)।
    • कैबिनेट 2: पिछले कुछ अध्यायों को रखता है (थोड़ा सारांशित)।
    • कैबिनेट 3: पिछले कुछ खंडों को रखता है (बहुत सारांशित)।
    • और इसी तरह।

यह प्रणाली कुशल है। हालाँकि, इसके मूल संस्करण में एक दोष था: इसने सभी कैबिनेट के साथ एक जैसा व्यवहार किया। इसके पास एक "वॉल्यूम नॉब" (जिसे λ\lambda कहा जाता है) था जो यह तय करता था कि प्रत्येक कैबिनेट की कितनी बात सुननी है। लेकिन यह नॉब एक निश्चित, उबाऊ सेटिंग पर सेट था। इससे कोई फर्क नहीं पड़ता था कि आप 5 मिनट पहले के विवरण के बारे में पूछ रहे हैं या 5 घंटे पहले के किसी बड़े प्लॉट पॉइंट के बारे में; मॉडल सभी कैबिनेट को एक ही वॉल्यूम पर सुनता था। यह कठोर था और पूछे गए विशिष्ट प्रश्न के अनुसार अनुकूलित नहीं हो सकता था।

समाधान: एक स्मार्ट, एडेप्टिव वॉल्यूम नॉब

लेखक एक सरल लेकिन शक्तिशाली अपग्रेड का प्रस्ताव करते हैं: एडेप्टिव मेमोरी डिके (Adaptive Memory Decay)।

एक निश्चित वॉल्यूम नॉब के बजाय, उन्होंने इसे एक स्मार्ट, नन्हे मस्तिष्क (एक छोटा दो-परत वाला न्यूरल नेटवर्क) से बदल दिया जो वर्तमान प्रश्न को देखता है और ठीक से तय करता है कि प्रत्येक कैबिनेट की आवाज़ कितनी तेज़ होनी चाहिए।

  • यदि प्रश्न हाल के किसी विवरण के बारे में है: स्मार्ट मस्तिष्क "हालिया कैबिनेट" (Recent Cabinet) की आवाज़ बढ़ा देता है और दूसरों को कम कर देता है।
  • यदि प्रश्न किसी पुराने प्लॉट पॉइंट के बारे में है: यह "पुराने सारांश कैबिनेट" (Old Summary Cabinet) की आवाज़ बढ़ा देता है और हाल के शोर को अनदेखा कर देता है।

सीक्रेट सॉस: सॉफ्टप्लस (Softplus)
लेखकों ने इन वॉल्यूम को नियंत्रित करने के लिए सॉफ्टप्लस नामक एक विशिष्ट गणितीय उपकरण को चुना।

  • सॉफ्टमैक्स (Softmax) (पुराना तरीका) को एक सख्त शिक्षक के रूप में कल्पना करें जो कहता है, "यदि आप कैबिनेट 1 को सुनते हैं, तो आप कैबिनेट 2 को नहीं सुन सकते।" यह अनावश्यक प्रतिस्पर्धा पैदा करता है।
  • सॉफ्टप्लस (Softplus) एक सहायक लाइब्रेरियन की तरह है जो कहता है, "आप जितनी ज़रूरत हो उतनी कैबिनेट 1 और कैबिनेट 2 दोनों को सुन सकते हैं।" यह मॉडल को हाल के विवरणों को पुराने सारांशों के साथ बिना किसी संघर्ष के पूरी तरह से मिलाने की अनुमति देता है।

परिणाम: क्या यह काम करता है?

लेखकों ने तीन प्रकार की चुनौतियों पर इस नए "स्मार्ट वॉल्यूम नॉब" का परीक्षण किया:

  1. "चाबी खोजें" टेस्ट (एसोसिएटिव रिकॉल - Associative Recall): उन्होंने एक लंबी सूची में चाबियों और वैल्यू के जोड़े छिपा दिए और मॉडल को उन्हें खोजने के लिए कहा।

    • पुराना मॉडल: जब सूची लंबी हो गई, तो पुराना मॉडल भ्रमित हो गया और सब कुछ भूल गया (सटीकता शून्य के करीब गिर गई)।
    • नया मॉडल: यह तेज रहा और लंबी सूचियों में भी चाबियों को लगभग पूरी तरह से खोज लिया।
  2. "सुई की नकल करें" टेस्ट (सिलेक्टिव कॉपीइंग - Selective Copying): उन्होंने मॉडल को एक शोर भरे, लंबे वाक्य से विशिष्ट शब्दों को कॉपी करने और बाकी को अनदेखा करने के लिए कहा।

    • पुराना मॉडल: इसे संघर्ष करना पड़ा और यह अस्थिर हो गया, कभी अच्छा काम करता तो कभी पूरी तरह विफल हो जाता।
    • नया मॉडल: यह बहुत लंबे वाक्यों के साथ भी सुसंगत और सटीक था।
  3. "कहानी लिखें" टेस्ट (लैंग्वेज मॉडलिंग - Language Modeling): उन्होंने मॉडल को टेक्स्ट के अगले शब्दों की भविष्यवाणी करने के लिए कहा।

    • नया मॉडल: इसने पुराने मॉडल की तुलना में थोड़ा बेहतर, अधिक सुसंगत टेक्स्ट लिखा, विशेष रूप से जब टेक्स्ट लंबा था।

सबसे अच्छी बात: यह मुफ्त है!

इस शोध पत्र की सबसे प्रभावशाली बात यह है कि यह अपग्रेड अविश्वसनीय रूप से सस्ता है।

  • गति: यह मॉडल को धीमा नहीं करता है। यह मूल "मध्य मार्ग" पद्धति की तरह ही तेज़ गति बनाए रखता है।
  • आकार: यह लगभग कोई अतिरिक्त मेमोरी या कंप्यूटर पार्ट्स नहीं जोड़ता है (0.007% से भी कम)। यह एक कैलकुलेटर में एक छोटा, स्मार्ट चिप जोड़ने जैसा है जिससे कैलकुलेटर भारी नहीं होता।

सारांश

यह शोध पत्र दिखाता है कि AI मॉडल की मेमोरी सिस्टम को केवल इस आधार पर नहीं कि कब हुआ, बल्कि इस आधार पर कि क्या याद रखना है (प्रश्न की सामग्री के आधार पर) स्मार्ट बनाकर, हम इन मॉडलों को बिना धीमा या बड़ा किए लंबी कहानियों को याद रखने में बहुत बेहतर बना सकते हैं। यह एक कठोर फाइलिंग सिस्टम को एक लचीले, बुद्धिमान सिस्टम में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →