← नवीनतम पेपर
💻 computer science

Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention

Gated DeltaNet-2 एक नवीन लीनियर अटेंशन मैकेनिज्म पेश करता है जो पिछले मॉडलों में स्केलर-टाइड एडिटिंग की सीमाओं को दूर करने के लिए अलग-अलग गेट्स के माध्यम से चैनल-वार इरेज़ (erase) और राइट (write) ऑपरेशन्स को डिकपल करता है, जिससे लैंग्वेज मॉडलिंग और लॉन्ग-कॉन्टेक्स्ट रिट्रीवल कार्यों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Ali Hatamizadeh, Yejin Choi, Jan Kautz

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ali Hatamizadeh, Yejin Choi, Jan Kautz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "बहुत अधिक मेमोरी" की समस्या

कल्पना कीजिए कि एक सुपर-स्मार्ट लाइब्रेरियन (AI मॉडल) है जिसे किसी सवाल का जवाब देने के लिए एक बहुत लंबी किताब पढ़नी है।

  • पुराना तरीका (स्टैंडर्ड ट्रांसफॉर्मर्स): लाइब्रेरियन ने जितने भी शब्द पढ़े हैं, उनके लिए कार्ड्स का एक विशाल, बढ़ता हुआ ढेर रखता है। अगर किताब 1,00,000 शब्दों की है, तो वह ढेर बहुत बड़ा हो जाता है। इसमें डेस्क की बहुत जगह (मेमोरी) लगती है और चीजों को ढूँढना धीमा हो जाता है।
  • नया तरीका (लीनियर अटेंशन): जगह बचाने के लिए, लाइब्रेरियन एक सिंगल, फिक्स्ड-साइज़ नोटबुक का उपयोग करता है। सब कुछ लिखने के बजाय, वे कहानी का सारांश बनाते चलते हैं। अगर नोटबुक भर जाती है, तो उन्हें कुछ नया लिखने के लिए कुछ मिटाना पड़ता है।

इस "फिक्स्ड नोटबुक" के साथ समस्या इंटरफेरेंस (हस्तक्षेप) की है। यदि लाइब्रेरियन एक नई कहानी लिखने के लिए एक पन्ना मिटा देता है, तो वे अनजाने में अतीत के किसी महत्वपूर्ण विवरण को मिटा सकते हैं जिसकी उन्हें बाद में अभी भी आवश्यकता हो सकती है। यह वैसा ही है जैसे अपनी स्टिकी नोट पर नई किराने की सूची लिखने की कोशिश करना जिस पर पहले से ही आपका फोन नंबर लिखा हो; यदि आप नंबर के ऊपर कुछ लिख देते हैं, तो आप उसे खो देते हैं।

पिछला समाधान: "एक ही आकार के लिए उपयुक्त" इरेज़र (One-Size-Fits-All Eraser)

शोधकर्ताओं ने KDA और Gated DeltaNet जैसे मॉडल्स के साथ इसे ठीक करने की कोशिश की। उन्होंने लाइब्रेरियन को एक विशेष "इरेज़र" और एक "पेन" दिया।

हालाँकि, इन मॉडल्स में एक दोष था: इरेज़र और पेन आपस में जुड़े हुए थे।
कल्पना कीजिए कि एक सिंगल स्विच है जो दो चीजों को एक साथ नियंत्रित करता है:

  1. कितनी पुरानी लिखावट को मिटाया जाना है।
  2. कितनी नई लिखावट को दर्ज किया जाना है।

यदि लाइब्रेरियन अतीत के एक विशिष्ट शब्द को मिटाना चाहता था लेकिन बाकी पन्ने को सुरक्षित रखना चाहता था, तो वह ऐसा नहीं कर सकता था। स्विच ने उन्हें मजबूर किया कि या तो वे पूरा पन्ना मिटा दें या पूरी नई कहानी लिखें। वे सटीक नहीं हो सकते थे। वे "एक-दूसरे से बंधे हुए" थे।

नया समाधान: Gated DeltaNet-2

Gated DeltaNet-2 इस लाइब्रेरियन की नोटबुक प्रणाली का एक नया संस्करण है। इसका मुख्य नवाचार इरेज़र को पेन से डिकपलिंग (अलग करना/अनटैंगल करना) है।

एक स्विच के बजाय, अब मॉडल के पास दो स्वतंत्र नियंत्रण हैं:

  1. "इरेस गेट" (The Eraser - मिटाने वाला द्वार): यह नियंत्रण पुरानी जानकारी को देखता है। यह तय करता है कि पुरानी कहानी के कौन से विशिष्ट हिस्सों को मिटाया जाना है। यह एक सटीक इरेज़र की तरह है जो "ऑरेंज" शब्द को छुए बिना केवल "एप्पल" शब्द को हटा सकता है।
  2. "राइट गेट" (The Write Gate - लिखने वाला द्वार): यह नई जानकारी को देखता है। यह तय करता है कि नई कहानी के कौन से हिस्से लिखे जाने चाहिए। यह एक पेन की तरह है जो केवल आपके खरीदे गए नए सामान को लिख सकता है, बिना पूरी लिस्ट को दोबारा लिखे।

उपमा (Analogy):
नोटबुक के पन्ने को एक डिजिटल व्हाइटबोर्ड के रूप में सोचें।

  • पुराना मॉडल: आपके पास एक रिमोट कंट्रोल है। यदि आप "अपडेट" दबाते हैं, तो यह बोर्ड का 50% मिटा देता है और 50% नया लिख देता है। आप यह नहीं चुन सकते कि क्या मिटाया जाए या क्या लिखा जाए।
  • Gated DeltaNet-2: आपके पास एक लेजर पॉइंटर और एक मार्कर है। आप लेजर का उपयोग करके केवल उन विशिष्ट पुराने तथ्यों को मिटाने के लिए कर सकते हैं जो गलत हैं ("इरेस गेट"), और फिर मार्कर का उपयोग करके केवल उन नए तथ्यों को लिखने के लिए कर सकते हैं जो महत्वपूर्ण हैं ("राइट गेट")।

यह क्यों मायने रखता है (परिणाम)

पेपर ने इस नए "दो-गेट" सिस्टम का परीक्षण अन्य स्मार्ट मॉडल्स (जैसे Mamba-2, Mamba-3, और मूल KDA) के खिलाफ एक 1.3-बिलियन-पैरामीटर वाले मॉडल पर किया, जिसे भारी मात्रा में शैक्षिक टेक्स्ट पर प्रशिक्षित किया गया था।

यहाँ उन्हें क्या मिला:

  1. "हे स्टैक में सुई" (Needle in a Haystack) खोजने में बेहतर:
    कल्प_िए एक टेस्ट जहाँ लाइब्रेरियन को 100 पन्नों के दस्तावेज़ के भीतर छिपी एक विशिष्ट वाक्य को खोजना है।

    • पुराने मॉडल्स कभी-कभी भ्रमित हो जाते थे क्योंकि "जुड़े हुए" इरेज़र ने नई जानकारी लिखने की कोशिश में अनजाने में "सुई" को भी मिटा दिया था।
    • Gated DeltaNet-2 इसमें सबसे अच्छा था। क्योंकि यह केवल विचलित करने वाली जानकारी को चुनिweise मिटा सकता था जबकि महत्वपूर्ण "सुई" को सुरक्षित रख सकता था, इसने बहुत लंबे दस्तावेजों में भी सही उत्तर को बेहतर ढंग से याद रखा।
  2. बेहतर तर्क क्षमता (Reasoning):
    कॉमन सेंस (जैसे "अगर मैं मेज पर एक कप रखता हूँ, तो कप कहाँ है?") से जुड़े परीक्षणों पर, नए मॉडल ने अपने प्रतिस्पर्धियों की तुलना में अधिक स्कोर किया। ऐसा लगता है कि मेमोरी को सटीकता से एडिट करने की क्षमता मॉडल को संबंधों को बेहतर ढंग से समझने में मदद करती है।

  3. गति और दक्षता:
    अपने अधिक जटिल नियंत्रणों (एक के बजाय दो गेट) के बावजूद, मॉडल काफी धीमा नहीं हुआ। यह अभी भी अन्य कुशल मॉडल्स की गति के समान गति से टेक्स्ट प्रोसेस करता है, जिससे यह वास्तविक दुनिया के उपयोग के लिए व्यावहारिक बनता है।

सारांश

Gated DeltaNet-2 AI के लिए उसकी शॉर्ट-टर्म मेमोरी को मैनेज करने का एक स्मार्ट तरीका है। भूलने (पुराने डेटा को मिटाना) की क्रिया को सीखने (नया डेटा लिखना) से अलग करके, मॉडल "कोलेटरल डैमेज" (आस-पास के नुकसान) से बचता है, जिससे महत्वपूर्ण जानकारी को गलती से डिलीट करने का खतरा कम हो जाता है। यह इसे लंबे किस्से और जटिल कार्यों को अधिक सटीकता के साथ संभालने की अनुमति देता है, जबकि मेमोरी का उपयोग कम और गति उच्च बनी रहती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →