← नवीनतम पेपर
🤖 machine learning

Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences

यह शोध पत्र Preconditioned DeltaNet को प्रस्तुत करता है, जो एक कर्वेचर-अवेयर (curvature-aware) फ्रेमवर्क है जो ऑनलाइन लीस्ट स्क्वायर्स थ्योरी से प्रीकंडीशनड वेरिएंट्स व्युत्पन्न करके DeltaNet और Mamba-2 जैसे सबक्वाड्रेटिक रिकरेंट मॉडल्स को बेहतर बनाता है, जिससे लॉन्ग-कॉन्टेक्स्ट लैंग्वेज मॉडलिंग और सिंथेटिक रिकॉल कार्यों में निरंतर प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Neehal Tumma, Noel Loo, Daniela Rus

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Neehal Tumma, Noel Loo, Daniela Rus

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बहुत लंबी किताब पढ़ना सिखाने की कोशिश कर रहे हैं और उसे शुरुआत के विशिष्ट विवरण याद रखने के लिए अंत में सवालों के जवाब देने के लिए तैयार कर रहे हैं। लार्ज लैंग्वेज मॉडल्स (LLMs) यही करते हैं।

लंबे समय तक, इसे करने का सबसे अच्छा तरीका एक फोटोकॉपीयर की तरह था। हर बार जब रोबोट एक नया शब्द पढ़ता था, तो उसे यह देखने के लिए कि वे आपस में कैसे जुड़ते हैं, उन सभी शब्दों को फिर से देखना पड़ता था जो उसने पहले पढ़े थे। इसे "अटेंशन" (Attention) कहा जाता है। यह अविश्वसनीय रूप से स्मार्ट है, लेकिन यह धीमा और महंगा है। यदि किताब दोगुनी लंबी हो जाती है, तो रोबोट को चार गुना अधिक काम करना पड़ता है।

इसे ठीक करने के लिए, वैज्ञानिकों ने लीनियर रिकरेंस (Linear Recurrences) जैसे कि डेल्टानेट (DeltaNet) का आविष्कार किया। इन्हें एक नोटबुक की तरह समझें। पूरी किताब को पीछे देखने के बजाय, रोबमाट बस अपने वर्तमान नोट को अपडेट करता है। यह सुपर फास्ट है, लेकिन यह थोड़ा "मूर्ख" है। यह हर नई जानकारी के साथ एक जैसा व्यवहार करता है, जिससे अक्सर महत्वपूर्ण विवरण भूल जाता है या लंबी किताब होने पर भ्रमित हो जाता है।

समस्या: "फ्लैट" नोटबुक

पेपर का तर्क है कि ये "नोटबुक" मॉडल ऐसे हैं जैसे आप एक ऊबड़-खाबड़ पहाड़ी परिदृश्य में एक सपाट मानचित्र (flat map) का उपयोग करके चलने की कोशिश कर रहे हों। वे उस ढलान के आधार पर कदम उठाते हैं जो उनके पैरों के ठीक नीचे है (तत्काल त्रुटि), लेकिन वे पहाड़ी के आकार (वक्रता/curvature) को नहीं समझते हैं।

  • उपमा: कल्पना करें कि आप एक घाटी के निचले हिस्से को खोजने की कोशिश कर रहे हैं।
    • मानक मॉडल (DeltaNet) एक आंखों पर पट्टी बंधे हुए हाइकर (पर्वतारोही) की तरह हैं जो केवल अपने पैर के नीचे की ढलान के आधार पर नीचे की ओर कदम उठाते हैं। यदि घाटी एक तरफ खड़ी है और दूसरी तरफ समतल है, तो वे बेतहाशा टेढ़े-मेढ़े चल सकते हैं या फंस सकते हैं।
    • लक्ष्य: वे घाटी के आकार को जानना चाहते हैं ताकि वे सीधे नीचे की ओर एक बड़ा, सीधा कदम ले सकें।

समाधान: प्रीकंडीशन्ड डेल्टानेट (The "Curvature-Aware" Hiker)

लेखक प्रीकंडीशनिंग (Preconditioning) पेश करते हैं। गणित में, यह हाइकर को विशेष चश्मे देने जैसा है जो परिदृश्य को इस तरह से बदल देते हैं कि पहाड़ियाँ सपाट दिखें और घाटियाँ सीधे रास्तों की तरह दिखें।

  1. "प्रीकंडीशनर" (चश्मे): मॉडल अपने "नोटबुक" को इस आधार पर एडजस्ट करना सीखता है कि उसने पहले कुछ पैटर्न कितनी बार देखे हैं। यदि किसी विशेष प्रकार की जानकारी बहुत आम है, तो मॉडल जानता है कि सावधान रहना है। यदि यह दुर्लभ है, तो वह इस पर अतिरिक्त ध्यान देने के लिए जानता है।
  2. "राइट की" (Write Key) बनाम "रीड की" (Read Key): पुराने मॉडलों में, रोबोट एक नोट को पढ़ने और एक नया नोट लिखने के लिए एक ही उंगली का उपयोग करता था। नया मॉडल दो अलग-अलग उंगलियों का उपयोग करता है।
    • रीड की (Read Key): "मैं क्या देख रहा हूँ?"
    • राइट की (Write Key): "मैं जो देख रहा हूँ उसके आधार पर अपनी याददाश्त को कैसे अपडेट करूँ?"
    • इन्हें अलग करके, मॉडल यह तय कर सकता है कि उसने अभी जो पढ़ा है उसे बिगाड़े बिना अपनी याददाश्त को कैसे अपडेट किया जाए।

जादू का नुस्खा: "डायगोनल" शॉर्टकट

परफेक्ट "चश्मे" (घाटी के सटीक आकार) की गणना करना कम्प्यूटेशनल रूप से महंगा है, जैसे घाटी के हर एक पत्थर का मानचित्र बनाने की कोशिश करना।

लेखकों ने एक चतुर शॉर्टकट खोजा। पूरी 3D आकृति का मानचित्र बनाने के बजाय, उन्होंने केवल प्रत्येक बिंदु पर ऊंचाई (एक डायगोनल एप्रोक्सिमेशन) को मापा।

  • उपमा: एक पूर्ण टोपोग्राफिक मैप बनाने के बजाय, उन्होंने बस एक साधारण सूची पर "यहाँ ऊँचा, वहाँ नीचा" लिख दिया।
  • यह क्यों काम करता है: यह सच है कि भाषा के लिए, प्रत्येक आयाम के "ऊंचाई" (महत्व) को जानना 90% लड़ाई जीतने जैसा है। यह मॉडल को तेज (पुराने नोटबुक की तरह) लेकिन स्मार्ट (फोटोकॉपीयर की तरह) रखता है।

परिणाम: तेज़ और स्मार्ट

इस नए "प्रीकंडीशन्ड डेल्टानेट" (और इसके चचेरे भाइयों जैसे PGDN और PKDA) का परीक्षण किया गया:

  • सिंथेटिक गेम्स: जैसे घास के ढेर में सुई ढूंढना (एक लंबी सूची से एक विशिष्ट तथ्य को याद रखना)।
  • वास्तविक भाषा: निबंध लिखना और सवालों के जवाब देना।

फैसला: नए मॉडल लंबे संदर्भों (contexts) को याद रखने और भाषा को समझने में लगातार बेहतर थे, बिना कंप्यूटर को धीमा किए। वे "सबसे अच्छे दोनों दुनियाओं" को प्राप्त करने में सफल रहे: एक नोटबुक की गति और एक फोटोकॉपीयर की याददाश्त।

एक वाक्य में सारांश

लेखकों ने तेज़, सरल भाषा मॉडल्स को "कर्वचर-अवेयर चश्मे" और एक दो-उंगली वाला लेखन सिस्टम दिया, जिससे वे बिना सुपरकंप्यूटर की आवश्यकता के लंबी कहानियों को बहुत बेहतर तरीके से याद रख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →