Raven: High-Recall Sequence Modeling with Sparse Memory Routing
Raven एक लीनियर-टाइम सीक्वेंस मॉडल है जो स्पार्स (sparse), इनपुट-डिपेंडेंट मेमोरी रूटिंग का उपयोग करके केवल मेमोरी स्लॉट्स के एक उपसमुच्चय (subset) को अपडेट करता है, जिससे लॉन्ग-कॉन्टेक्स्ट रिकॉल में सुधार होता है, और यह प्रभावी रूप से डेंस स्टेट-स्पेस मॉडल्स की इंटरफेरेंस समस्याओं और स्लाइडिंग-विंडो अटेंशन की हार्ड इविक्शन सीमाओं के बीच संतुलन बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कहानी को याद करने की कोशिश कर रहे हैं जो आपने अभी सुनी है, लेकिन आपके मस्तिष्क का एक अजीब नियम है: हर बार जब आप एक नया शब्द सुनते हैं, तो आपको पूरी कहानी को फिर से शुरू से लिखना होता है, और उस नए शब्द को आपके द्वारा लिखे गए हर एक वाक्य में मिला देना होता है। "स्टेट-स्पेस मॉडल" (State-Space Models) नामक कुछ कंप्यूटर प्रोग्राम इसी तरह काम करते हैं। वे एक लंबे समय तक कहानी के सामान्य भाव को बनाए रखने में बहुत अच्छे होते हैं, लेकिन क्योंकि वे सब कुछ एक-दूसरे में इतनी गहराई से मिला देते हैं, इसलिए बीच में दबे हुए किसी विशिष्ट विवरण, जैसे कि कोई नाम या तारीख, को ढूँढना असंभव हो जाता है। दूसरी ओर, एक अलग प्रकार की स्मृति की कल्पना करें जो निश्चित संख्या में पृष्ठों वाली एक नोटबुक की तरह काम करती है। जब आप आखिरी पृष्ठ भर देते हैं, तो आप बस उसे फाड़कर फेंक देते हैं और उसकी जगह एक नया पृष्ठ लगा देते हैं। यह "स्लाइडिंग विंडो" (Sliding Window) मॉडल की तरह काम करता है। वे पिछले कुछ पृष्ठों को पूरी तरह से याद रखने में बहुत अच्छे होते हैं, लेकिन जैसे ही कोई जानकारी किनारे से बाहर धकेली जाती है, वह हमेशा के लिए गायब हो जाती है।
यह वैज्ञानिकों के क्षेत्र में आर्टिफिशियल इंटेलिजेंस (AI) की एक बड़ी समस्या है जिसे वे हल करने की कोशिश कर रहे हैं: हम एक ऐसा कंप्यूटर मस्तिष्क कैसे बनाएं जो विवरणों को मिलाए बिना एक कहानी को बहुत लंबे समय तक याद रख सके, लेकिन यह भी सुनिश्चित करे कि पुराना होने के कारण शुरुआत को भुला न दिया जाए? हमें एक ऐसी प्रणाली की आवश्यकता है जो लंबे समय तक विशिष्ट, महत्वपूर्ण तथ्यों को थामे रख सके और साथ ही नई जानकारी को कुशलतापूर्वक संसाधित भी कर सके। यह अत्यंत महत्वपूर्ण है क्योंकि जैसे-जैसे AI मॉडल अधिक स्मार्ट होते जा रहे हैं, उन्हें लंबी किताबें पढ़नी, विशाल दस्तावेजों का विश्लेषण करना और बातचीत के हजारों शब्द बीत जाने के बाद भी शुरुआत में दिए गए निर्देशों को याद रखने की आवश्यकता है।
यहाँ रेवन (Raven) आता है, एक नया प्रकार का AI मॉडल जिसे शोधकर्ताओं ने इसी सटीक मेमोरी पहेली को हल करने के लिए डिज़ाइन किया है। रेवन की स्मृति को एक अस्त-व्यस्त पुनलेखन (rewrite) या एक साधारण कचरा-पेटी वाली नोटबुक के रूप में नहीं, बल्कि सैकड़ों लॉकरों वाले एक हाई-टेक लॉकर रूम के रूप में सोचें। पुराने सिस्टमों में, हर बार जब कोई नई वस्तु आती थी, तो उसे एक साथ हर लॉकर में डालने के लिए मजबूर किया जाता था, या उसे केवल आगमन के क्रम के आधार पर एक लॉकर में ठूँस दिया जाता था, जिससे सबसे पुराना आइटम बिना यह देखे बाहर निकल जाता था कि वह कितना महत्वपूर्ण था। रेवन नियमों को बदल देता है। यह एक स्मार्ट "राउटर" का उपयोग करता है जो एक बाउंसर की तरह काम करता है। जब जानकारी का एक नया टुकड़ा आता है, तो बाउंसर देखता है कि वह क्या है और निर्णय लेता है: "यह एक उबाऊ तथ्य है? इसे एक साझा लॉकर में डाल दो जिसे अक्सर साफ किया जाता है। यह एक बहुत महत्वपूर्ण रहस्य है? इसे एक विशेष, समर्पित लॉकर में डालो जिसे कोई और छू भी नहीं सकता।"
यह शोध पत्र रूटिंग स्लॉट मेमोरीज (RSM) नामक एक ढांचे को पेश करता है, जो रेवन का ब्लूप्रिंट है। मुख्य नवाचार यह है कि रेवन इस बात को अलग करता है कि जानकारी कहाँ लिखी जाती है और वह कितनी देर तक वहाँ रहती है। पिछले मॉडलों में, ये दोनों चीजें आपस में उलझी हुई थीं। रेवन एक "स्पार्स" (sparse) रूटिंग सिस्टम का उपयोग करता है, जिसका अर्थ है कि यह प्रत्येक नए टेक्स्ट के लिए लॉकरों (मेमोरी स्लॉट्स) के एक छोटे, चयनित समूह को ही अपडेट करता है, बाकी को पूरी तरह से अछूता छोड़ देता है। यह एक बहुत बड़ी बात है क्योंकि यह उस "हस्तक्षेप" (interference) को रोकता है जो तब होता है जब आप एक साथ सब कुछ अपडेट करने की कोशिश करते हैं। यदि कोई विशिष्ट लॉकर किसी महत्वपूर्ण पासवर्ड को थामे हुए है, तो रेवन का राउटर उस लॉकर को अनदेखा करने का विकल्प चुन सकता है, जिससे वह पासवर्ड सुरक्षित रूप से वहीं बना रहे जबकि बाकी मेमोरी अपना काम करती रहे।
शोधकर्ताओं ने रेवन का परीक्षण कुछ बहुत कठिन मेमोरी गेम्स पर किया। इनमें से एक "नीडल इन अ हेस्टैक" (Needle in a Haystack) टेस्ट था, जहाँ AI को एक विशाल दस्तावेज़ के भीतर छिपे एक विशिष्ट वाक्य को खोजना होता है। इन परीक्षणों में, रेवन ने दिखाया कि वह उस सुई को खोज सकता है भले ही दस्तावेज़ उसके प्रशिक्षित आकार से 16 गुना लंबा हो। जबकि Mamba-2 या Sliding Window Attention जैसे अन्य मॉडल विफल होने लगे और चीजें भूलने लगे, रेवन ने अपनी सटीकता को लगभग पूर्ण बनाए रखा। उदाहरण के लिए, 32,000-टोकन के टेस्ट पर, रेवन ने 91% से अधिक सटीकता बनाए रखी, जबकि अन्य मॉडल काफी नीचे गिर गए।
सबसे दिलचस्प बात यह है कि रेवन को यह करने के लिए किसी भी फैंसी अतिरिक्त ट्रिक्स की आवश्यकता नहीं है। यह जटिल कन्वोल्शन (जो अन्य मॉडलों द्वारा उपयोग किए जाने वाले शॉर्ट-टर्म मेमोरी फिल्टर की तरह हैं) या विशेष पोजीशन मार्कर्स पर निर्भर नहीं है। यह बस इस स्मार्ट रूटिंग सिस्टम का उपयोग करता है। शोध पत्र सुझाव देता है कि मेमोरी को पोजीशन (वाक्य में वह कहाँ है) के बजाय कंटेंट (शब्द क्या है) के आधार पर आवंटित करने से मॉडल को एक प्राकृतिक "विशेषज्ञता" (specialization) मिलती है। कुछ मेमोरी स्लॉट्स रिट्रीवल-क्रिटिकल विवरणों को थामे रखने के विशेषज्ञ बन जाते हैं, जबकि अन्य कहानी के सामान्य प्रवाह को संभालते हैं।
लेखकों ने पाया कि यह दृष्टिकोण न केवल अकेले, बल्कि अन्य प्रकार के AI आर्किटेक्चर के साथ मिलकर भी काम करता है। जब उन्होंने रेवन को मानक अटेंशन मैकेनिज्म (जिसका उपयोग आज के सबसे लोकप्रिय AI मॉडलों में किया जाता है) के साथ जोड़ा, तो हाइब्रिड सिस्टम ने लॉन्ग-कॉन्टेक्स्ट कार्यों पर और भी बेहतर प्रदर्शन किया, और Sliding Window Attention या अन्य लीनियर मॉडलों का मुकाबला करते हुए बेहतर प्रदर्शन किया। शोध पत्र निष्कर्ष निकालता है कि रेवन सफलतापूर्वक उन मॉडलों के बीच के अंतर को पाटता है जो दीर्घकालिक निरंतरता (long-term persistence) में अच्छे हैं और उन मॉडलों के बीच जो सटीक रिकॉल (precise recall) में अच्छे हैं, जो यह सुझाव देता है कि मेमोरी एलोकेशन को एक जानबूझकर चुने जाने वाले, सीखने योग्य विकल्प के रूप में देखना अधिक स्मार्ट और कुशल AI बनाने का एक शक्तिशाली तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।