MoNe: Modular Neural Memory for Efficient Long Context Inference
MoNe एक हल्का, मॉड्यूलर न्यूरल मेमोरी सिस्टम है जो फ्रीज्ड ट्रांसफॉर्मर्स (frozen Transformers) से जुड़कर संदर्भ लंबाई (context length) से इन्फरेंस लागत को अलग करता है, जिससे बिना रीट्रेनिंग के निरंतर क्वेरी जटिलता (constant query complexity) और काफी कम मेमोरी उपयोग के साथ कुशल लॉन्ग-कॉन्टेक्स्ट इन्फरेंस सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक आर्टिफिशियल इंटेलिजेंस उस बिंदु पर पहुँच गया है जहाँ यह पूरी किताबें पढ़ सकता है, वर्षों के चैट लॉग का विश्लेषण कर सकता है, या एक बार में विशाल कानूनी अनुबंधों को आत्मसात कर सकता है। ऐसा करने के लिए, ये सिस्टम एक ऐसी प्रक्रिया पर निर्भर करते हैं जो उन्हें वर्तमान प्रश्न को समझने के लिए उस सब कुछ को पीछे मुड़कर देखने की अनुमति देती है जिसे उन्होंने अभी-अभी प्रोसेस किया है। हालाँकि, इस क्षमता की एक भारी कीमत चुकानी पड़ती है। जैसे-जैसे टेक्स्ट की मात्रा बढ़ती है, इसे प्रोसेस करने के लिए आवश्यक ऊर्जा और कंप्यूटर मेमोरी केवल बढ़ती ही नहीं, बल्कि विस्फोट की तरह बढ़ जाती है। कल्पना कीजिए कि आप एक पुस्तकालय को पढ़ने की कोशिश कर रहे हैं और अभी जो शब्द आप पढ़ रहे हैं, उसकी तुलना हर उस शब्द से कर रहे हैं जो आपने शुरू करने के बाद से पढ़ा है। आवश्यक प्रयास इतनी तेजी से बढ़ता है कि यह बहुत जल्दी मानक कंप्यूटरों के लिए, विशेष रूपेश फोन या लैपटॉप में पाए जाने वाले छोटे उपकरणों के लिए, एक बार में कुछ हज़ार शब्दों से अधिक को संभालना असंभव बना देता है। यह सीमा वर्तमान सिस्टम को या तो एक लंबी कहानी की शुरुआत को भूलने के लिए मजबूर करती है या बिखरे हुए विवरणों को जोड़ने वाले बड़े चित्र को समझने के बजाय विशिष्ट तथ्यों को खोजने के लिए बाहरी उपकरणों पर निर्भर करती है।
क्वालकॉम एआई रिसर्च (Qualcomm AI Research) के शोधकर्ताओं की एक टीम ने MoNe नामक एक नया दृष्टिकोण विकसित किया है, जो इन आर्टिफिशियल इंटेलिजेंस मॉडल्स को बिना पुन: प्रशिक्षित (retrained) किए या उनके हार्डवेयर पर अत्यधिक बोझ डाले, सूचना की विशाल मात्रा को संभालने की अनुमति देता है। मॉडल को हर बार किसी प्रश्न का उत्तर देने के लिए बातचीत या दस्तावेज़ के पूरे इतिहास को बार-बार पढ़ने के लिए मजबूर करने के बजाय, MoNe एक विशेष नोटबुक की तरह कार्य करता है जिसमें मॉडल पढ़ते समय लिखता है। यह सिस्टम लंबे टेक्स्ट को छोटे, प्रबंधनीय टुकड़ों में प्रोसेस करता है। जैसे-जैसे यह प्रत्येक टुकड़े को पढ़ता है, यह इस आंतरिक नोटबुक को अपडेट करता है, जिससे आवश्यक जानकारी को एक संक्षिप्त रूप में संकलित किया जाता है। एक बार जब पूरा टेक्स्ट पढ़ लिया जाता है और नोटबुक भर जाती है, तो मॉडल केवल उस नोटबुक की सामग्री का उपयोग करके प्रश्नों के उत्तर दे सकता है। महत्वपूर्ण बात यह है कि मॉडल को मूल लंबे टेक्स्ट को फिर से देखने की आवश्यकता कभी नहीं होती है। इस डिज़ाइन का अर्थ है कि प्रश्न का उत्तर देने की लागत स्थिर रहती है, चाहे मूल दस्तावेज़ एक छोटा ईमेल हो या एक लाख शब्दों का उपन्यास।
शोधकर्ताओं ने इस पद्धति का परीक्षण मानक चुनौतियों के एक सेट पर किया, जो यह देखने के लिए डिज़ाइन किए गए थे कि क्या कोई मॉडल टेक्स्ट के ढेर में गहराई से छिपे किसी विशिष्ट तथ्य को खोज सकता है, जिसे अक्सर 'हेस्टैक में सुई ढूंढना' (finding a needle in a haystack) कहा जाता है। उन्होंने अक्सर उल्लेखित शब्दों को निकालने और उन समस्याओं को हल करने की इसकी क्षमता का भी परीक्षण किया जिनमें टेक्स्ट में फैले कई सूचनाओं के टुकड़ों को जोड़ने की आवश्यकता होती है। जब टेक्स्ट की लंबाई मॉडल की मूल प्रशिक्षण सीमाओं के भीतर थी, तो नई विधि लगभग पूर्ण रूप से सफल रही, जिसने एक साथ सब कुछ पढ़ने का प्रयास करने वाले मानक दृष्टिकोणों से बेहतर प्रदर्शन किया। इससे भी अधिक प्रभावशाली बात यह है कि जब शोधकर्ताओं ने सिस्टम को मॉडल के लिए डिज़ाइन की गई मूल लंबाई से कहीं अधिक, यानी एक लाख अट्ठाईस हज़ार टोकन तक के टेक्स्ट को संभालने के लिए धकेला, तो नई विधि उच्च सटीकता के साथ काम करती रही। इसके विपरीत, मानक दृष्टिकोण, जो एक साथ पूरे टेक्स्ट को पढ़ने का प्रयास करता है, टेक्स्ट लंबा होने के साथ पूरी तरह विफल हो गया और इसकी सटीकता शून्य के करीब पहुँच गई। एक सामान्य वैकल्पिक पद्धति, जो प्रासंगिक टेक्स्ट स्निपेट्स खोजने का प्रयास करती है, वह भी संघर्ष करती रही जब उत्तर के लिए कई अलग-अलग, बिखरे हुए तथ्यों को जोड़ने की आवश्यकता थी।
इस नई पद्धति से होने वाले दक्षता लाभ पर्याप्त हैं। परीक्षण किए गए सबसे लंबे टेक्स्ट की लंबाई पर, शोधकर्ताओं ने पाया कि उनके दृष्टिकोण ने मानक पद्धति की तुलना में कंप्यूटर पावर की मात्रा को लगभग अस्सी प्रतिशत कम कर दिया। इसने पीक मेमोरी (peak memory) की आवश्यकता को भी उसी मार्जिन से कम कर दिया। यह एक महत्वपूर्ण सुधार है क्योंकि इसका अर्थ है कि शक्तिशाली लॉन्ग-कॉन्टेक्स्ट रीजनिंग अंततः सीमित संसाधनों वाले उपकरणों पर चल सकती है, न कि केवल विशाल, महंगे सर्वरों की आवश्यकता होगी। यह सिस्टम एक स्थिर मेमोरी फुटप्रिंट बनाए रखकर यह उपलब्धि हासिल करता है; जैसे-जैसे टेक्स्ट लंबा होता जाता है, आंतरिक नोटबुक का आकार नहीं बढ़ता है। शोधकर्ताओं ने प्रदर्शित किया कि इस सिस्टम को मौजूदा, प्री-ट्रेन्ड मॉडल्स के साथ उनके मूल ढांचे को बदले बिना जोड़ा जा सकता है, जिसमें केवल थोड़े अतिरिक्त डेटा स्टोरेज की आवश्यकता होती है। उन्होंने यह भी दिखाया कि सिस्टम केवल टेक्स्ट को निश्चित आकार के खंडों में प्रोसेस करके और चरण-दर-चरण अपने आंतरिक स्टेट को अपडेट करके, उस टेक्स्ट की लंबाई के लिए भी सामान्य हो सकता है जो उसके प्रशिक्षण से बत्तीस गुना अधिक लंबा है।
हालाँकि वर्तमान प्रयोगों ने एक विशेष मॉडल आकार का उपयोग करके विशिष्ट रिट्रीवल कार्यों पर ध्यान केंद्रित किया, लेकिन परिणाम आर्टिफिशियल इंटेलिजेंस को वास्तविक दुनिया की लंबी, विस्तृत जानकारी को संभालने में अधिक सक्षम बनाने के लिए एक व्यवहार्य मार्ग का सुझाव देते हैं। यह पद्धति नए प्रकार के कंप्यूटर मस्तिष्क को शून्य से बनाने की मांग नहीं करती है, न ही इसके लिए मॉडल को विशाल नए डेटासेट्स पर पुन: प्रशिक्षित करने की आवश्यकता होती है। इसके बजाय, यह एक हल्का, मॉड्यूलर जुड़ाव पेश करती है जो चलते समय (on the fly) सूचना को संकुचित करना सीखता है। यह सिस्टम को अतीत की एक स्पष्ट, निरंतर स्मृति बनाए रखने की अनुमति देता है जबकि वर्तमान के बारे में सोचने की लागत को कम रखता है। जैसे-जैसे घंटों की बातचीत या हजारों पृष्ठों के दस्तावेजीकरण पर तर्क करने में सक्षम आर्टिफिशियल इंटेलिजेंस की मांग बढ़ रही है, यह दृष्टिकोण उन सिस्टम्स को तेज़, कुशल और उस पूर्ण संदर्भ को समझने में सक्षम बनाए रखने का एक व्यावहारिक तरीका प्रदान करता है, जिसे वे नेविगेट करने के लिए पूछे जाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।