Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
यह शोध पत्र एंग्राम (Engram) को प्रस्तुत करता है, जो एक स्केलेबल कंडीशनल मेमोरी मॉड्यूल है जो -ग्राम एम्बेडिंग्स को लुकअप के लिए आधुनिक बनाता है, जो एक यू-आकार (U-shaped) की स्पर्सिटी एलोकेशन लॉ को प्रकट करता है जो न्यूरल कंप्यूटेशन और स्टैटिक मेमोरी के बीच के ट्रेड-ऑफ को अनुकूलित करता है ताकि लार्ज लैंग्वेज मॉडल्स में रीजनिंग, कोड और लॉन्ग-कॉन्टेक्स्ट रिट्रीवल प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, जटिल पहेली को सुलझाने की कोशिश कर रहे हैं। लंबे समय से, सबसे बुद्धिमान पहेली-सुलझाने वाले (AI मॉडल) एक विशाल कारखाने की तरह बनाए गए हैं। उनके पास हजारों विशिष्ट कार्यकर्ता (जिन्हें "Mixture-of-Experts" या MoE कहा जाता है) हैं जो कठिन तर्क या नए विचारों को समझने के लिए केवल आवश्यकता पड़ने पर ही सामने आते हैं। यह सोचने के लिए तो बहुत अच्छा है, लेकिन सरल, उबाऊ तथ्यों को याद रखने के मामले में यह थोड़ा अनाड़ी हो सकता है।
इसे इस तरह समझें: यदि आप एक प्रतिभाशाली गणितज्ञ से पूछें, "फ्रांस की राजधानी क्या है?" तो वे केवल "पेरिस" नहीं कहेंगे। उन्हें हर बार शून्य से उत्तर को फिर से व्युत्पन्न करने के लिए एक पूर्ण मानसिक सिमुलेशन चलाना होगा, जिससे बहुत अधिक मानसिक शक्ति खर्च होगी। यह बिल्कुल वैसा ही है जैसे किसी का अपना फोन नंबर याद करने के लिए सुपरकंप्यूटर का उपयोग करना।
बड़ी खोज: मस्तिष्क के लिए एक "चीट शीट" (Cheat Sheet)
DeepSeek-AI और बीजिंग यूनिवर्सिटी के शोधकर्ताओं ने पूछा: क्या होगा यदि हम इन मॉडलों को एक समर्पित "चीट शीट" दे दें उन चीजों के लिए जिन्हें उन्हें बस याद रखने की आवश्यकता है?
उन्होंने Engram नामक एक नया टूल पेश किया। यह सुनिश्चित करने के बजाय कि AI हर एक शब्द के लिए "सोचता" रहे, Engram एक सुपर-फास्ट, O(1) लुकअप टेबल की तरह कार्य करता है (इसका मतलब है कि चाहे आप एक शब्द खोज रहे हों या दस लाख, इसमें लगने वाला समय समान रहता है)। यह N-grams (शब्दों के समूहों को एक साथ देखना) के एक पुराने विचार पर आधारित है, लेकिन उन्होंने इसे आधुनिक तकनीक के साथ अपग्रेड किया है ताकि यह एक विशाल AI के भीतर पूरी तरह से काम कर सके।
"U-आकार" का रहस्य
टीम ने मॉडल बनाने के बारे में एक दिलचस्प नियम की खोज की, जिसे वे U-shaped scaling law कहते हैं।
कल्पना कीजिए कि आपके पास "मस्तिष्क शक्ति" (कंप्यूटिंग स्टेप्स) का एक निश्चित बजट है। आप इसे पूरा "सोचने वाले कार्यकर्ताओं" (MoE) पर खर्च कर सकते हैं, या आप इसे पूरा "मेमोरी चीट शीट" (Engram) पर खर्च कर सकते हैं।
- यदि आप 100% सोचने वाले कार्यकर्ताओं पर खर्च करते हैं, तो मॉडल तर्क में अच्छा होता है लेकिन तथ्यों को याद रखने में खराब होता है।
- यदि आप 100% चीट शीट पर खर्च करते हैं, तो यह तथ्यों को याद रखता है लेकिन अच्छी तरह से तर्क नहीं कर पाता।
- सही संतुलन (The Sweet Spot): शोध में पाया गया कि सबसे अच्छा प्रदर्शन तब होता है जब आप बजट को विभाजित करते हैं। आपको दोनों की आवश्यकता है। विशेष रूप से, उन्होंने पाया कि सोचने वाले कार्यकर्ताओं के "अतिरिक्त" मेमोरी बजट से लगभग 20–25% हिस्सा लेकर उसे Engram मेमोरी मॉड्यूल को देने से पूरा सिस्टम अधिक स्मार्ट हो जाता है। यह ऐसा है जैसे यह महसूस करना कि एक जीनियस को एक तेज़ दिमाग के साथ-साथ एक अच्छी लाइब्रेरी की भी ज़रूरत होती है।
वास्तव में क्या हुआ? (प्रमाण)
उन्होंने Engram-27B नामक एक मॉडल बनाया और इसकी तुलना ठीक उसी आकार और गति वाले एक मानक "केवल-सोचने वाले" मॉडल से की। परिणाम आश्चर्यजनक रूप से मजबूत थे:
- ज्ञान (Knowledge): यह ट्रिविया और तथ्यों में बेहतर हुआ (जैसे MMLU पर +3.4 और CMMLU पर +4.0 अधिक स्कोर करना)।
- तर्क (Reasoning): इससे भी आश्चर्यजनक रूप से, यह सामान्य तर्क और पहेलियों में बहुत बेहतर हो गया (जैसे BBH पर +5.0 और ARC-Challenge पर +3.7 अधिक स्कोर करना)।
- गणित और कोड: इसमें कोडिंग और गणित में भी सुधार हुआ (जैसे HumanEval पर +3.0)।
शोध पत्र बताता है कि ऐसा इसलिए होता है क्योंकि Engram मॉड्यूल "उबाऊ" चीजों (जैसे यह याद रखना कि "सिकंदर महान" एक विशिष्ट नाम है) को संभाल लेता है ताकि मुख्य मस्तिष्क को इसे फिर से बनाने में अपनी ऊर्जा बर्बाद न करनी पड़े। यह मुख्य AI के गहरे स्तरों को जटिल, गहन सोच पर ध्यान केंद्रित करने के लिए मुक्त कर देता है। यह बिल्कुल वैसा ही है जैसे एक सचिव सभी शेड्यूलिंग को संभालता है ताकि CEO रणनीति पर ध्यान केंद्रित कर सके।
"लंबी स्मृति" (Long Memory) का कमाल
एक सबसे शानदार प्रभाव यह है कि ये मॉडल लंबी कहानियों को कितनी अच्छी तरह से संभालते हैं। क्योंकि Engram मॉड्यूल स्थानीय विवरणों को तुरंत पकड़ लेता है, इसलिए मुख्य AI के पास पूरी कहानी को शुरू से अंत तक याद रखने के लिए अधिक "ध्यान" (Attention) बचा रहता है। परीक्षणों में, Engram मॉडल टेक्स्ट के ढेर में एक विशिष्ट सुई को 97.0% बार ढूंढ सका, जबकि मानक मॉडल केवल 84.2% ही कर पाया।
हार्डवेयर का जादू
अंत में, शोध पत्र तर्क देता है कि यह केवल एक सॉफ्टवेयर ट्रिक नहीं है; यह हार्डवेयर-अनुकूल भी है। क्योंकि "चीट शीट" निश्चित पतों (deterministic IDs) का उपयोग करती है, कंप्यूटर वर्तमान हिस्से के लिए गणित करने के दौरान ही अगले हिस्से को फेच (fetch) करना शुरू कर सकता है। इसका मतलब है कि वे एक नियमित कंप्यूटर के हार्ड ड्राइव (होस्ट मेमोरी) पर एक विशाल 100 बिलियन पैरामीटर वाली टेबल स्टोर कर सकते हैं और फिर भी लगभग उतनी ही गति से परिणाम प्राप्त कर सकते हैं जितनी कि सुपर-फास्ट GPU पर। स्पीड का नुकसान नगण्य था, 3% से भी कम।
वे स्पष्ट रूप से क्या नहीं कहते
शोध पत्र इस बारे में बहुत स्पष्ट है कि यह क्या नहीं है:
- यह केवल एक बड़ा शब्दावली (Vocabulary) नहीं है। उन्होंने केवल शब्दावली को बड़ा करने (OverEncoding) की कोशिश की थी, और वह Engram जितना अच्छा काम नहीं कर सका।
- यह "सोचने" वाले हिस्से का विकल्प नहीं है। यदि आप "सोचने वाले कार्यकर्ताओं" (MoE) को पूरी तरह से हटा देते हैं, तो मॉडल तर्क करने में विफल हो जाता है। मेमोरी एक सहायक है, विकल्प नहीं।
- यह हर चीज़ के लिए जादुई समाधान नहीं है। शोध पत्र नोट करता है कि हालांकि यह तथ्यों और तर्क में मदद करता है, लेकिन "बैकबोन" (मुख्य AI) अभी भी पढ़ने की समझ जैसी चीजों के लिए भारी काम करता है, जो संदर्भ (Context) पर अधिक निर्भर करता है न कि स्थिर स्मृति पर।
वे कितने आश्वस्त हैं?
लेखक अपने मापन को लेकर बहुत आश्वस्त हैं। उन्होंने केवल सिमुलेशन नहीं किया; उन्होंने 262 बिलियन टोकन के डेटा पर वास्तविक मॉडल प्रशिक्षित किए और वास्तविक दुनिया के बेंचमार्क पर उनका परीक्षण किया। उन्होंने दिखाया कि "U-आकार" का नियम विभिन्न आकारों में भी सत्य है और प्रदर्शन में सुधार वास्तविक, मापने योग्य और दोहराने योग्य है। उन्होंने मॉडल के अंदर के "गेट्स" (Gates) को भी विज़ुअलाइज़ किया ताकि यह दिखाया जा सके कि यह वास्तव में नामों और वाक्यांशों जैसी चीजों के लिए विशेष रूप से मेमोरी को सक्रिय कर रहा है, जैसा कि उन्होंने डिज़ाइन किया था।
संक्षेप में, शोध पत्र सुझाव देता है कि AI का भविष्य केवल बड़े दिमाग बनाने के बारे में नहीं है; यह उन दिमागों को चीजों को खोजने का एक बेहतर, तेज़ और स्मार्ट तरीका देने के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।