← नवीनतम पेपर
🤖 machine learning

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

यह शोध पत्र FlashMemory-DeepSeek-V4 प्रस्तुत करता है, जो एक बैकबोन-मुक्त प्रशिक्षित Lookahead Sparse Attention तंत्र का उपयोग करने वाला एक नवीन इन्फरेंस प्रतिमान (paradigm) है, जो केवल महत्वपूर्ण KV कैश चंक्स (chunks) का सक्रिय रूप से पूर्वानुमान लगाने और उन्हें बनाए रखने के लिए डिज़ाइन किया गया है, जिससे अल्ट्रा-लॉन्ग कॉन्टेक्स्ट में डाउनस्ट्रीम सटीकता को बनाए रखते हुए या थोड़ा सुधारते हुए भौतिक मेमोरी ओवरहेड को 85% से अधिक कम किया जा सकता है।

मूल लेखक: Yan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo Lin, Chunyang Li, Zhichao Wang, Jia Li, Yujiu Yang, Haitao Mi, Dong Yu

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo Lin, Chunyang Li, Zhichao Wang, Jia Li, Yujiu Yang, Haitao Mi, Dong Yu

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पहेली को हल करने की कोशिश कर रहे हैं, लेकिन आपके पास उन टुकड़ों को फैलाने के लिए एक बहुत छोटी मेज (आपके कंप्यूटर का GPU मेमोरी) है।

सामान्य तौर पर, जब एक स्मार्ट AI (लार्ज लैंग्वेज मॉडल) किसी बड़े दस्तावेज़ (जैसे कि पूरी किताब) के आधार पर किसी प्रश्न का उत्तर देने की कोशिश करता है, तो वह उस किताब के हर एक पन्ने को एक ही समय में अपनी मेज पर फैलाने की कोशिश करता है। जैसे-जैसे किताब लंबी होती जाती है, मेज पर बोझ बढ़ जाता है, टुकड़े नीचे गिरने लगते हैं, और AI धीमा हो जाता है या क्रैश हो जाता है। यह वही "मेमोरी बॉटलनेक" (स्मृति बाधा) है जिसका वर्णन इस पेपर में किया गया है।

FlashMemory-DeepSeek-V4 इस समस्या को हल करने का एक नया तरीका है। पूरी किताब को फैलाने के बजाय, AI एक स्मार्ट लाइब्रेरियन (पुस्तकालयाध्यक्ष) का उपयोग करता है जो यह तय करता है कि उसे अभी ठीक किस पन्ने को देखने की आवश्यकता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "जमाखोरी" करने वाला AI

एक पारंपरिक AI को एक ऐसे छात्र के रूप में सोचें जो, किसी प्रश्न का उत्तर देने के लिए, इतिहास की किताबों के पूरे पुस्तकालय को पढ़ने पर अड़ा रहता है, भले ही उत्तर केवल एक पैराग्राफ में हो। वह हर एक पन्ने को अपनी "वर्किंग मेमोरी" (GPU) में रखता है।

  • परिणाम: यदि कहानी 5,00,000 शब्दों की है, तो छात्र को फुटबॉल के मैदान के आकार की मेज की आवश्यकता होगी। यह महंगा और अक्षम है।

2. समाधान: "स्मार्ट लाइब्रेरियन" (Lookahead Sparse Attention)

शोधकर्ताओं ने Lookahead Sparse Attention (LSA) नामक एक नई प्रणाली बनाई है। कल्पना कीजिए कि अब AI के पास एक अत्यंत कुशल लाइब्रेरियन खड़ा है।

  • चाल: सभी पन्नों को मेज पर रखने के बजाय, लाइब्रेरियन वर्तमान प्रश्न को देखता है और अनुमान लगाता है कि अगले कुछ वाक्यों के लिए अतीत के किन विशिष्ट पन्नों की आवश्यकता होगी।
  • कार्य: लाइब्रेरियन केवल उन विशिष्ट पन्नों को शेल्फ (CPU स्टोरेज) से निकालता है और उन्हें छोटी मेज (GPU मेमोरी) पर रखता है। बाकी की किताब सुरक्षित रूप से शेल्फ पर रहती है, रास्ते से दूर।
  • परिणाम: मेज छोटी रहती है, लेकिन AI के पास अभी भी वही सटीक जानकारी होती है जिसकी उसे आवश्यकता है।

3. लाइब्रेरियन कैसे सीखता है (The "Decoupled" Training)

आमतौर पर, एक लाइब्रेरियन को प्रशिक्षित करने के लिए, आपको पूरे छात्र (विशाल AI मॉडल) को लाइब्रेरियन के साथ मिलकर अध्ययन करना पड़ता है। यह धीमा है और इसके लिए विशाल कंप्यूटरों की आवश्यकता होती है।

  • नवाचार: शोधकर्ताओं ने महसूस किया कि वे लाइब्रेरियन को अलग से प्रशिक्षित कर सकते हैं। उन्होंने उन "नोट्स" (हिडन स्टेट्स) को लिया जो AI ने पहले ही लिख लिए थे और लाइब्रेरियन को केवल उन नोट्स पर प्रशिक्षित किया।
  • लाभ: उन्हें लाइब्रेरियन को प्रशिक्षित करने के लिए विशाल AI मॉडल को कंप्यूटर में लोड करने की आवश्यकता नहीं थी। यह ऐसा था जैसे पूरे पुस्तकालय के बजाय इंडेक्स कार्ड के एक ढेर का उपयोग करके एक लाइब्रेरियन को प्रशिक्षित करना। इसने प्रशिक्षण को अविश्वसनीय रूप से तेज़ और सस्ता बना दिया।

4. परिणाम: "कम ही अधिक है" (Less is More)

इस प्रणाली का परीक्षण तीन प्रमुख चुनौतियों (LongBench-v2, LongMemEval, और RULER) पर किया गया, जिसमें 64,000 से लेकर 5,00,000 से अधिक शब्दों के दस्तावेज़ शामिल थे।

  • मेमोरी बचत: नए सिस्टम ने मानक AI द्वारा आवश्यक मेमोरी का केवल 13.5% उपयोग किया। सबसे बड़े पैमाने पर (5 लाख शब्द), इसने मेमोरी के 90% से अधिक की बचत की।
  • प्रदर्शन: आश्चर्यजनक रूप से, अप्रासंगिक पन्नों के "शोर" को हटाकर, AI वास्तव में थोड़ा बेहतर (लगभग 0.6% अधिक सटीक) प्रदर्शन कर सका। लाइब्रेरियन ने एक "नॉइज़ फिल्टर" के रूप में कार्य किया, जिससे AI को महत्वपूर्ण चीजों पर ध्यान केंद्रित करने में मदद मिली।

5. कमी (सीमाएं)

पेपर ईमानदारी से बताता है कि यह प्रणाली कहाँ संघर्ष करती है:

  • "MRCR" की विफलता: यदि किसी कार्य के लिए पूरी किताब के हर एक विवरण को एक साथ याद रखने की आवश्यकता होती है (जैसे कि एक विशिष्ट प्रकार का जटिल रिट्रीवल गेम), तो लाइब्रेरियन कभी-कभी चूक जाता है, और AI का प्रदर्शन काफी गिर जाता है।
  • "कॉन्टेक्स्ट-फ्री" ग्लिच: यदि AI से एक ऐसा प्रश्न पूछा जाता है जिसका लंबी कहानी से कोई लेना-देना नहीं है, तो लाइब्रेरियन कभी-कभी अनावश्यक रूप से कुछ अतिरिक्त पन्ने खींच लेता है, हालांकि यह अभी भी बहुत सारी मेमोरी बचाता है।
  • लंबाई की सीमा: लाइब्रेरियन को 5,12,000 शब्दों तक की किताबों पर प्रशिक्षित किया गया था। यदि आप इसे दोगुनी बड़ी किताब (10 लाख+ शब्द) देते हैं, तो यह भ्रमित होने लगता है और यह अनुमान लगाने लगता है कि कौन से पन्ने निकालने हैं।

6. वर्तमान स्थिति

पेपर के अंत में एक नोट है कि संगठनात्मक परिवर्तनों के कारण इस प्रोजेक्ट को निलंबित (suspend) कर दिया गया है। मुख्य शोधकर्ता कंपनी छोड़ चुके हैं। हालाँकि, उन्होंने यह रिपोर्ट यह दिखाने के लिए जारी की है कि "FlashMemory" का विचार काम करता है और दूसरों को इस काम को जारी रखने के लिए आमंत्रित करने के लिए।

संक्षेप में:
FlashMemory एक विशाल AI को एक स्मार्ट फिल्टर देने जैसा है। डेटा के समुद्र में डूबने के बजाय, यह आगे की झलक पाने, केवल उन महत्वपूर्ण जीवन-रक्षक नौकाओं (life-rafts) को पकड़ने और बाकी को अनदेखा करने के बारे में सीखता है जिनकी उसे जीवित रहने के लिए आवश्यकता है। यह इसे एक विशाल मेज की आवश्यकता के बिना विशाल किताबें पढ़ने की अनुमति देता है, और कई मामलों में, यह उन्हें बेहतर भी पढ़ता है क्योंकि यह शोर से विचलित नहीं होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →