← नवीनतम पेपर
💬 NLP

S4^4R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching

यह शोध पत्र S4^4R का प्रस्ताव करता है, जो एक नवीन KV कैश संपीड़न विधि है जो लो-रैंक सबस्पेस बनाने के लिए प्रॉम्प्ट-अवेयर सिलेक्टिव सैंपलिंग को डिकोडिंग के दौरान स्पार्स रिकंस्ट्रक्शन के साथ जोड़ती है, जिससे ऑफलाइन विधियों की कैलिब्रेशन डेटा निर्भरता और ऑनलाइन फुल-प्रॉम्ट रिकंस्ट्रक्शन की उच्च कम्प्यूटेशनल लागत से बचते हुए लगभग पूर्ण सटीकता के साथ 5×\times तक संपीड़न प्राप्त किया जाता है।

मूल लेखक: Jialong Han, You Wu, Kewei Tu

प्रकाशित 2026-08-04
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jialong Han, You Wu, Kewei Tu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बड़ी कहानी को याद करने की कोशिश कर रहे हैं ताकि आप उसे अपने दोस्त को सुना सकें। जैसे-जैसे कहानी लंबी होती जाती है, हर एक विवरण को अपने दिमाग में बनाए रखने के लिए आपको अधिक मानसिक ऊर्जा की आवश्यकता होती है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से लार्ज लैंग्वेज मॉडल्स (LLMs) में, इस "मानसिक ऊर्जा" को मेमोरी (स्मृति) कहा जाता है। ये मॉडल अविश्वसनीय रूप से स्मार्ट होते हैं, लेकिन जब वे बहुत लंबे दस्तावेज़ों—जैसे पूरी किताबें या घंटों की बातचीत—को पढ़ने या लिखने की कोशिश करते हैं, तो वे अपनी मेमोरी खो देते हैं क्योंकि वे उस हर एक शब्द को सहेजने की कोशिश करते हैं जो उन्होंने कभी देखा है। इसे ठीक करने के लिए, वैज्ञानिक यह पता लगाने की कोशिश कर रहे हैं कि महत्वपूर्ण हिस्सों को खोए बिना उनके दिमाग में कहानी का सारांश कैसे बनाया जाए। उन्होंने दो मुख्य तरीके आजमाए हैं: या तो किसी भी कहानी के लिए काम करने वाला एक सामान्य सारांश याद करना (जो तेज़ है लेकिन अक्सर मुख्य बात चूक जाता है), या अभी पढ़ रहे विशिष्ट कहानी का सारांश बनाने की कोशिश करना (जो सटीक है लेकिन इसमें गणना करने में बहुत अधिक समय और मानसिक शक्ति लगती है)।

यहाँ S4R आता है, जो शंघाईटेक यूनिवर्सिटी के शोधकर्ताओं द्वारा प्रस्तावित एक नई विधि है जो दोनों दुनियाओं का सर्वश्रेष्ठ परिणाम देने की कोशिश करती है। S4R को एक सुपर-स्मार्ट लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में सोचें जो न केवल पूरी लाइब्रेरी को रटने की कोशिश करती है, और न ही वह केवल अंदाज़ा लगाती है कि किताबों में क्या है। इसके बजाय, वह कहानी के सामान्य भाव (vibe) को समझने के लिए कुछ प्रमुख पृष्ठों को तेज़ी से स्कैन करती है, शुरुआती कुछ वाक्यों (जो अक्सर लहजा निर्धारित करते हैं) को पूर्ण विवरण के साथ सुरक्षित रखती है, और फिर केवल उन विशिष्ट पृष्ठों को निकालती है जिन्हें वह अपने अगले वाक्य को लिखने के लिए आवश्यक समझती है। यह AI को मेमोरी खत्म किए बिना भारी मात्रा में टेक्स्ट को संभालने की अनुमति देता है, जबकि वह प्रश्नों के सटीक उत्तर देने में भी सक्षम रहता है। शोधकर्ताओं ने लोकप्रिय AI मॉडलों पर इसका परीक्षण किया और पाया कि यह मेमोरी की आवश्यकता को 5 गुना तक कम कर सकता है, जबकि AI का प्रदर्शन लगभग उतना ही अच्छा रहता है जितना कि यदि उसने सब कुछ पूरी तरह से याद रखा होता।

समस्या: "बहुत अधिक सामग्री" की दुविधा

लार्ज लैंग्वेज मॉडल्स उन छात्रों की तरह हैं जिन्होंने पूरा इंटरनेट पढ़ लिया है। जब वे किसी प्रश्न का उत्तर देते हैं, तो वे केवल अनुमान नहीं लगाते; वे यह सुनिश्चित करने के लिए अब तक पढ़े गए सब कुछ को पीछे मुड़कर देखते हैं कि उनका उत्तर तर्कसंगत हो। इस "पीछे मुड़कर देखने" के लिए एक विशेष स्टोरेज क्षेत्र की आवश्यकता होती है जिसे KV कैश (KV Cache) कहा जाता है। KV कैश को एक व्हाइटबोर्ड की तरह समझें जहाँ मॉडल कहानी पढ़ते समय सबसे महत्वपूर्ण तथ्यों को लिखता है।

समस्या यह है कि जैसे-जैसे कहानी लंबी होती जाती है (कुछ वाक्यों से लेकर एक पूरे उपन्यास तक), व्हाइटबोर्ड बहुत बड़ा हो जाता है। यदि कहानी 128,000 शब्दों की है, तो व्हाइटबोर्ड इतना स्थान घेर लेता है कि वह मॉडल के मस्तिष्क से भी बड़ा हो सकता है! यह AI को धीमा और चलाने में महंगा बना देता है।

वैज्ञानिकों ने इसे हल करने के दो तरीके आजमाए हैं, लेकिन दोनों में एक कमी है:

  1. "एक ही आकार सबके लिए" (One-Size-Fits-All) दृष्टिकोण: कुछ विधियाँ एक निश्चित नियम का उपयोग करके व्हाइटबोर्ड को कंप्रेस (संक्षिप्त) करने की कोशिश करती हैं जो किसी भी कहानी के लिए काम करता है। यह तेज़ है, लेकिन यदि कहानी अजीब या अनूठी है, तो कंप्रेशन गलत विवरणों को हटा सकता है, और AI भ्रमित हो सकता है।
  2. "सबका विश्लेषण करने वाला" (Analyze-Everything) दृष्टिकोण: अन्य विधियाँ कहानी को पढ़ते समय ही विशिष्ट कहानी का विश्लेषण करने की कोशिश करती हैं ताकि यह तय किया जा सके कि क्या रखना है। यह बहुत सटीक है, लेकिन यह पहली बार किताब पढ़ते समय उसका सारांश बनाने जैसा है—इसमें इतना अतिरिक्त समय लगता है कि AI अविश्वसनीय रूप से धीमा हो जाता है।

S4R समाधान: "स्मार्ट लाइब्रेरियन" रणनीति

S4R विधि (सिलेक्टिव सैंपलिंग, सबस्पेस और स्पार्स रिकंस्ट्रक्शन) एक चतुर लाइब्रेरियन की तरह कार्य करती है जो जानती है कि एक विशाल लाइब्रेरी को बिना अभिभूत हुए कैसे प्रबंधित किया जाए। यह तीन मुख्य तरकीबों का उपयोग करती है:

1. "एंकर" पृष्ठ (सिंक टोकन्स - Sink Tokens)
शोधकर्ताओं ने देखा कि कहानी के शुरुआती कुछ वाक्य अक्सर एक "गोंद" की तरह काम करते हैं जो पूरी चीज़ को एक साथ जोड़कर रखते हैं। बाद में चाहे कुछ भी हो जाए, ये शुरुआती पंक्तियाँ हमेशा महत्वपूर्ण होती हैं। S4R इन पहले कुछ शब्दों (जिन्हें "सिंक टोकन्स" कहा जाता है) को कीमती अवशेषों की तरह मानता है। यह उन्हें उनके मूल, उच्च-गुणवत्ता वाले रूप में रखता है और उन्हें कभी कंप्रेस नहीं करता है। यह सुनिश्चित करता है कि AI हमेशा कहानी की शुरुआत को पूरी तरह से याद रखे।

2. "त्वरित स्कैन" (सिलेक्टिव सैंपलिंग - Selective Sampling)
पूरी 128,000 शब्दों की कहानी को एक साथ पढ़ने और सारांशित करने की कोशिश करने के बजाय (जो धीमा है), S4R एक त्वरित "स्निफ़ टेस्ट" (गंध परीक्षण) करता है। यह कहानी से शब्दों का एक छोटा, प्रतिनिधि नमूना चुनता है—कुछ शुरुआत से और कुछ अंत से—ताकि जानकारी के सामान्य "आकार" या "सबस्पेस" को समझा जा सके। यह एक किताब के कुछ रैंडम पन्ने पलटने जैसा है ताकि हर शब्द पढ़े बिना कथानक का सार समझा जा सके। यह मॉडल को हर एक टोकन का भारी काम किए बिना कहानी की संरचना का एक संक्षिप्त और कुशल सारांश बनाने की अनुमति देता है।

3. "जरूरत पड़ने पर पुनर्प्राप्ति" (स्पार्स रिकंस्ट्रक्शन - Sparse Reconstruction)
यह जादू का खेल है। जब AI को अगला शब्द लिखने की आवश्यकता होती है, तो वह पूरी कंप्रेस की गई कहानी को फिर से बनाने (reconstruct) की कोशिश नहीं करता। ऐसा करना बहुत धीमा होगा। इसके बजाय, वह संक्षिप्त सारांश को देखता है और पूछता है, "मैं अभी जो लिख रहा हूँ, उसके लिए कहानी के कौन से हिस्से वास्तव में प्रासंगिक हैं?"

  • यह हमेशा हाल के कुछ शब्दों ("लोकल विंडो") को रखता है क्योंकि वे आमतौर पर सबसे महत्वपूर्ण होते हैं।
  • फिर यह गहराई में अतीत के कुछ "वैश्विक रूप से महत्वपूर्ण" शब्दों को खोजने के लिए सारांश को स्कैन करता है जिनकी आवश्यकता पड़ सकती है।
  • यह केवल उन विशिष्ट शब्दों को ही "रिकंस्ट्रक्ट" (पूर्ण विवरण में वापस लाना) करता है और हाल के शब्दों को लाता है। यह उस विशेष क्षण के लिए बाकी कहानी को अनदेखा कर देता है।

परिणाम क्या दर्शाते हैं

शोधकर्ताओं ने दो प्रमुख चुनौतियों पर S4R का परीक्षण किया: LongBench (यह परीक्षण कि AI लंबे दस्तावेज़ों को कितनी अच्छी तरह समझता है) और RULER (यह परीक्षण कि AI टेक्स्ट के ढेर में विशिष्ट 'सुई' को कितनी अच्छी तरह ढूंढ सकता है)। उन्होंने Llama और Qwen जैसे लोकप्रिय AI मॉडलों का उपयोग किया।

यहाँ उन्हें क्या मिला:

  • विशाल मेमोरी बचत: S4R, KV कैश के लिए आवश्यक मेमोरी को 5 गुना तक कम करने में सक्षम था। यह एक बड़ी बात है क्योंकि इसका मतलब है कि AI छोटे कंप्यूटरों पर चल सकता है या बहुत लंबी कहानियों को संभाल सकता है।
  • सटीकता बनी रही: इतनी सारी कंप्रेशन के बावजूद, AI की सटीकता "फुल मेमोरी" संस्करण के बहुत करीब रही। LongBench टेस्ट पर, S4R का स्कोर अनकंप्रेस्ड मॉडलों के लगभग बराबर रहा, जिसने उन अन्य कंप्रेशन विधियों को भी पीछे छोड़ दिया जो बहुत आक्रामक होने की कोशिश कर रही थीं।
  • गति की जीत: अन्य विधियों की तुलना में जो चलते समय पूरी कहानी का विश्लेषण करने की कोशिश करती हैं (जैसे xKV नामक विधि), S4R बहुत तेज़ था। इसने उत्तर उत्पन्न करने में लगने वाले समय को (एक परीक्षण में लगभग 80 सेकंड से घटाकर 27 सेकंड कर दिया) कम कर दिया और इसकी समग्र लेखन गति उन धीमी, भारी-भरकम विधियों की तुलना में लगभग 4 से 5 गुना तेज़ थी।

निष्कर्ष

S4R सुझाव देता है कि आपको सब कुछ पूरी तरह से याद करने की आवश्यकता नहीं है, और न ही आपको अंधे होकर अंदाज़ा लगाने की ज़रूरत है। कहानी के "एंकर" को सुरक्षित रखकर, बड़े चित्र को समझने के लिए एक स्मार्ट, त्वरित स्कैन करके, और अगले कदम के लिए आवश्यक विशिष्ट विवरणों को वापस लाकर, AI मॉडल बहुत अधिक कुशल बन सकते हैं। शोधकर्ताओं ने दिखाया कि यह दृष्टिकोण विभिन्न प्रकार के AI मॉडलों और कार्यों में अच्छी तरह से काम करता है, जो लंबे-संदर्भ वाले AI को उसकी बुद्धिमत्ता खोए बिना तेज़ और सस्ता बनाने का एक व्यावहारिक तरीका प्रदान करता है। हालांकि यह विधि पूर्ण नहीं है (यह अभी भी "नीडल-इन-अ-हेस्टैक" के बहुत विशिष्ट कार्यों के लिए फुल मेमोरी की तुलना में थोड़ा संघर्ष करती है), यह लंबे दस्तावेज़ वाले AI को सभी के लिए उपयोगी बनाने की दिशा में एक महत्वपूर्ण कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →