← नवीनतम पेपर
🤖 machine learning

KVSculpt: KV Cache Compression as Distillation

KVSculpt एक नवीन KV कैश संपीड़न विधि प्रस्तुत करता है जो निरंतर एम्बेडिंग स्पेस में अनियंत्रित KV युग्मों को अनुकूलित करने के लिए अनुकूली बजट आवंटन द्वारा संवर्धित, बारी-बारी से L-BFGS और लीस्ट-स्क्वायर समाधानों के माध्यम से अनुकूलित करता है, ताकि मौजूदा चयन या विलय दृष्टिकोणों की तुलना में KL डाइवर्जेंस को काफी कम किया जा सके और अटेंशन व्यवहार को संरक्षित किया जा सके।

मूल लेखक: Bo Jiang, Sian Jin

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bo Jiang, Sian Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी को याद रखने की कोशिश कर रहे हैं ताकि आप बाद में उसे आगे लिख सकें। AI की दुनिया में, इस "याददाश्त" को KV Cache कहा जाता है।

सामान्य तौर पर, एक कहानी को याद रखने के लिए, एक AI अपने नोटबुक में हर एक शब्द और उसके संदर्भ (context) को लिख देता है। यदि कहानी 2,000 शब्दों की है, तो नोटबुक बहुत बड़ी हो जाती है, जिससे कंप्यूटर की मेमोरी भर जाती है और सब कुछ धीमा हो जाता है।

पुराना तरीका: "कैंची और गोंद" (The Scissors and Glue)

मेमोरी को छोटा करने के मौजूदा तरीके एक अनाड़ी संपादक की तरह काम करते हैं जिसके पास दो उपकरण हैं:

  1. निकाले जाना (Eviction - कैंची): AI नोटबुक को देखता है और निर्णय लेता है, "मैं सबसे महत्वपूर्ण 30% शब्दों को रखूँगा और बाकी को फेंक दूँगा।" यह एक किताब से पन्ने काटने जैसा है। समस्या क्या है? आप केवल वे पन्ने रख सकते हैं जो पहले से मौजूद हैं। यदि सबसे महत्वपूर्ण विचार दो ऐसे पन्नों में फैला हुआ था जिन्हें आपने फेंक दिया, तो आप उसे हमेशा के लिए खो देंगे।
  2. विलय करना (Merging - गोंद): AI दो समान पन्नों को ढूँढता है और उन्हें एक में जोड़ने के लिए आपस में चिपका देता है। यह काटने से बेहतर है, लेकिन आप अभी भी मूल स्याही तक ही सीमित हैं। आप पन्ने पर लिखे शब्दों को बदल नहीं सकते; आप केवल उन्हें मिला सकते हैं।

दोनों तरीके सीमित हैं क्योंकि वे नोटबुक के मूल पन्जों का उपयोग करने के लिए मजबूर हैं। वे कहानी का नया सारांश बनाने में सक्षम नहीं हैं।

नया तरीका: KVSCULPT (द "मास्टर समराइज़र")

यह पेपर KVSCULPT पेश करता है, जो खेल को पूरी तरह बदल देता है। मौजूदा पन्जों को काटने या चिपकाने के बजाय, KVSCULPT एक शानदार घोस्टराइटर (ghostwriter) की तरह काम करता है।

यह इस प्रकार काम करता है:

  • अवधारणा (The Concept): यह पूछने के बजाय कि, "मुझे मूल पन्जों के कौन से 30% हिस्से रखने चाहिए?", KVSCULPT पूछता है, "यदि मैं शुरुआत से 30 बिल्कुल नए और सटीक पन्ने लिख सकूँ, तो वे क्या कहेंगे जिससे AI कहानी को उतनी ही अच्छी तरह याद रख सके?"
  • जादू (The Magic): यह केवल शब्द नहीं चुनता; यह नए "वेक्टर्स" (अर्थ के गणितीय प्रतिनिधित्व) बनाता है जो मूल टेक्स्ट में मौजूद ही नहीं थे। यह एक 1,000 पन्नों के उपन्यास को एक 300 पन्नों के "परफेक्ट सारांश" में बदलने जैसा है जो कहानी के सार को पकड़ लेता है, भले ही वह सारांश उन वाक्यों का उपयोग करे जो मूल पुस्तक में कभी नहीं आए थे।

यह सारांश कैसे बनाता है

AI इन नए सटीक पन्नों को बनाने के लिए दो-चरणीय नृत्य (dance) का उपयोग करता है:

  1. "की" (The Key - हुक): यह नए पन्नों के लिए सटीक "हुक्स" या विषयों को समझने के लिए एक स्मार्ट गणितीय टूल (L-BFGS) का उपयोग करता है। यह पूरी किताब का सारांश देने वाले सटीक अध्याय शीर्षकों (chapter titles) को खोजने जैसा है।
  2. "वैल्यू" (The Value - सामग्री): एक बार जब हुक सेट हो जाते हैं, तो यह सामग्री को पूरी तरह से भरने के लिए एक गणितीय पहेली को हल करता है। यह हिस्सा तेज़ और स्वचालित है।

यह नृत्य तब तक दोहराता रहता है जब तक कि नया 300-पन्नों का सारांश AI के मस्तिष्क में ठीक वही यादें पैदा न कर दे जो मूल 1,000-पन्नों की किताब करती थी।

"स्मार्ट बजट" का तरीका

इस पेपर ने यह भी गौर किया कि कुछ दिलचस्प बात है: कहानी के सभी हिस्से याद रखने में समान रूप से कठिन नहीं होते।

  • कुछ अध्याय सरल होते हैं (जिन्हें कंप्रेस करना आसान है)।
  • कुछ अध्याय जटिल होते हैं, जिनमें मोड़ या भावनात्मक उतार-चढ़ाव होते हैं (जिन्हें कंप्रेस करना कठिन है)।

पुराने तरीके हर अध्याय को समान स्थान (जैसे, प्रत्येक को 10 पन्ने) देते थे। KVSCULPT पहले कहानी का परीक्षण करने के लिए एक "पायलट रन" (Pilot Run) का उपयोग करता है। यह जल्दी से जाँच करता है कि कौन से अध्याय कठिन हैं।

  • परिणाम: यह कठिन अध्यायों को 20 पन्ने और उबाऊ अध्यायों को केवल 5 पन्ने देता है।
  • लाभ: कुल आकार वही रहता है, लेकिन मेमोरी बहुत अधिक स्मार्ट होती है। यह एक सूटकेस पैक करने जैसा है: आप अपने मोज़ों को अपने नाजुक फूलदान के समान जगह नहीं देते।

यह क्यों महत्वपूर्ण है

  • बेहतर मेमोरी: कठिन कहानियों पर, KVSCULPT पुराने "कैंची" वाले तरीके की तुलना में 4 गुना कम गलतियाँ करता है।
  • लगभग बिना किसी नुकसान के (Near-Lossless): सरल कहानियों के लिए, यह मेमोरी को इतना कंप्रेस कर सकता है कि AI लगभग कोई गलती नहीं करता है।
  • चुनौती (The Catch): AI के बोलने शुरू करने से पहले इस "परफेक्ट सारांश" को लिखने में थोड़ा समय लगता है। इसलिए, यह ऑफलाइन कार्यों के लिए (जैसे कि आपके पास पहले से मौजूद एक विशाल दस्तावेज़ का सारांश बनाना) एकदम सही है, लेकिन वास्तविक समय की बातचीत (real-time chatting) के लिए जहाँ आपको तुरंत उत्तर चाहिए, यह बहुत धीमा हो सकता है।

निष्कर्ष

KVSCULPT को एक ऐसे लाइब्रेरियन के रूप में न देखें जो किताबें फेंक रहा है, बल्कि एक कलाकार के रूप में देखें जो एक नई, छोटी मूर्ति गढ़ रहा है जो मूल विशाल मूर्ति के सार को पकड़ लेती है। यह समझता है कि जगह बचाने के लिए, आपको मूल ईंटों को रखने की आवश्यकता नहीं है; आपको बस एक बेहतर, छोटा ढांचा बनाने की आवश्यकता है जो उसी आकार को बनाए रखे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →