← नवीनतम पेपर
🤖 machine learning

Training Transformers for KV Cache Compressibility

यह शोध पत्र KV-कंप्रेशन अवेयर ट्रेनिंग (KV-CAT) को प्रस्तुत करता है, जो एक निरंतर प्रीट्रेनिंग विधि है जो प्रशिक्षण के दौरान KV स्लॉट्स को मास्क करती है ताकि स्वाभाविक रूप से संपीड़ित (compressible) प्रतिनिधित्व सीखने को प्रोत्साहित किया जा सके, जिससे लॉन्ग-कॉन्टेक्स्ट लैंग्वेज मॉडलिंग के लिए पोस्ट-हॉक KV कैश कंप्रेशन की प्रभावशीलता में उल्लेखनीय सुधार होता है।

मूल लेखक: Yoav Gelberg, Yam Eitan, Michael Bronstein, Yarin Gal, Haggai Maron

प्रकाशित 2026-05-08
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yoav Gelberg, Yam Eitan, Michael Bronstein, Yarin Gal, Haggai Maron

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी किताब पढ़ रहे हैं, और आप इसके सबसे महत्वपूर्ण हिस्सों को याद रखना चाहते हैं ताकि आप बाद में इसके बारे में सवालों के जवाब दे सकें। AI की दुनिया में, इस "याददाश्त" को KV Cache (Key-Value Cache) कहा जाता है।

यहाँ समस्या यह है: जैसे-जैसे किताब लंबी होती जाती है, AI को पढ़े गए हर एक शब्द के लिए नोट्स की एक बढ़ती हुई सूची रखनी पड़ती है। अंततः, यह सूची इतनी विशाल हो जाती है कि इसकी मेमोरी खत्म हो जाती है या इसे पढ़ने में बहुत अधिक समय लगने लगता है।

इसे ठीक करने के लिए, वैज्ञानिकों ने AI को प्रशिक्षित (train) करने के बाद इन नोट्स को "सारांशित" (summarize) करने की कोशिश की है। वे उबाऊ नोट्स को फेंकने और केवल महत्वपूर्ण नोट्स को रखने की कोशिश करते हैं। लेकिन इस शोध पत्र के लेखकों ने इस दृष्टिकोण में एक खामी पाई है: यह एक ऐसी किताब का सारांश बनाने जैसा है जो बहुत ही बिखरी हुई और अव्यवस्थित लिखावट में लिखी गई हो। आप कितनी भी मेहनत क्यों न कर लें, मूल बिखराव इतना अधिक है कि अर्थ खोए बिना महत्वपूर्ण विवरणों को बनाए रखना असंभव हो जाता है।

मुख्य विचार: शुरुआत से ही सफाई से लिखना

यह शोध पत्र तर्क देता है कि AI को प्रशिक्षित करने के बाद उसके बिखरे हुए नोट्स को साफ करने के बजाय, हमें AI को शुरुआत से ही साफ और संकुचित (compressible) नोट्स लिखना सिखाना चाहिए।

वे इस नई प्रशिक्षण विधि को KV-CAT (KV-Compression Aware Training) कहते हैं।

यह कैसे काम करता है: "लुका-छिपी" का खेल

AI को साफ नोट्स लिखना सिखाने के लिए, शोधकर्ताओं ने प्रशिक्षण के दौरान "लुका-छिपी" (या तकनीकी रूप से, KV Sparsification) नामक एक खेल खेला।

  1. सेटअप: कल्पना कीजिए कि AI एक वाक्य पढ़ रहा है। सामान्य रूप से, यह अगले शब्द को समझने के लिए हर एक शब्द को देखता है।
  2. ट्विस्ट: प्रशिक्षण के दौरान, शोधकर्ता यादृच्छिक रूप से (randomly) लगभग आधे शब्दों को "छिपा" (mask) देते हैं। AI को पिछले सभी नोट्स देखे बिना अगले शब्द का अनुमान लगाने के लिए मजबूर किया जाता है।
  3. सबक: क्योंकि AI सभी नोट्स देखने पर निर्भर नहीं रह सकता, इसलिए वह अपनी मेमोरी को अलग तरह से व्यवस्थित करना सीख जाता है। वह सबसे महत्वपूर्ण जानकारी को कम से कम नोट्स में पैक करना सीख जाता है, ठीक वैसे ही जैसे एक छात्र एक संक्षिप्त संस्करण पर परीक्षण होने के ज्ञान के कारण एक आदर्श सारांश लिखना सीखता है।
  4. सुरक्षा जाल: यह सुनिश्चित करने के लिए कि AI सामान्य रूप से पढ़ना न भूल जाए, वे इसे कभी-कभी पूर्ण, बिना छिपे हुए टेक्स्ट को भी पढ़ने देते हैं। यह सुनिश्चित करता है कि जब इसे संकुचित करने की आवश्यकता हो, तब भी यह स्मार्ट और सटीक बना रहे।

परिणाम: एक बेहतर मेमोरी

जब उन्होंने इस नई विधि का परीक्षण किया, तो परिणाम प्रभावशाली थे:

  • बेहतर सारांश: जब उन्होंने बाद में AI की मेमोरी को संकुचित करने की कोशिश की (मानक उपकरणों का उपयोग करके), तो KV-CAT के साथ प्रशिक्षित AI ने मानक AI की तुलना में मूल अर्थ को बहुत अधिक सुरक्षित रखा।
  • तेज़ प्रोसेसिंग: KV-CAT AI की मेमोरी को संकुचित करने में कम समय और प्रयास लगा।
  • बुद्धिमत्ता में कोई कमी नहीं: महत्वपूर्ण रूप से, AI सामान्य कार्यों में "मूर्ख" नहीं हुआ। संकुचित न होने पर भी यह मूल मॉडल की तरह ही सवाल पूछने और टेक्स्ट लिखने में उतना ही सक्षम था।

निष्कर्ष

इसे यात्रा के लिए पैकिंग करने के रूप में समझें।

  • पुराना तरीका: आप अपने पास मौजूद हर चीज़ के साथ एक बड़ा सूटकेस पैक करते हैं, फिर उसे हवाई अड्डे पर एक छोटे बैग में जबरदस्ती डालने की कोशिश करते हैं। इस चक्कर में आप अपना टूथब्रश या अपनी पसंदीदा शर्ट खो देते हैं।
  • KV-CAT तरीका: आपको शुरुआत से ही कुशलतापूर्वक पैक करना सिखाया जाता है। आप सीखते हैं कि छोटे बैग में क्या-क्या फिट होता है, ताकि जब आप हवाई अड्डे पर पहुँचें, तो आप कुछ भी महत्वपूर्ण खोए बिना उसे पूरी तरह से ज़िप कर सकें।

यह शोध पत्र सिद्ध करता है कि AI को "कंप्रेशन-अवेयर" (compression-aware) बनाने के लिए प्रशिक्षित करके, हम बिना उसके आर्किटेक्चर को बदले या उसकी बुद्धिमत्ता से समझौता किए, लंबे संदर्भों (long contexts) को संभालने में उन्हें बहुत अधिक कुशल बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →