← नवीनतम पेपर
🤖 machine learning

CompilerKV: Risk-Adaptive KV Compression via Offline Experience Compilation

CompilerKV एक ऑफलाइन-कंपाइल्ड KV रिटेंशन पॉलिसी पेश करता है जो शोर वाले ऑनलाइन एस्टीमेशन को कुशल O(1)O(1) लुकअप से बदलने के लिए क्रॉस-प्रॉम्ट रेगुलैरिटी का लाभ उठाता है, जो मौजूदा प्रीफिल-ओनली कंप्रेशन विधियों की तुलना में अत्यधिक मेमोरी बाधाओं के तहत अत्याधुनिक प्रदर्शन और बेहतर स्केलेबिलिटी प्राप्त करता है।

मूल लेखक: Ning Yang, Chengzhi Wang, Yibo Liu, Baoliang Tian, Haijun Zhang

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ning Yang, Chengzhi Wang, Yibo Liu, Baoliang Tian, Haijun Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी याद रखने की कोशिश कर रहे हैं ताकि बाद में उससे जुड़े सवालों के जवाब दे सकें। आपका मस्तिष्क (AI मॉडल) सबसे महत्वपूर्ण हिस्सों को पकड़ने के लिए एक सीमित मात्रा में "मानसिक स्क्रैचपैड" स्थान (जिसे KV Cache कहा जाता है) का उपयोग करता है।

यदि कहानी छोटी है, तो आप सब कुछ याद रख सकते हैं। लेकिन यदि कहानी 1,00,000 शब्दों लंबी है, तो आपका स्क्रैचपैड भर जाएगा। आपको जगह बनाने के लिए कुछ हिस्सों को फेंकना होगा। समस्या यह है: एक बार जब आपने कुछ फेंक दिया, तो आप उसे कभी वापस नहीं पा सकते। यदि आपने गलती से उस हिस्से को हटा दिया जहाँ खलनायक अपनी गुप्त योजना का खुलासा करता है, तो आपकी पूरी कहानी बिखर जाएगी।

पुराना तरीका: उसी क्षण अनुमान लगाना

पिछले तरीकों ने यह तय करने की कोशिश की कि क्या रखना है, यह देखते हुए कि कहानी अभी कैसी है, वास्तविक समय में। वे कहते थे, "इस शब्द का अटेंशन स्कोर (attention score) अधिक है, इसलिए यह महत्वपूर्ण होना चाहिए!" या "यह वाक्य जटिल लग रहा है, इसे रखें!"

इस शोध पत्र के लेखक तर्क देते हैं कि यह एक फिल्म के केवल एक शोर भरे फ्रेम को देखकर पूरी फिल्म का न्याय करने जैसा है। क्योंकि कहानी बहुत लंबी है और डेटा अव्यवस्थित है, केवल एक प्रॉम्प्ट (एक कहानी) को देखना गलत अनुमानों की ओर ले जाता है। आप एक चमकते हुए लेकिन बेकार शब्द को रख सकते हैं और एक शांत लेकिन महत्वपूर्ण सुराग को फेंक सकते हैं।

नया तरीका: COMPILERKV (एक "प्री-गेम रणनीति")

लेखक COMPILERKV पेश करते हैं। मौके पर अनुमान लगाने के बजाय, वे पहले से ही एक रणनीति "कंपाइल" (compile) करते हैं, जैसे कोई कोच बड़े मैच से पहले गेम फिल्म का अध्ययन करता है।

यह कैसे काम करता है, इसे तीन सरल चरणों में विभाजित किया गया है:

1. "शोर फिल्टर" (Stabilized Utility)

कल्पना कीजिए कि आप एक भीड़भाड़ वाले कमरे में सुन रहे हैं। कुछ लोग चिल्ला रहे हैं (transient spikes), और कुछ माइक्रोफोन बस दूसरों की तुलना में तेज़ हैं (scale bias)।

  • समाधान: COMPILERKV केवल यह नहीं सुनता कि कौन सबसे ज़ोर से चिल्ला रहा है। यह शोर को सुचारू बनाता है और वॉल्यूम को सामान्य (normalize) करता है। यह पूछता है, "क्या यह व्यक्ति वास्तव में कुछ महत्वपूर्ण कह रहा है, या वे बस शोर मचा रहे हैं?" यह AI को अस्थायी शोर से धोखा खाने से रोकता है।

2. "विशेषज्ञ मानचित्र" (Head Heterogeneity Table)

AI के भीतर, कई अलग-अलग "मस्तिष्क कोशिकाएं" (जिन्हें अटेंशन हेड्स कहा जाता है) होती हैं। कुछ तथ्य खोजने में विशेषज्ञ हैं (जैसे एक लाइब्रेरियन), जबकि अन्य केवल शोर मचाने वाली बातें करती हैं।

  • समाधान: लेखकों ने हजारों कहानियों का ऑफलाइन अध्ययन किया और महसूस किया: कुछ मस्तिष्क कोशिकाएं हमेशा विश्वसनीय होती हैं, और अन्य हमेशा शोर भरी होती हैं। उन्होंने एक स्थायी "विशेषज्ञों का मानचित्र" बनाया।
  • उपमा: पूरी टीम से राय मांगने के बजाय, सिस्टम जानता है: "यदि 'लाइब्रेरियन' कोशिका कहती है कि एक शब्द महत्वपूर्ण है, तो हम उसे रखेंगे, भले ही 'चैटरबॉक्स' कोशिकाएं कहें कि वह बेकार है।" यह महत्वपूर्ण जानकारी को बचाने के लिए विश्वसनीय विशेषज्ञों को "वीटो पावर" देता है।

3. "जोखिम मीटर" (Risk-Adaptive Threshold)

सभी कहानियाँ एक जैसी नहीं होतीं। कुछ सरल होती हैं (एक रेसिपी); अन्य जटिल और भ्रमित करने वाली होती हैं (एक रहस्य उपन्यास)।

  • समाधान: सिस्टम यह जांचता है कि वर्तमान कहानी कितनी "जोखिम भरी" है।
    • कम जोखिम (सरल कहानी): "हम आक्रामक हो सकते हैं। 90% टेक्स्ट को हटा दें; हम ठीक रहेंगे।"
    • उच्च जोखिम (भ्रमित करने वाली कहानी): "यह खतरनाक है! रूढ़िवादी बनें। बस सावधानी के तौर पर 95% टेक्स्ट को रखें।"
  • उपमा: यह यात्रा के लिए पैकिंग करने जैसा है। यदि आप जानते हैं कि मौसम बेहतरीन है, तो आप हल्का सामान पैक करते हैं। यदि तूफान की चेतावनी है, तो आप अतिरिक्त सामान पैक करते हैं। COMPILERKV स्वचालित रूप से यह तय करने के लिए कि उसे कितना रखना है, वर्तमान प्रॉम्प्ट के आधार पर खुद को समायोजित करता है।

यह एक बड़ी बात क्यों है

शोध पत्र का दावा है कि मौके पर अनुमान लगाने (ऑनलाइन ह्यूरिस्टिक्स) के बजाय इस "प्री-गेम स्टडी" (ऑफलाइन कंपाइलेशन) को करके, उन्हें बहुत बेहतर परिणाम मिलते हैं:

  • यह पोर्टेबल है: उनके द्वारा बनाया गया "विशेषज्ञों का मानचित्र" विभिन्न AI मॉडलों पर काम करता है। यह एक सार्वभौमिक नियम पुस्तिका की तरह है जो विभिन्न प्रकार के मस्तिष्क पर लागू होती है।
  • यह मेमोरी बचाता है: वे AI को बहुत कम मेमोरी बजट (मूल टेक्स्ट का केवल 1.5%) पर चलते रहने के योग्य बना सकते हैं और फिर भी प्रश्नों के सही उत्तर दे सकते हैं।
  • यह लंबी सामग्री को संभालता है: जब विशाल संदर्भों (1,28,000 शब्दों तक) पर परीक्षण किया गया, तो COMPILERKV मजबूत रहा जबकि अन्य तरीके विफल हो गए। उदाहरण के लिए, एक "नीडल इन अ हेस्टैक" (Needle in a Hayestack) परीक्षण में (एक विशाल टेक्स्ट में एक विशिष्ट तथ्य खोजना), COMPILYKV ने 89% बार सुई को खोज निकाला, जबकि अगली सबसे अच्छी विधि ने इसे केवल 42% बार खोजा।

निचोड़

COMPILERKV एक पल के भीतर सटीक निर्णय लेने की कोशिश करना बंद करता है। इसके बजाय, यह तय करने के लिए कि क्या रखना है, एक पूर्व-निर्धारित, जोखिम-जागरूक रणनीति का उपयोग करता है। यह एक जुआरी द्वारा लगाई गई जंगली बाजी और एक शतरंज के ग्रैंडमास्टर के बीच का अंतर है, जिसने वर्षों के अनुभव के आधार पर सर्वोत्तम चालों की पहले से गणना कर ली है। परिणाम एक ऐसा AI है जो बिना मेमोरी खत्म किए या महत्वपूर्ण हिस्सों को भूले, भारी मात्रा में टेक्स्ट को याद रख सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →