← नवीनतम पेपर
🔢 mathematics

Polynomial Context-Truncation Sensitivity in Autoregressive Language Models: Sequential Wyner-Ziv Bounds for KV Cache Compression

यह शोध पत्र यह स्थापित करता है कि ऑटोरेग्रेसिव लैंग्वेज मॉडल्स में नेक्स्ट-टोकन डिस्ट्रीब्यूशन्स की कॉन्टेक्स्ट ट्रंकेशन के प्रति संवेदनशीलता ज्यामितीय (जियोमेट्रिक) के बजाय बहुपद (पॉलिनोमियल) रूप से घटती है, जिससे अनुक्रमिक वाइनर-ज़िव सोर्स कोडिंग के तहत सफिक्स-ओनली KV कैश कंप्रेशन पॉलिसियों की मेमोरी आवश्यकताओं के लिए एक व्युत्पन्न Θ(ε1/α)\Theta(\varepsilon^{-1/\alpha}) स्केलिंग लॉ प्राप्त होता है।

मूल लेखक: Munsik Kim

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Munsik Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी याद रखने की कोशिश कर रहे हैं ताकि आप अनुमान लगा सकें कि आगे क्या होगा। AI की दुनिया में, यह कहानी "कॉन्टेक्स्ट" (context) है (वे सभी शब्द जो मॉडल ने अब तक पढ़े हैं), और "प्रेडिक्शन" (prediction) अगला शब्द पहचानने का प्रयास है।

इसे करने के लिए, AI एक विशाल डिजिटल नोटबुक रखता है जिसे KV Cache कहा जाता है। हर बार जब वह एक शब्द पढ़ता है, तो वह उसके बारे में एक नोट लिखता है। समस्या क्या है? जैसे-जैसे कहानी लंबी होती जाती है, यह नोटबुक बहुत बड़ी हो जाती है, जिससे कंप्यूटर की सारी मेमोरी खत्म होने लगती है। इसे ठीक करने के लिए, इंजीनियर पुराने नोट्स को फेंकने की कोशिश कर रहे हैं, केवल सबसे महत्वपूर्ण नोट्स को ही रख रहे हैं।

यह शोध पत्र एक मौलिक प्रश्न पूछता है: पुराने शब्दों का महत्व कितनी तेजी से कम होता है?

बड़ी खोज: यह कोई लाइट स्विच नहीं, बल्कि एक मंद होती गूँज है

लंबे समय से, शोधकर्ता यह मान रहे थे कि इन मॉडल्स में पुरानी जानकारी एक लाइट स्विच बंद होने की तरह गायब हो जाती है। उन्हें लगा था कि यदि आप केवल कुछ दर्जन शब्द पीछे जाते हैं, तो मॉडल पहले जो कुछ भी आया था उसे पूरी तरह भूल जाएगा। तकनीकी शब्दों में, उन्होंने माना था कि "भूलने" की प्रक्रिया एक्सपोनेंशियल (exponentially) (बहुत तेजी से) होती है।

इस पेपर की मुख्य खोज यह है कि यह धारणा गलत है।

एक लाइट स्विच के बजाय, लेखकों ने पाया कि भूलने की प्रक्रिया एक मंद होती गूँज (fading echo) या धीरे-धीरे ढलते सूर्यास्त की तरह है। पुराने शब्दों का महत्व पॉलीनोमियल (polynomially) (बहुत धीरे-धीरे) कम होता है।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक गाना सुन रहे हैं।
    • पुराना दृष्टिकोण (Exponential): यदि आप 10 सेकंड के लिए सुनना बंद कर देते हैं, तो संगीत तुरंत शांत हो जाता है। आप 10 सेकंड पहले की कोई भी चीज़ नहीं सुन सकते।
    • नया दृष्टिकोण (Polynomial): यदि आप 10 सेकंड के लिए सुनना बंद कर देते हैं, तो संगीत धीमा हो जाता है, लेकिन आप अभी भी एक हल्की सी गूँज सुन सकते हैं। यदि आप 100 सेकंड के लिए रुकते हैं, तो यह और भी धीमा हो जाता है, लेकिन वह हल्की गूँज अभी भी वहीं है। अतीत का "सिग्नल" उम्मीद से कहीं अधिक लंबे समय तक बना रहता है।

प्रयोग: "मेमोरी" का परीक्षण

लेखकों ने कई AI मॉडल्स (जैसे Qwen और SmolLM) पर दो प्रकार के टेक्स्ट का उपयोग करके इसका परीक्षण किया: किताबें (प्राकृतिक भाषा) और कंप्यूटर कोड (Python)।

उन्होंने यह मापा कि जब उन्होंने कहानी की शुरुआत को काट दिया और केवल आखिरी कुछ शब्द दिखाए, तो मॉडल का प्रेडिक्शन कितना बदल गया।

  • परिणाम: जैसे-जैसे उन्होंने अधिक शब्द हटाए, मॉडल का प्रेडिक्शन धीरे-धीरे बदला। यह तुरंत क्रैश नहीं हुआ।
  • गणित: उन्होंने एक विशिष्ट "डिके रेट" (decay rate) पाया (एक संख्या जिसे α\alpha कहा जाता है)। किताबों के लिए, मेमोरी लगभग 0.44 की दर से कम होती है; कोड के लिए, यह लगभग 0.38 है। यह "स्लो फेड" (धीमी गिरावट) के सिद्धांत की पुष्टि करता है।

परिणाम: आपको एक बड़ी नोटबुक की आवश्यकता है

चूंकि मेमोरी बहुत धीरे-धीरे कम होती है, इसलिए एक छोटा "स्लाइडिंग विंडो" (जैसे, केवल पिछले 4,000 शब्द) रखने की पुरानी रणनीति उतनी कुशल नहीं है जितनी हमें उम्मीद थी।

  • पुराना तर्क: "यदि मैं पिछले 50 शब्द रखता हूँ, तो मैं 99% सुरक्षित हूँ।"
  • नई वास्तविकता: "क्योंकि मेमोरी धीरे-धीरे कम होती है, इसलिए 99% सुरक्षित रहने के लिए, मुझे शायद पिछले 500 शब्दों को रखना होगा।"

यह पेपर गणितीय रूप से सिद्ध करता है कि यदि आप त्रुटि (डिस्टॉर्शन) को कम रखना चाहते हैं, तो आपकी नोटबुक (विंडो) का आकार एक विशिष्ट पावर लॉ (power law) के अनुसार बढ़ना चाहिए। आप केवल एक छोटी विंडो रखकर पूर्ण परिणाम की उम्मीद नहीं कर सकते; आपको अतीत का एक बहुत बड़ा हिस्सा रखना होगा जितना कि पहले आवश्यक माना जाता था।

"सिंक" (Sink) और "रिसेंट" (Recent) की तकनीक

यह पेपर वास्तविक दुनिया के AI सिस्टम में उपयोग की जाने वाली एक लोकप्रिय ट्रिक का भी विश्लेषण करता है जिसे "Sink-Plus-Recent" कहा जाता है।

  • ट्रिक: कहानी के पहले कुछ शब्दों को रखें (जिसे "सिंक" कहा जाता है, जो एक एंकर की तरह काम करते हैं) और आखिरी कुछ शब्दों को रखें ("रिसेंट"), और बीच के सब कुछ हटा दें।
  • निष्कर्ष: यह आश्चर्यजनक रूप से अच्छा काम करता है! यह पेपर दो प्रकार की त्रुटियों के बीच एक गणितीय संबंध का उपयोग करके समझाता है कि यह क्यों काम करता है। यह पता चलता है कि क्योंकि "फेडिंग" धीमी है, इसलिए केवल शुरुआत और अंत को रखने से सबसे महत्वपूर्ण जानकारी मिल जाती है, जो रैंडम शब्दों को रखने की तुलना में त्रुटियों को लगभग 100 गुना कम कर देती है।

सरल अंग्रेजी में सारांश

  1. समस्या: AI मॉडल्स को लंबी कहानियों को याद रखने के लिए बहुत अधिक मेमोरी की आवश्यकता होती है।
  2. गलत धारणा: हमें लगा था कि पुरानी यादें थोड़े समय के बाद तुरंत गायब हो जाती हैं।
  3. सच्चाई: पुरानी यादें बहुत धीरे-धीरे कम होती हैं, जैसे एक लंबी गूँज की पूंछ।
  4. प्रभाव: अच्छे परिणाम प्राप्त करने के लिए, हमें अतीत की एक बहुत बड़ी "विंडो" रखनी होगी। यदि हम मेमोरी को बहुत आक्रामक तरीके से कंप्रेस करने की कोशिश करते हैं, तो AI अधिक गलतियाँ करेगा क्योंकि वह उस जानकारी को काट रहा है जो अभी भी सूक्ष्म रूप से प्रासंगिक है।
  5. अच्छी खबर: अब हमारे पास एक गणितीय मानचित्र (एक फॉर्मूला) है जो हमें बताता है कि एक निश्चित स्तर की सटीकता प्राप्त करने के लिए हमारी मेमोरी विंडो कितनी बड़ी होनी चाहिए। यह इंजीनियरों को बेहतर, अधिक कुशल AI सिस्टम डिजाइन करने में मदद करता है जो मेमोरी बर्बाद नहीं करते हैं लेकिन महत्वपूर्ण कॉन्टेक्स्ट भी नहीं खोते हैं।

यह पेपर किसी नए AI मॉडल या नए मेडिकल टूल के आविष्कार का दावा नहीं करता है। यह केवल एक सैद्धांतिक नियम पुस्तिका (theoretical rulebook) प्रदान करता है जो समझाती है कि ये मॉडल्स वास्तव में चीजों को कैसे याद रखते हैं, और एक लंबे समय से चली आ रही धारणा को सुधारता है कि वे कितनी तेजी से भूल जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →