← नवीनतम पेपर
💬 NLP

EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models

एन्ट्रॉपीकैश (EntropyCache) डिफ्यूजन-आधारित लार्ज लैंग्वेज मॉडल्स के लिए एक ट्रेनिंग-मुक्त KV कैशिंग विधि है जो डिकोडेड टोकन एन्ट्रॉपी का उपयोग एक स्थिर-लागत वाले सिग्नल के रूप में यह गतिशील रूप से निर्णय लेने के लिए करती है कि कब कैश किए गए स्टेट्स को पुनर्गणना (recompute) किया जाए, जिससे न्यूनतम ओवरहेड के साथ प्रतिस्पर्धी सटीकता बनाए रखते हुए महत्वपूर्ण इन्फरेंस स्पीडअप प्राप्त होता है।

मूल लेखक: Minsoo Cheong, Donghyun Son, Woosang Lim, Sungjoo Yoo

प्रकाशित 2026-03-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minsoo Cheong, Donghyun Son, Woosang Lim, Sungjoo Yoo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ EntropyCache पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "सब कुछ फिर से लिखने" का नियम

कल्पना कीजिए कि आप एक बहुत ही सख्त, जादुई संपादक के साथ एक कहानी लिख रहे हैं।

  • सामान्य लेखक (Autoregressive Models): वे एक बार में एक शब्द लिखते हैं, बाएँ से दाएँ। एक बार जब वे एक शब्द लिख देते हैं, तो वे उसे कभी नहीं बदलते। यदि उन्हें अगला शब्द लिखने के लिए पिछले शब्द को याद रखने की आवश्यकता होती है, तो वे बस अपनी नोटबुक देखते हैं। यह तेज़ और कुशल है।
  • डिफ्यूजन लेखक (dLLMs): ये मॉडल अलग तरह से काम करते हैं। वे "रहस्यमय बक्सों" (masks) से भरी एक खाली पन्ने से शुरुआत करते हैं। हर चरण में, वे कुछ बक्सों के अंदर झाँकते हैं, अनुमान लगाते हैं कि वहाँ कौन से शब्द होने चाहिए, और फिर पूरे विवरण (story) का पुनर्मूल्यांकन (re-evaluate) करते हैं ताकि यह सुनिश्चित हो सके कि नए शब्द पुराने शब्दों के साथ पूरी तरह फिट बैठते हैं।

रुकावट (The Bottleneck): क्योंकि डिफ्यूजन लेखक हर बार नया शब्द अनुमान लगाने के लिए पूरी कहानी को देखता है, वह पुराने हिस्सों को बस "याद" नहीं रख सकता। उसे हर चरण के लिए पूरी कहानी को शुरू से फिर से कैलकुलेट करना पड़ता है। यह एक मास्टरपीस बनाने की कोशिश करने जैसा है जहाँ हर एक ब्रशस्ट्रोक जोड़ने के बाद आपको पूरा कैनवास फिर से पेंट करना पड़ता है। यह अविश्वसनीय रूप से धीमा है।

पुराना समाधान: "आलसी" अनुमान

इसे तेज़ करने के लिए, पिछले तरीकों ने "आलसी" होने की कोशिश की। उन्होंने कहा, "हे, कहानी का अधिकांश हिस्सा ज़्यादा नहीं बदला है, तो चलो पुराने कैलकुलेशन (KV Cache) को कॉपी-पेस्ट कर देते हैं और केवल नए हिस्सों को फिर से कैलकुलेट करते हैं।"

  • खामी: यह जानने के लिए कि "आलसी" होना कब सुरक्षित है, इन तरीकों को कहानी के हर एक शब्द पर एक जटिल "स्वास्थ्य जाँच" (health check) करनी पड़ती थी। उन्हें कहानी के नए संस्करण की तुलना पुराने संस्करण से परत-दर-परत (layer by layer) करनी पड़ती थी।
  • लागत: यह "स्वास्थ्य जाँच" इतनी महंगी और जटिल थी कि इसने समय की अधिकांश बचत को खत्म कर दिया। यह एक घर को बनाने के बाद, यह देखने के लिए इंजीनियरों की एक टीम को काम पर रखने जैसा था कि क्या आप पूरे घर को फिर से पेंट करने से बच सकते हैं।

नया समाधान: EntropyCache (द "सरप्राइज मीटर")

इस पेपर के लेखकों ने, EntropyCache, एक शानदार और सरल तरकीब निकाली। उन्होंने महसूस किया कि उन्हें पूरे घर की जाँच करने की ज़रूरत नहीं है। उन्हें बस एक सवाल पूछना था: "मॉडल कितना हैरान हुआ?"

वे एंट्रॉपी (Entropy) नामक एक अवधारणा का उपयोग करते हैं, जो मूल रूप से अनिश्चितता (uncertainty) या आश्चर्य (surprise) का एक माप है।

दो स्वर्णिम नियम ("अहा!" मोमेंट्स)

  1. नियम #1: आश्चर्य = परिवर्तन।

    • उपमा: कल्पना कीजिए कि आप एक वाक्य में अगला शब्द अनुमान लगा रहे हैं।
      • यदि आप 100% आश्वस्त हैं कि अगला शब्द "The" है (कम एंट्रॉपी), तो आप वास्तव में कुछ नया नहीं सीख रहे हैं। कहानी ज्यादा नहीं बदल रही है। आप भारी पुनर्गणना (re-calculation) को सुरक्षित रूप से छोड़ सकते हैं।
      • यदि आप पूरी तरह भ्रमित हैं और मॉडल "Cat," "Dog," "Car," या "Pizza" के बीच अनुमान लगा रहा है (उच्च एंट्रॉपी), तो इसका मतलब है कि मॉडल एक "यूरेका" क्षण का अनुभव कर रहा है। वह एक बड़े बदलाव के प्रति प्रतिबद्ध हो रहा है। जब मॉडल हैरान होता है, तो पूरी कहानी की संरचना बदल जाती है। यही वह संकेत है कि अब आलसी होना बंद करें और सब कुछ फिर से कैलकुलेट करें।
    • जादू: पूरी कहानी की जाँच करने के बजाय, वे बस नए शब्दों के "आश्चर्य के स्तर" को देखते हैं। यह एक छोटा, सस्ता कैलकुलेशन है (जैसे थर्मामीटर चेक करना) जो उन्हें ठीक से बताता है कि कब कड़ी मेहनत करनी है और कब आराम करना है।
  2. नियम #2: "हैंगओवर" प्रभाव।

    • उपमा: कभी-कभी, मॉडल द्वारा एक शब्द चुनने के बाद भी, वह थोड़ा डगमगाता रहता है। यह एक ऐसे व्यक्ति की तरह है जिसने अभी-अभी एक बड़ा निर्णय लिया है; वह स्थिर होने से पहले कुछ चरणों तक डगमगा सकता है।
    • सुधार: पिछले तरीके केवल तत्काल नए शब्द को फिर से कैलकुलेट करते थे। EntropyCache कहता है, "नहीं, आइए उन पिछले कुछ शब्दों को भी फिर से कैलकुलेट करें जिन्हें हमने अभी-अभी तय किया है, ताकि यह सुनिश्चित हो सके कि वे स्थिर हैं।" यह कहानी को बाद में भटकने से रोकता है।

व्यवहार में यह कैसे काम करता है

यहाँ EntropyCache की चरण-दर-चरण प्रक्रिया दी गई है, जिसे एक ट्रैफिक लाइट सिस्टम के रूप में देखा जा सकता है:

  1. रुकना और चलना (The Stop & Go): मॉडल कुछ नए शब्द बनाता है।
  2. जाँच (लाइट): सिस्टम उन नए शब्दों के "सरप्राइज मीटर" (एंट्रॉपी) की जाँच करता है।
    • ग्रीन लाइट (कम आश्चर्य): मॉडल आश्वस्त है। "ठीक है, हम ठीक हैं।" -> भारी काम को छोड़ दें (Skip)। पुराने नोट्स (Cache) का उपयोग करें।
    • रेड लाइट (उच्च आश्चर्य): मॉडल भ्रमित है या एक बड़ी छलांग लगा रहा है। "ओह, चीजें बदल रही हैं!" -> रुकें! सटीकता सुनिश्चित करने के लिए कहानी का पूर्ण पुनर्गणना (full re-calculation) करें।
  3. सेफ्टी नेट: भले ही लाइट ग्रीन हो, सिस्टम पिछले कुछ शब्दों (हाल के टोकन) की दोबारा जाँच करता है ताकि यह सुनिश्चित हो सके कि वे डगमगाए नहीं।

यह एक बड़ी बात क्यों है?

  • गति: क्योंकि "सरप्राइज मीटर" को कैलकुलेट करना बहुत सस्ता है (इससे कोई फर्क नहीं पड़ता कि कहानी कितनी लंबी है या मॉडल कितना बड़ा है), सिस्टम यह तय करने में लगभग शून्य समय खर्च करता है।
  • परिणाम: अपने परीक्षणों में, इस पद्धति ने डिफ्यूजन मॉडल्स को मानक तरीके की तुलना में 15 से 26 गुना तेज़ बनाया, और जटिल तर्क कार्यों (जैसे गणित की समस्याओं) पर 100 गुना तक तेज़ बनाया, बिना सटीकता खोए।
  • सरलता: इसके लिए मॉडल को फिर से प्रशिक्षित (re-training) करने की आवश्यकता नहीं है। यह एक "प्लग-एंड-प्ले" अपग्रेड है जो एक स्मार्ट ट्रैफिक कंट्रोलर की तरह काम करता है, जो प्रवाह को तेज़ रखता है लेकिन ठीक तभी रुकता है जब कोई दुर्घटना होने वाली होती है।

सारांश उपमा

कल्पना कीजिए कि आप एक धुंध भरे शहर में कार चला रहे हैं।

  • पुराना तरीका: आप हर 10 फीट पर कार से बाहर निकलते हैं, घूमते हैं और नक्शा देखते हैं कि आगे का रास्ता साफ है या नहीं। इसमें बहुत समय लगता है।
  • EntropyCache: आप बस अपने वाइपर (windshield wipers) को देखते हैं। यदि वे धीरे चल रहे हैं (कम आश्चर्य), तो आप जानते हैं कि रास्ता साफ है और आप तेज़ गाड़ी चला सकते हैं। यदि वे पागलों की तरह हिल रहे हैं (उच्च आश्चर्य), तो आप जानते हैं कि कुछ बड़ा हो रहा है, इसलिए आप धीमे हो जाते हैं और सावधानी से नक्शा देखते हैं।

EntropyCache वह स्मार्ट वाइपर है जो डिफ्यूजन मॉडल्स को दुर्घटनाग्रस्त हुए बिना हाईवे की गति से चलाने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →