← नवीनतम पेपर
🤖 machine learning

ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models

ThinKV एक थॉट-अडेप्टिव (thought-adaptive) KV कैश कंप्रेशन फ्रेमवर्क है जो अटेंशन स्पैरसिटी (attention sparsity) का लाभ उठाकर हाइब्रिड क्वांटाइजेशन और इविक्शन रणनीतियों को लागू करता है, जिससे बड़े रीजनिंग मॉडल्स को मूल कैश के 5% से भी कम के साथ लगभग लॉसलेस सटीकता प्राप्त करने और इन्फरेंस थ्रूपुट को 5.8 गुना तक बढ़ाने में सक्षम बनाया जा सके।

मूल लेखक: Akshat Ramachandran, Marina Neseem, Charbel Sakr, Rangharajan Venkatesan, Brucek Khailany, Tushar Krishna

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Akshat Ramachandran, Marina Neseem, Charbel Sakr, Rangharajan Venkatesan, Brucek Khailany, Tushar Krishna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही जटिल गणितीय समस्या को हल करने या कोड का एक लंबा हिस्सा लिखने की कोशिश कर रहे हैं। आपके पास एक शानदार सहायक (AI) है जो हर कदम पर ज़ोर से सोचता है। यह "ज़ोर से सोचने" की प्रक्रिया को Chain of Thought (विचारों की श्रृंखला) कहा जाता है।

समस्या यह है कि जैसे-जैसे सहायक अधिक समय तक सोचता है, उसे यह याद रखने की आवश्यकता होती है कि उसने अब तक क्या कहा है ताकि वह ट्रैक पर बना रहे। कंप्यूटर की भाषा में, इस स्मृति को KV Cache कहा जाता है। यदि सहायक बहुत लंबे समय तक सोचता है, तो यह स्मृति का ढेर इतना बड़ा हो जाता है कि यह कंप्यूटर के मस्तिष्क (GPU मेमोरी) को भर देता है, जिससे सिस्टम क्रैश हो जाता है या बहुत धीमा हो जाता है।

यह शोध पत्र ThinKV (सोचें KV) नामक एक नई प्रणाली पेश करता है जो इस समस्या को हल करती है। यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है:

1. समस्या: एक बिखरी हुई मेज (A Cluttered Desk)

कल्पना कीजिए कि AI की स्मृति एक मेज की तरह है जहाँ वह अपने द्वारा सोचे गए हर विचार को एक के ऊपर एक रखता है।

  • पुराना तरीका: जगह बचाने के लिए, पिछले तरीके केवल मेज पर रखे सबसे पुराने कागजों को फेंक देते थे (जैसे कल के नोट्स फेंक देना) या सभी कागजों को बहुत छोटे, पढ़ने में कठिन सूक्ष्म-अक्षरों (क्वांटाइजेशन) में सिकोड़ देते थे।
  • दोष: कभी-कभी, सबसे "पुराना" कागज वास्तव में सबसे महत्वपूर्ण सुराग होता है। और सब कुछ सिकोड़ने से गणित गलत हो जाता है। AI भ्रमित हो जाता है और बार-बार एक ही चीज़ दोहराने लगता है या गलत उत्तर देने लगता है।

2. अंतर्दृष्टि: सभी विचार समान नहीं होते (Not All Thoughts Are Created Equal)

लेखकों ने पाया कि जब एक AI तर्क करता है, तो वह केवल यादृच्छिक शब्द उत्पन्न नहीं करता है। वह सोचने के तीन अलग-अलग "मोड्स" से गुजरता है, जिन्हें वे Thought Types (विचारों के प्रकार) कहते हैं:

  • तर्क (Reasoning - R): गहरी सोच, योजना और तर्क। (उच्च महत्व)
  • निष्पादन (Execution - E): वास्तविक गणना या कोड लिखना। (मध्यम महत्व)
  • संक्रमण (Transition - T): "रुको, मुझे एक बार चेक करने दो," "हम्म," या "वास्तव में, मैं गलत था" जैसे क्षण। (कम महत्व, लेकिन स्थिरता के लिए महत्वपूर्ण)

उन्होंने पाया कि संक्रमण (Transition) के क्षणों के दौरान AI का ध्यान स्वाभाविक रूप से "विरल" (कम केंद्रित) हो जाता है, जिससे उन्हें पहचानना आसान हो जाता है।

3. समाधान: एक स्मार्ट फाइलिंग सिस्टम (ThinKV)

ThinKV एक सुपर-स्मार्ट लाइब्रेरियन की तरह कार्य करता है जो विचारों के पुराने होने के आधार पर नहीं, बल्कि विचार के प्रकार के आधार पर मेज को व्यवस्थित करता है। यह दो मुख्य तरकीबों का उपयोग करता है:

तरकीब A: "क्वांटाइज करने से पहले सोचें" (Shrinking the Right Papers)

हर कागज को एक ही छोटे आकार में सिकोड़ने के बजाय, ThinKV उन्हें उनके महत्व के आधार पर सिकोड़ता है:

  • तर्क वाले कागज (Reasoning papers) को बड़ा और स्पष्ट रखा जाता है (उच्च सटीकता) क्योंकि वे मुख्य तर्क हैं।
  • निष्पादन वाले कागज (Execution papers) को थोड़ा सिकोड़ा जाता है (मध्यम सटीकता)।
  • संक्रमण वाले कागज (Transition papers) (जैसे "रुको, हम्म" वाले क्षण) को सबसे छोटे संभव आकार में सिकोड़ दिया जाता है (निम्न सटीकता)।
  • परिणाम: आप महत्वपूर्ण तर्क को खोए बिना बहुत अधिक स्थान बचाते हैं।

तरकीब B: "निकालने से पहले सोचें" (Think Before You Evict)

जब मेज बहुत भर जाती है, तो ThinKV केवल सबसे पुराना कागज नहीं फेंकता। यह कहानी के प्रवाह को देखता है:

  • यदि AI एक संक्रमण (Transition) क्षण पर पहुँचता है (दिशा में बदलाव), तो ThinKV जानता है कि वह सुरक्षित रूप से पिछले विचारों के समूह को हटा सकता है क्योंकि AI पहले ही एक नए पथ पर आगे बढ़ चुका है।
  • यह व्यक्तिगत शब्दों को चुनने के बजाय विचारों के पूरे खंडों (chunks) को एक साथ हटा देता है।
  • महत्वपूर्ण नियम: यह हमेशा संक्रमण (Transition) विचारों का एक छोटा "सुरक्षा जाल" (safety net) रखता है। शोध पत्र नोट करता है कि यदि आप इन्हें पूरी तरह से हटा देते हैं, तो AI "रुको, मैं क्या कर रहा था?" के अंतहीन लूप में फंस जाता है।

4. सिस्टम हैक: "सफाई करना" अब नहीं (No More "Cleaning Up")

आमतौर पर, जब आप किसी स्मृति प्रणाली से चीजें हटाते हैं, तो आप खाली जगह (गैप) बना देते हैं जिन्हें साफ करने और पुनर्व्यवस्थित करने के लिए एक धीमी, ऊर्जा-गहन प्रक्रिया (जिसे संकुचन या compaction कहा जाता है) की आवश्यकता होती है।

  • ThinKV का नवाचार: यह एक विशेष "निरंतर सोच" (Continuous Thinking) इंजन का उपयोग करता है। अंतराल को साफ करने के बजाय, यह सीधे पुराने विचारों द्वारा छोड़े गए खाली स्थानों में नए विचारों को लिख देता है।
  • उपमा: कल्पना कीजिए कि एक पार्किंग गैरेज है। पुरानी कारें निकल जाती हैं, जिससे खाली जगह बन जाती है। गैरेज के खाली स्थानों को भरने के लिए सफाईकर्मी के इंतजार करने के बजाय (जिससे ट्रैफिक जाम हो सकता है), ThinKV बस नई कारों को सीधे खाली जगहों में चला देता है। यह गैरेज को अविश्वसनीय रूप से तेज़ बनाता है।

परिणाम

इस शोध पत्र का परीक्षण कठिन गणित और कोडिंग कार्यों पर किया गया:

  • स्मृति: इसने मूल मेमोरी स्पेस के 5% से भी कम का उपयोग किया।
  • सटीकता: यह पूर्ण, अनकंप्रेस्ड संस्करण के लगभग समान रूप से स्मार्ट था (लगभग लॉसलेस)।
  • गति: इसने मौजूदा सर्वोत्तम तरीकों की तुलना में AI को 5.8 गुना तेज़ बना दिया क्योंकि यह मेमोरी खत्म हुए बिना एक साथ कई उपयोगकर्ताओं को संभाल सकता था।

संक्षेप में: ThinKV AI को अपने विचारों को व्यवस्थित करना, उबाऊ हिस्सों को सिकोड़ना और पुराने विचारों को तभी हटाना सिखाता है जब यह वास्तव में सुरक्षित हो, और यह सब करते हुए मेमोरी सिस्टम को बिना किसी अव्यवस्थित सफाई के सुचारू रूप से चलाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →