← नवीनतम पेपर
💬 NLP

LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation

LogQuant ने एक नवीन लॉग-डिस्ट्रीब्यूटेड 2-बिट क्वांटाइजेशन तकनीक पेश की है जो KV कैश के लिए, न्यूनतम मेमोरी फुटप्रिंट बनाए रखते हुए, बड़े भाषा मॉडलों (LLMs) के लिए इन्फरेंस थ्रूपुट, बैच साइज और टास्क सटीकता में महत्वपूर्ण सुधार करती है।

मूल लेखक: Han Chen, Zicong Jiang, Zining Zhang, Bingsheng He, Pingyi Luo, Mian Lu, Yuqiang Chen

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Han Chen, Zicong Jiang, Zining Zhang, Bingsheng He, Pingyi Luo, Mian Lu, Yuqiang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी याद रखने की कोशिश कर रहे हैं ताकि अंत में एक चुटकुला सुना सकें। ऐसा करने के लिए, आपका मस्तिष्क (AI मॉडल) एक "रफ नोट" (स्क्रैचपैड/KV Cache) रखता है जहाँ वह अब तक सुनी गई हर शब्द और वाक्य को लिखता जाता है।

समस्या यह है कि जैसे-जैसे कहानी लंबी होती जाती है, यह स्क्रैचपैड बहुत बड़ा होता जाता है। यह इतनी जगह घेर लेता है कि आप एक साथ कई चुटकुले नहीं सुना सकते, या कहानी को प्रोसेस करने में बहुत लंबा समय लगता है।

पुराना तरीका: चीजों को फेंक देना या अनुमान लगाना
पिछले तरीकों ने इस समस्या को दो तरह से हल करने की कोशिश की:

  1. "कचरे का डिब्बा" (Trash Can) दृष्टिकोण: वे कहानी को देखते थे और अनुमान लगाते थे कि कौन से हिस्से महत्वहीन हैं, फिर उन्हें पूरी तरह से फेंक देते थे। समस्या यह थी कि वे अक्सर गलत चीजें फेंक देते थे, या अतीत में छिपे किसी महत्वपूर्ण विवरण को मिस कर देते थे।
  2. "धुंधली तस्वीर" (Blurry Photo) दृष्टिकोण: उन्होंने सब कुछ रखने की कोशिश की लेकिन उसे कम सटीक तरीके से लिखा (क्वांटाइजेशन)। लेकिन यदि उन्होंने सब कुछ बहुत अधिक धुंधला कर दिया, तो कहानी का कोई अर्थ नहीं रह जाता था।

नया तरीका: LogQuant (द लॉगरिदमिक लाइब्रेरी)
इस पेपर के लेखकों ने महसूस किया कि LogQuant, हमारे मस्तिष्क (और AI मॉडल) वास्तव में कैसे ध्यान देते हैं।

अंतर्दृष्टि: "लॉगरिदमिक" पैटर्न
उन्होंने खोजा कि जब AI कहानी को पीछे मुड़कर देखता है, तो वह हर शब्द को समान रूप से नहीं देखता है।

  • वह हाल के शब्दों (पिछले कुछ वाक्यों) को बहुत बारीकी से देखता है।
  • वह कुछ समय पहले के शब्दों को कम बारीकी से देखता है।
  • वह बिल्कुल शुरुआत के शब्दों को बहुत ही विरल रूप (sparsely) से देखता है।

महत्वपूर्ण बात यह है कि यह पैटर्न रैंडम नहीं है; यह एक विशिष्ट गणितीय वक्र (curve) का अनुसरण करता है जिसे लॉगरिदम (logarithm) कहा जाता है। इसे एक ऐसी लाइब्रेरी की तरह सोचें जहाँ सामने की अलमारियों (हाल की घटनाओं) की किताबें सघन रूप से रखी गई हैं, लेकिन जैसे-जैसे आप लाइब्रेरी में गहराई तक जाते हैं, अलमारियाँ चौड़ी होती जाती हैं और किताबें एक-दूसरे से दूर होती जाती हैं।

LogQuant कैसे काम करता है
चीजों को फेंकने या अनुमान लगाने के बजाय, LogQuant इस "स्पेस-आउट" पैटर्न का उपयोग करके अपनी मेमोरी को कंप्रेस (संकुचित) करता है:

  1. "हाल का" ज़ोन (The Recent Zone): यह कहानी के सबसे अंतिम भाग को हाई डेफ़िनेशन (पूर्ण सटीकता) में रखता है क्योंकि वहीं मुख्य क्रिया चल रही होती है।
  2. "मध्यम" ज़ोन (The Middle Zone): जैसे-जैसे यह पीछे जाता है, यह शब्दों को छोड़ना शुरू कर देता है। यह एक शब्द रखता है, एक छोड़ता है, एक रखता है, एक छोड़ता है।
  3. "गहरा" ज़ोन (The Deep Zone): और भी पीछे जाने पर, यह और अधिक शब्दों को छोड़ देता है। यह एक शब्द रखता है, तीन छोड़ता है, एक रखता है, तीन छोड़ता है।

ऐसा करके, यह मेमोरी को केवल 2 बिट्स (एक बहुत ही कम जगह, जैसे एक हाई-डेफिनेशन मूवी को एक छोटे टेक्स्ट फ़ाइल में बदलना) तक सिकोड़ सकता है बिना महत्वपूर्ण कथानक के बिंदुओं को खोए। क्योंकि यह AI के ध्यान देने के प्राकृतिक "लॉगरिदमिक" तरीके का पालन करता है, इसे यह अनुमान लगाने की आवश्यकता नहीं है कि कौन सा हिस्सा महत्वपूर्ण है; गणित इसे ठीक से बताता है कि कहाँ देखना है।

परिणाम: अधिक चुटकुले, बेहतर याददाश्त
पेपर का दावा है कि इस विधि का उपयोग करके:

  • गति (Speed): AI जानकारी को 25% तेज़ी से प्रोसेस कर सकता है।
  • क्षमता (Capacity): आप एक ही कंप्यूटर पर एक साथ 60% अधिक बातचीत चला सकते हैं क्योंकि मेमोरी का आकार बहुत छोटा हो जाता है।
  • सटीकता (Accuracy): गणित की समस्याओं को हल करने या कोड लिखने जैसे कठिन कार्यों के लिए, LogQuant अन्य संपीड़न (compression) विधियों की तुलना में 40% से 200% अधिक सटीक है। यह एक पहेली सुलझाने के लिए कहानी को स्पष्ट रखने जैसा है, भले ही मेमोरी बहुत छोटी हो।

यह "चीजों को फेंकने" से बेहतर क्यों है?
लेखकों ने यह भी सिद्ध किया कि "चीजों को फेंक देना" (eviction) AI के ध्यान के लिए बुरा है। यदि आप एक शब्द को हटा देते हैं, तो AI को यह पुनर्गणना करनी पड़ती है कि शेष शब्द एक-दूसरे से कैसे संबंधित हैं, जो कहानी को विकृत कर देता है। LogQuant सभी शब्दों को रखता है लेकिन उन्हें एक छोटे, कंप्रेस्ड फॉर्मेट में लिखता है। यह एक किताब के हर पन्ने को रखने जैसा है लेकिन उसे छोटे फॉन्ट में प्रिंट करना, बजाय इसके कि आधे पन्नों को फाड़ दिया जाए।

सारांश में
LogQuant AI की मेमोरी को सिकोड़ने का एक स्मार्ट तरीका है, यह महसूस करते हुए कि AI स्वाभाविक रूप से हाल की घटनाओं पर तीव्रता से और पुरानी घटनाओं पर ढीले ढंग से ध्यान देता है। इस प्राकृतिक पैटर्न के अनुरूप अपनी मेमोरी को कंप्रेस करके, यह AI को महत्वपूर्ण हिस्सों को "भुलने" दिए बिना बहुत अधिक स्थान और गति बचाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →