← नवीनतम पेपर
🤖 machine learning

Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression

यह शोध पत्र हुरविट्ज़ क्वार्टरनियन मल्टीप्लिकेटिव क्वांटाइजेशन (HQMQ) को प्रस्तुत करता है, जो एक कैलिब्रेशन-मुक्त विधि है जो 4-तत्वों वाले चंक्स को एक निश्चित हुरविट्ज़ समूह और यादृच्छिक माध्यमिक कोडबुक्स के उत्पाद के माध्यम से क्वांटाइज किए गए क्वार्टरनियन के रूप में निरूपित करके KV कैश को संकुचित करती है, जिससे विविध आधुनिक LLMs में 5.05x तक संपीड़न के साथ लगभग fp16 सटीकता प्राप्त होती है और कैलिब्रेशन की आवश्यकता समाप्त हो जाती है।

मूल लेखक: Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, David Cox, Antonio Torralba

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, David Cox, Antonio Torralba

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression" (HQMQ) के पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "मेमोरी होर्डर" (याद रखने वाला लालची)

एक बुद्धिमान लेकिन भुलक्कड़ लाइब्रेरियन की कल्पना करें जो एक Large Language Model (LLM) है। जब आप उससे कोई लंबा सवाल पूछते हैं, तो उसे सही उत्तर देने के लिए यह याद रखना पड़ता है कि आपने अब तक क्या-क्या कहा है। कंप्यूटर की भाषा में, इस मेमोरी को KV Cache कहा जाता है।

बहुत लंबी बातचीत के लिए, यह मेमोरी कैश बहुत बड़ा हो जाता है। यदि लाइब्रेरियन हर विवरण को हाई-डेफिनिशन (जैसे 4K मूवी) में याद रखने की कोशिश करता है, तो यह कंप्यूटर की RAM को तुरंत भर देता है। इससे कंप्यूटर को धीमी स्टोरेज का उपयोग करने के लिए मजबूर होना पड़ता है या वह क्रैश हो जाता है, जिससे बातचीत रुक जाती है।

इसे ठीक करने के लिए, इंजीनियर डेटा को "कंप्रेस" (छोटा) करने की कोशिश करते हैं, जैसे किसी 4K मूवी को एक छोटी MP4 फ़ाइल में बदलना। हालाँकि, कंप्रेशन के पिछले तरीके एक कुंद चाकू (blunt knife) की तरह थे: यदि आप फ़ाइल के आकार को बहुत अधिक कम करते हैं (4 बिट से नीचे), तो मूवी देखने लायक नहीं रहती (AI बेतुकी बातें करने लगता है)। यदि AI मॉडल में "आउटलेयर्स" (डेटा में अजीब, अत्यधिक संख्याएँ) होते हैं, तो मानक कंप्रेशन पूरी तरह से टूट जाता है, जिससे AI बेतहाशा भ्रमित (hallucinate) होने लगता है।

समाधान: HQMQ ("स्मार्ट कंपास" सिस्टम)

लेखकों ने HQMQ नामक एक नई विधि प्रस्तावित की है। डेटा के समूहों को छोटा करने के बजाय, वे डेटा को क्वाटरनियंस (एक प्रकार का 4D गणितीय कंपास) के रूप में देखते हैं।

यह कैसे काम करता है, इसे तीन सरल चरणों में विभाजित किया गया है:

1. "24-पॉइंट स्टार" (प्राइमरी कोडबुक)

कल्पना करें कि डेटा का एक टुकड़ा जिस दिशा में इशारा कर रहा है, वह एक कंपास की सुई की तरह है। डेटा के सटीक कोण (angle) को स्टोर करने की कोशिश करने के बजाय (जिसमें बहुत जगह लगती है), लेखक एक विशेष, पहले से बने "तारे" का उपयोग करते हैं जिसमें 24 बिंदु (जिसे हर्ट्ज़ समूह कहा जाता है) होते हैं।

  • उपमा: इसे 24 निश्चित दिशाओं (उत्तर, उत्तर-पूर्व, आदि, लेकिन 4D में) के एक मानक सेट के रूप में सोचें। डेटा पॉइंट कहीं भी हों, आप बस उसे इन 24 "परफेक्ट" दिशाओं में से निकटतम दिशा पर सेट कर देते हैं।
  • जादू: क्योंकि ये 24 बिंदु गणितीय रूप से पूर्ण और समान रूप से फैले हुए हैं, आपको AI को इन्हें सीखने के लिए प्रशिक्षित करने की आवश्यकता नहीं है। ये केवल "हार्ड-कोडेड" नियम हैं, जैसे कीबोर्ड पर अक्षर।

2. "रैंडम स्पिन" (सेकेंडरी कोडबुक)

24 बिंदु हर संभव बारीकी को कवर करने के लिए पर्याप्त नहीं हैं। इसलिए, लेखक एक दूसरा स्तर जोड़ते हैं: प्रत्येक विशिष्ट AI भाग के लिए एक छोटा, रैंडम "स्पिन" (घूर्णन)।

  • उपमा: कल्पना करें कि आपके पास एक ग्लोब है जिस पर 24 बिंदु पेंट किए गए हैं। अब, कल्पना करें कि आप हर उस वाक्य के लिए ग्लोब को रैंडमली घुमा सकते हैं जिसे AI प्रोसेस कर रहा है।
  • परिणाम: जब आप इन निश्चित 24 बिंदुओं को एक रैंडम स्पिन के साथ मिलाते हैं, तो आपको हजारों अद्वितीय दिशाएं प्राप्त होती हैं (24×random spins24 \times \text{random spins})।
  • यह क्यों शानदार है: पेपर का दावा है कि आपको इस रैंडम स्पिन को ट्रेन करने की आवश्यकता नहीं है। इसके पीछे के गणित के कारण, कोई भी रैंडम स्पिन लगभग एक प्रशिक्षित (trained) स्पिन जितना ही अच्छा काम करता है। यह कहना ऐसा ही है जैसे, "आपको डार्ट फेंकने का अभ्यास करने की आवश्यकता नहीं है; बस उन्हें रैंडमली फेंकें, और गणित गारंटी देता है कि आप बोर्ड पर ही हिट करेंगे।" इससे समय और डेटा की बचत होती है।

3. "आउटलेयर सेफ्टी नेट" (Med3×)

कुछ AI मॉडल (जैसे Qwen) में "आउटलेयर्स" होते हैं—ऐसे डेटा पॉइंट्स जो सामान्य से 100x या 200x बड़े होते हैं। मानक कंप्रेशन इन विशाल नंबरों को फिट करने के लिए उन्हें दबाने की कोशिश करता है, जिससे डेटा नष्ट हो जाता है।

  • उपमा: कल्पना करें कि आप एक सूटकेस पैक कर रहे हैं। अधिकांश कपड़े सामान्य आकार के हैं, लेकिन आपके पास एक बहुत बड़ा, अजीब आकार का टेडी बियर है। यदि आप टेडी बियर को एक छोटे बॉक्स में डालने की कोशिश करेंगे, तो वह बॉक्स फट जाएगा।
  • समाधान: HQMQ का एक नियम है: "यदि कोई नंबर बहुत बड़ा है (औसत से 3 गुना से अधिक), तो उसे दबाएं नहीं। बस उसे उसके मूल, उच्च-गुणवत्ता वाले रूप (fp16) में रखें और उसे एक छोटे झंडे (flag) के साथ चिह्नित करें।"
  • परिणाम: केवल 1-3% डेटा को इस विशेष उपचार की आवश्यकता होती है, इसलिए मेमोरी की बचत अभी भी बहुत अधिक है, लेकिन ये "विशाल टेडी बियर" सिस्टम को तोड़ते नहीं हैं।

उन्होंने क्या साबित किया?

लेखकों ने पांच अलग-अलग आधुनिक AI मॉडल (Mistral, Llama, Qwen, आदि) पर इसका परीक्षण किया। उनके मुख्य निष्कर्ष यहाँ दिए गए हैं:

  • यह बिना ट्रेनिंग के काम करता है: अन्य तरीकों के विपरीत जिन्हें "कैलिब्रेशन" चरण (जहाँ AI डेटा को समझने के लिए अध्ययन करता है) की आवश्यकता होती है, HQMQ रैंडम सेटिंग्स के साथ तुरंत काम करता है।
  • यह भारी जगह बचाता है: वे मेमोरी कैश को 5 गुना तक सिकोड़ने में सफल रहे। उदाहरण के लिए, 70-बिलियन-पैरामीटर वाले मॉडल के लिए 128k-कॉन्टेक्स्ट कैश (जो आमतौर पर 43 GB लेता है) को 8.5 GB तक सिकोड़ दिया गया। इसका मतलब है कि आप एक सुपरकंप्यूटर के बजाय एक सिंगल कंज्यूमर ग्राफिक्स कार्ड पर एक विशाल AI चला सकते हैं।
  • यह "खराब" डेटा को संभालता है: अत्यधिक आउटलेयर्स वाले मॉडल्स (जैसे Qwen) पर, मानक कंप्रेशन पूरी तरह विफल हो गया (AI की त्रुटि दर बढ़ गई)। HQMQ + "सेफ्टी नेट" ने इस समस्या को ठीक कर दिया, जिससे AI का प्रदर्शन लगभग पूर्ण स्तर पर वापस आ गया।
  • गति: उन्होंने एक विशेष "फ्यूज्ड" इंजन बनाया है जो कंप्रेस्ड डेटा को पढ़ता है और AI के सोचते समय ही इसे तुरंत डिकोड कर देता है। इसका मतलब है कि AI धीमा नहीं होता है; यह बस कम मेमोरी का उपयोग करता है।

निचोड़ (The Bottom Line)

HQMQ AI मेमोरी के लिए एक यूनिवर्सल, प्री-मेड कंप्रेशन किट की तरह है। यह एक चतुर गणितीय ट्रिक (एक निश्चित 24-पॉइंट स्टार को रैंडम स्पिन के साथ गुणा करना) का उपयोग करता है ताकि कुछ भी सीखने की आवश्यकता के बिना दिशाओं को कुशलतापूर्वक स्टोर किया जा सके। इसमें अजीब डेटा स्पाइक्स के लिए एक सुरक्षा स्विच भी है।

परिणाम? आप बहुत छोटे कंप्यूटरों पर बहुत लंबी, स्मार्ट बातचीत चला सकते हैं बिना AI के अपना मानसिक संतुलन खोए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →