SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference
स्फेरिकल KV (Spherical KV) एक कुशल लॉन्ग-कॉन्टेक्स्ट इन्फरेंस विधि है जो एंगल-डोमेन अटेंशन (Angle-Domain Attention), जो सघन पुनर्निर्माण के बिना कॉम्पैक्ट स्फेरिकल की (spherical key) रिप्रजेंटेशन से सीधे अटेंशन लॉजिट्स की गणना करता है, और रेट-डिस्टॉर्शन रिटेंशन (Rate-Distortion Retention), जो एक निश्चित मेमोरी बजट के तहत टोकन रिटेंशन और प्रिसिजन को इष्टतम रूप से आवंटित करता है, को जोड़कर HBM बैंडविड्थ बाधाओं को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ही प्रश्न का उत्तर देने के लिए 1,00,000 पन्नों की एक विशाल किताब पढ़ने की कोशिश कर रहे हैं। ऐसा करने के लिए, आपके मस्तिष्क (AI) को अब तक पढ़ी गई हर चीज़ का एक "चीट शीट" (cheat sheet) रखने की आवश्यकता होगी ताकि कहानी का अंत पढ़ते समय आप शुरुआत को भूल न जाएं।
AI की भाषा में, यह चीट शीट KV Cache कहलाती है।
समस्या यह है, जैसा कि यह शोध पत्र बताता है, जैसे-जैसे किताब लंबी होती जाती है, यह चीट शीट इतनी बड़ी हो जाती है कि यह आपकी अल्पकालिक स्मृति (GPU की तेज़ मेमोरी) में फिट नहीं बैठती। भले ही यह फिट हो जाए, आपका मस्तिष्क इस विशाल चीट शीट के पन्नों को पलटने में वास्तव में उत्तर सोचने की तुलना में अधिक समय बिताता है। बाधा आपकी सोचने की गति नहीं है; बल्कि डेटा को इधर-उधर ले जाने वाले ट्रैफिक जाम की समस्या है।
मौजूदा समाधान इसे ठीक करने की कोशिश करते हैं या तो:
- पन्ने फेंक देते हैं: कहानी के पुराने हिस्सों को हटा देते हैं (जिससे महत्वपूर्ण विवरण भूलने का जोखिम रहता है)।
- बहुत छोटी लिखावट में लिखते हैं: टेक्स्ट को कंप्रेस (compress) करते हैं (जिसमें आमतौर पर उसे पढ़ने के लिए फिर से बड़े अक्षरों में लिखने की आवश्यकता होती है, जिससे समय बर्बाद होता है)।
Spherical KV एक नया तरीका है जो यह बदल देता है कि चीट शीट को कैसे लिखा जाता है और कैसे पढ़ा जाता है, बिना टेक्स्ट को बड़े अक्षरों में दोबारा लिखे।
यह कैसे काम करता है, सरल उपमाओं का उपयोग करके यहाँ दिया गया है:
1. "दिशा बनाम दूरी" की ट्रिक (Angle-Domain Attention)
कल्पना कीजिए कि आप किसी को कॉफी शॉप का रास्ता बता रहे हैं।
- पुराना तरीका: आप यात्रा के हर एक कदम के लिए सटीक निर्देशांक (अक्षांश, देशांतर, ऊंचाई) लिखते हैं। दुकान को खोजने के लिए, पाठक को पूर्ण 3D निर्देशांकों को देखना पड़ता है, एक जटिल गणितीय गणना करनी पड़ती है, और फिर दिशा का पता लगाना पड़ता है।
- Spherical KV का तरीका: आप महसूस करते हैं कि कॉफी शॉप को खोजने के लिए, केवल दूरी (वह कितनी दूर है) और दिशा (किस तरफ देखना है) ही मायने रखती है।
- आप दूरी को एक साधारण संख्या के रूप में लिखते हैं (जैसे, "5 मील")।
- आप दिशा को एक संक्षिप्त कोड के रूप में लिखते हैं (जैसे, "उत्तर-उत्तर-पूर्व")।
- जादू: जब पाठक को दुकान को खोजना होता है, तो उन्हें पूरा 3D मैप फिर से बनाने की आवश्यकता नहीं होती। वे "उत्तर-उत्तर-पूर्व" कोड और "5 मील" की संख्या को देख सकते हैं और तुरंत उत्तर जान सकते हैं। वे पूरे मैप को फिर से बनाने के भारी गणित को छोड़ देते हैं।
शोध पत्र में, इसे Angle-Domain Attention कहा गया है। यह 'कीज़' (टेक्स्ट की "दिशाएं") को एक त्रिज्या (radius) और एक कोण (angle) के रूप में संग्रहीत करता है। AI इन कोडों से सीधे "प्रासंगिकता" (relevance) की गणना कर सकता है और उसे कभी भी पूर्ण, भारी डेटा को फिर से बनाने की आवश्यकता नहीं होती। यह डेटा को इधर-उдя ले जाने में लगने वाले समय को बहुत कम कर देता है।
2. "स्मार्ट बजट" (Rate-Distortion Retention)
कल्पना कीजिए कि आपकी यात्रा के लिए आपके बैकपैक में सीमित स्थान है। आप सब कुछ नहीं ले जा सकते।
- पुराना तरीका: आप शायद पुरानी चीजें बस फेंक देते हैं, या सब कुछ समान रूप से कंप्रेस कर देते हैं (जिससे सब कुछ थोड़ा धुंधला हो जाता है)।
- Spherical KV का तरीका: आप एक स्मार्ट ट्रैवल एजेंट की तरह कार्य करते हैं। आप अपनी वस्तुओं को देखते हैं और पूछते हैं: "यह कितनी महत्वपूर्ण है?"
- महत्वपूर्ण वस्तुएं: "अस्पताल का नक्शा" या "एलर्जी की सूची।" आप इन्हें उच्च-गुणता वाले, अनकंप्रेस्ड विवरण में रखते हैं।
- जरूरी वस्तुएं: "होटल का नाम।" आप इन्हें रखते हैं, लेकिन शायद थोड़े छोटे फॉन्ट में।
- कम मूल्य की वस्तुएं: "मंगलवार को आकाश का रंग।" आप इन्हें पूरी तरह से हटा सकते हैं या इन्हें भारी रूप से कंप्रेस कर सकते हैं।
इसे Rate-Distortion Retention कहा जाता है। यह केवल यह तय नहीं करता कि क्या रखना है; यह यह भी तय करता है कि उसे कितनी स्पष्टता के साथ रखना है। यह अपने "मेमोरी बजट" को कहानी के उन हिस्सों पर खर्च करता है जो वर्तमान प्रश्न के लिए सबसे अधिक महत्वपूर्ण हैं, यह सुनिश्चित करता है कि सटीक होने की आवश्यकता होने पर AI धुंधली जानकारियों से भ्रमित न हो।
परिणाम
इन दोनों विचारों को जोड़कर, Spherical KV एक ऐसा सिस्टम बनाता है जहाँ:
- चीट शीट कम जगह लेती है (क्योंकि यह क्या रखना है, इस बारे में अधिक स्मार्ट है)।
- AI चीट शीट को तेजी से पढ़ता है (क्योंकि उसे समझने के लिए पूरे टेक्स्ट को फिर से बनाने की आवश्यकता नहीं होती)।
शोध पत्र के निष्कर्ष:
जब लेखकों ने लंबी कहानियों (1,28,000 शब्दों तक) पर इसका परीक्षण किया, तो उन्होंने पाया कि:
- AI पहले की तुलना में 1.5 से 1.7 गुना तेज़ टेक्स्ट जेनरेट कर सका।
- इसने समान कार्य करने के लिए 24% से 42% कम मेमोरी का उपयोग किया।
- सबसे महत्वपूर्ण बात यह है कि उत्तरों की गुणवत्ता में गिरावट नहीं आई। AI ने गलत जानकारी (hallucinate) देना या प्लॉट भूलना शुरू नहीं किया; यह बस अपनी मेमोरी को प्रबंधित करने में बहुत अधिक कुशल हो गया।
संक्षेप में:
Spherical KV को एक ऐसे पुस्तकालय से अपग्रेड करने के रूप में समझें जहाँ आपको पीछे जाना पड़ता है, एक विशाल विश्वकोश निकालना पड़ता है, पूरा पन्ना कॉपी करना पड़ता है, और फिर उसे पढ़ना पड़ता है, से एक ऐसे पुस्तकालय में जहाँ आपको बस एक छोटा, स्मार्ट इंडेक्स कार्ड मिलता है जो आपको तुरंत बताता है कि आपको क्या चाहिए। यह लंबे संवादों के "ट्रैफिक जाम" को मेमोरी को छोटा और पढ़ने की प्रक्रिया को स्मार्ट बनाकर हल करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।