MoE-nD: Per-Layer Mixture-of-Experts Routing for Multi-Axis KV Cache Compression
MoE-nD एक प्रति-परत मिश्रण-विशेषज्ञ (mixture-of-experts) रूटिंग फ्रेमवर्क पेश करता है जो एक वैश्विक मेमोरी बजट के तहत प्रत्येक ट्रांसफॉर्मर परत को अद्वितीय टोकन इविक्शन अनुपात और क्वांटाइजेशन बिट-चौड़ाई गतिशील रूप से आवंटित करता है, जिससे लंबी-संदर्भ तर्क कार्यों (long-context reasoning tasks) पर अनकंप्रेस्ड बेसलाइन के तुलनीय सटीकता बनाए रखते हुए 14x तक KV कैश संपीड़न प्राप्त किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ MoE-nD पेपर का सरल भाषा में अनुवाद दिया गया है:
बड़ी समस्या: "ओवरस्टफ्ड बैकपैक" (ज़रूरत से ज़्यादा भरा हुआ बस्ता)
कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक बहुत ही बुद्धिमान छात्र है जो एक बहुत लंबी कहानी या एक जटिल गणित की समस्या को हल करने की कोशिश कर रहा है। ऐसा करने के लिए, छात्र को अपनी "वर्किंग मेमोरी" (जिसे KV Cache कहा जाता है) में उन सभी चीज़ों की एक चलती हुई सूची रखनी होगी जो उसने अब तक पढ़ी हैं।
छोटी कहानियों के लिए, यह मेमोरी एक बैकपैक में आसानी से समा जाती है। लेकिन लंबे संदर्भों (जैसे कि पूरी किताब या 16,000 शब्दों का दस्तावेज़) के लिए, बैकपैक इतना भारी और बड़ा हो जाता है कि:
- यह छात्र की गति को धीमा कर देता है (लेटेंसी)।
- यह मानक कंप्यूटरों पर बैकपैक को फाड़ देता है (आउट-ऑफ-मेमोरी एरर)।
पुराना समाधान: "एक ही नियम सबके लिए"
इसे ठीक करने के लिए, शोधकर्ताओं ने बैकपैक को छोटा करने की कोशिश की। उन्होंने दो मुख्य उपकरणों का उपयोग किया:
- इविक्शन (Eviction - चीज़ों को बाहर फेंकना): जगह बनाने के लिए पुरानी नोट्स को डिलीट करना।
- क्वांटाइजेशन (Quantization - शॉर्टहैंड में लिखना): नोट्स को छोटी, कम सटीक लिखावट में लिखना (जैसे, 16-बिट के बजाय 4-बिट नंबरों का उपयोग करना)।
दोष: पिछले तरीकों ने छात्र के मस्तिष्क के साथ एक "कुकी कटर" (एक ही सांचे) जैसा व्यवहार किया। उन्होंने मस्तिष्क के हर हिस्से पर एक ही नियम लागू किया।
- उदाहरण: "पूरी कहानी के नोट्स में से 50% फेंक दो, और बाकी बचे हुए सभी नोट्स को बहुत छोटी शॉर्टहैंड में लिखो।"
यह क्यों विफल होता है: छात्र का मस्तिष्क एक समान नहीं होता।
- लेयर 1 (शुरुआत): यह कहानी को समझने के लिए महत्वपूर्ण हो सकती है। यदि आप इन नोट्स का 50% फेंक देते हैं, तो छात्र कहानी पूरी तरह भूल जाएगा।
- लेयर 20 (मध्य): यह फालतू की बातों से भरी हो सकती है। यहाँ 50% फेंकने से कोई खास नुकसान नहीं होगा।
- लेयर 28 (अंत): इसे अंतिम गणितीय समीकरण को हल करने के लिए उच्च सटीकता की आवश्यकता हो सकती है। यहाँ "छोटी शॉर्टहैंड" में लिखने से गणना में त्रुटियां हो सकती हैं।
हर लेयर के साथ एक जैसा व्यवहार करना वैसा ही है जैसे आपने पूरे साल के लिए "औसत" पहनावे का निर्णय लिया हो और गर्मियों में विंटर कोट और सर्दियों में टी-शर्ट पहन रहे हों।
नया समाधान: MoE-nD (एक "स्मार्ट वार्डरोब")
लेखक MoE-nD का प्रस्ताव देते हैं, जिसका अर्थ है Mixture-of-Experts for n-Dimensional routing।
इसे छात्र के बैकपैक के लिए एक स्मार्ट वार्डरोब मैनेजर के रूप में सोचें। हर किसी के लिए एक ही नियम होने के बजाय, मैनेजर मस्तिष्क के हर एक लेयर को व्यक्तिगत रूप से देखता है और पूछता है: "इस विशिष्ट मस्तिष्क भाग को अभी किस चीज़ की आवश्यकता है?"
इसके पास प्रत्येक लेयर के लिए चुनने के लिए तीन "विशेषज्ञ" (विकल्प) हैं:
- कचरे का डिब्बा (Eviction): हम इस लेयर की कितनी मेमोरी डिलीट कर सकते हैं?
- शॉर्टहैंड पेन (K-Quantization): हम "Key" नोट्स को कितना छोटा लिख सकते हैं?
- शॉर्टहैंड पेन (V-Quantization): हम "Value" नोट्स को कितना छोटा लिख सकते हैं?
यह कैसे काम करता है:
- मैप (ऑफलाइन कैलिब्रेशन): छात्र की परीक्षा शुरू होने से पहले, सिस्टम एक त्वरित, सस्ता टेस्ट चलाता है ताकि यह देखा जा सके कि प्रत्येक लेयर कितनी संवेदनशील है। यह एक मैप बनाता है: "लेयर 5 को डिलीट होना पसंद नहीं है। लेयर 10 को शॉर्टहैंड में लिखना पसंद नहीं है। लेयर 20 को दोनों में से किसी की भी परवाह नहीं है।"
- बजट (ग्लोबल लिमिट): छात्र के पास एक सख्त बैकपैक आकार सीमा है (जैसे, 136 MB)।
- ग्रीडी सॉल्वर (Greedy Solver): एक स्मार्ट एल्गोरिदम मैप और बजट को देखता है। यह "बेस्ट वैल्यू" के खेल को खेलता है।
- यह कहता है: "ठीक है, लेयर 5 बहुत संवेदनशील है, इसलिए इसे फुल साइज में रखते हैं। लेकिन ले्यो 10 छोटी शॉर्टहैंड के लिए ठीक है, तो इसे सिकोड़ देते हैं। लेयर 20 अपने नोट्स आधा खो सकता है बिना रोए।"
- परिणाम: बैकपैक को उसके मूल आकार के 1/14वें हिस्से तक संकुचित कर दिया जाता है, लेकिन छात्र का प्रदर्शन बिल्कुल वैसा ही होता है जैसा कि उनके पास पूर्ण, बिना संकुचित बैकपैक होता।
मुख्य खोज: "कचरे का डिब्बा ही हीरो है"
पेपर ने यह देखने के लिए एक दिलचस्प प्रयोग किया कि कौन सी रणनीति सबसे अधिक मायने रखती है। उन्होंने तीन संस्करणों का परीक्षण किया:
- यूनिफॉर्म (Uniform): सबके लिए एक ही नियम। (भयानक परिणाम)।
- स्मार्ट शॉर्टहैंड (Smart Shorthand): अलग-अलग लेयर्स के लिए अलग-अलग शॉर्टहैंड आकार, लेकिन कचरा फेंकने के नियम एक ही। (अभी भी बुरा)।
- स्मार्ट ट्रैश (Smart Trash): एक ही शॉर्टहैंड आकार, लेकिन अलग-अलग लेयर्स के लिए अलग-अलग कचरा फेंकने के नियम। (यह विजेता था!)
उपमा (Analogy):
कल्पthoughtना कीजिए कि आप यात्रा के लिए पैकिंग कर रहे हैं।
- यूनिफॉर्म: आप अपने कपड़े 50% फेंक देते हैं और बाकी को सिकोड़ देते हैं। आप ठंड महसूस करते हैं और ठीक से कपड़े नहीं पहन पाते।
- स्मार्ट शॉर्टहैंड: आप अपने सभी कपड़े रखते हैं लेकिन कपड़े के फैब्रिक को सिकोड़ देते हैं। आपके पास अभी भी बहुत सारे कपड़े हैं; बैग बहुत भारी है।
- MoE-nD (स्मार्ट ट्रैश): आप महसूस करते हैं कि आपके "मोज़े" (कुछ लेयर्स) बेकार हैं और आप उनमें से 90% फेंक देते हैं, लेकिन आप अपनी "जैकेट" (महत्वपूर्ण लेयर्स) को पूरी तरह सुरक्षित रखते हैं। बैग हल्का हो जाता है, लेकिन आप फिर भी गर्म और तैयार रहते हैं।
परिणाम: लंबी कहानियों पर जादू
जब उन्होंने कठिन बेंचमार्क (जैसे 16,000 शब्दों की कहानी पढ़ना या जटिल गणित हल करना) पर इसका परीक्षण किया:
- पुराने तरीके: जब उन्होंने मेमोरी को सिकोड़ने की कोशिश की, तो मॉडल भ्रमित हो गया और विफल हो गया (सटीकता लगभग शून्य हो गई)।
- MoE-nD: इसने मेमोरी को 14 गुना सिकोड़ दिया (1.9 GB से 136 MB तक) और मॉडल का प्रदर्शन बिल्कुल वैसा ही रहा जैसा कि इसके विशाल, बिना संकुचित संस्करण का था।
यह कब काम नहीं करता?
पेपर अपनी सीमाओं के बारे में ईमानदार है। यह छोटे कार्यों (जैसे 500 शब्दों की साधारण गणित की समस्या) में मदद नहीं करता है।
- क्यों? यदि कहानी छोटी है, तो बैकपैक पहले से ही छोटा है। "स्मार्ट मैनेजर" लेयर्स को देखता है और कहता है, "हे, हमारे पास काफी जगह है! चलो सब कुछ रखते हैं।"
- इस स्थिति में, सिस्टम बस "सब कुछ रखने" पर डिफ़ॉल्ट हो जाता है, और फैंसी रूटिंग कोई मूल्य नहीं जोड़ती है। यह एक कमरे में नेविगेट करने के लिए GPS का उपयोग करने जैसा है जिसे आप स्पष्ट रूप से देख सकते हैं; आपको जटिल दिशाओं की आवश्यकता नहीं है।
सारांश
MoE-nD एक ऐसी तकनीक है जो AI के मस्तिष्क को मिट्टी के एक एकल ब्लॉक की तरह मानना बंद करती है। इसके बजाय, यह प्रत्येक लेयर को एक अद्वितीय व्यक्ति के रूप में मानती है, कुछ लेयर्स को "डिलीट" बटन देती है, कुछ को "सिकोड़ने" का बटन, और कुछ को "सुरक्षित रखने" का बटन देती है। हर सिंगल लेयर के लिए कंप्रेशन को कस्टमाइज़ करके, यह AI को सुपरकंप्यूटर की मेमोरी की आवश्यकता के बिना लंबी कहानियाँ याद रखने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।