Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking
यह शोध पत्र Qwen3.6-35B-A3B Mixture-of-Experts मॉडल का एक व्यवस्थित संवेदनशीलता विश्लेषण प्रस्तुत करता है, जो यह प्रकट करता है कि लेयर संवेदनशीलता गहराई पर अत्यधिक निर्भर है और यह प्रदर्शित करता है कि अंतिम परतों में कम-परिमाण वाले विशेषज्ञों की आक्रामक मास्किंग (masking), आउटपुट गुणवत्ता को बनाए रखते हुए कुशल मॉडल संपीड़न सक्षम करने में समान मास्किंग की तुलना में काफी बेहतर प्रदर्शन करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोट मस्तिष्क है जिसे पहेलियाँ सुलझाने, कोड लिखने और भाषाओं का अनुवाद करने के लिए बनाया गया है। यह मस्तिष्क धातु के एक विशाल, भारी ब्लॉक से नहीं बना है; बल्कि इसे सैकड़ों विशिष्ट वर्कस्टेशन वाले एक विशाल कारखाने की तरह बनाया गया है। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है, जो चैटबॉट्स से लेकर कोडिंग सहायकों तक सब कुछ चलाने वाले AI इंजन हैं। इन मस्तिष्कों को तेज़ और कुशल बनाने के लिए, इंजीनियर 'मिक्सचर-ऑफ़-एक्सपर्ट्स' (MoE) नामक एक ट्रिक का उपयोग करते हैं। इसे कारखाने के हर कमरे में 256 अलग-अलग "विशेषज्ञों" (experts) की एक विशाल टीम के रूप में सोचें। जब कोई सवाल आता है, तो एक स्मार्ट मैनेजर (जिसे "रूटर" कहा जाता है) तय करता है कि उस विशिष्ट समस्या को हल करने के लिए किन कुछ विशेषज्ञों की आवश्यकता है, जबकि टीम के बाकी सदस्य कॉफी ब्रेक पर चले जाते हैं। यह रोबler को तेज़ रखता है क्योंकि यह केवल उन्हीं श्रमिकों को जगाता है जिनकी उसे वास्तव में आवश्यकता होती है।
लेकिन यहाँ एक बड़ा सवाल है: क्या वे सभी कार्यकर्ता समान रूप से महत्वपूर्ण हैं? यदि आपको जगह और बिजली बचाने के लिए कारखाने को सिकोड़ना पड़ा, तो क्या आप हर कमरे में बेतरतीब ढंग से 30% श्रमिकों को बस नौकरी से निकाल सकते हैं? या क्या इसमें कोई गुप्त पैटर्न है? वैज्ञानिक अनुमान लगा रहे थे, लेकिन उनके पास कोई स्पष्ट मानचित्र नहीं था कि मस्तिष्क के कौन से हिस्से नाजुक हैं और कौन से मजबूत। इसे समझना इसलिए महत्वपूर्ण है क्योंकि ये मॉडल विशाल होते जा रहे हैं, और यदि हम अनावश्यक हिस्सों को सुरक्षित रूप से "प्रून" (हटा) सकें, तो हम उनकी बुद्धिमत्ता खोए बिना उन्हें सस्ते कंप्यूटरों पर तेज़ी से चला सकते हैं, जिससे ऊर्जा और धन की बचत होगी।
द ग्रेट फैक्ट्री ऑडिट: हम किसे जाने दे सकते हैं?
इस शोध पत्र में, पर्सिस्टेंट सिस्टम्स (Persistent Systems) की एक टीम ने Qwen3.6-35B-A3B नामक एक विशिष्ट, विशाल AI मॉडल पर "कट द कॉर्ड" (तार काटने) का एक उच्च-दांव वाला खेल खेलने का निर्णय लिया। यह मॉडल एक दैत्य है: इसमें 40 परतें (layers) हैं (इन्हें एक गगनचुंबी कारखाने की 40 मंजिलों के रूप में सोचें), और प्रत्येक मंजिल पर, 256 विशेषज्ञ हैं। हर बार जब मॉडल एक शब्द को प्रोसेस करता है, तो वह काम करने के लिए शीर्ष 8 विशेषज्ञों को चुनता है।
शोधकर्ता यह पता लगाना चाहते थे कि: यदि हम कुछ परतों में "कमजोर" विशेषज्ञों (वे जिनके मस्तिष्क में संख्याएँ सबसे छोटी हैं) को अनदेखा करने के लिए मजबूर करते हैं, तो क्या मॉडल क्रैश हो जाएगा, या यह काम करना जारी रखेगा? उन्होंने एक कठिन कार्य पर इसका परीक्षण किया: एक प्रोग्रामिंग भाषा से दूसरी प्रोग्रामिंग भाषा में कोड का अनुवाद करना (जैसे C++ को Python में बदलना), जिसके लिए XLCoST नामक बेंचमार्क का उपयोग किया गया।
खोज: यह इस पर निर्भर है कि आप कहाँ काटते हैं
टीम ने विशेषज्ञों को अलग-अलग पैटर्न में काटने की कोशिश की, जैसे कि एक सर्जन विभिन्न चीरा लगाने वाली जगहों का परीक्षण करता है। उनके पास तीन मुख्य सिद्धांत थे:
- "फ्लैट कट" थ्योरी (The "Flat Cut" Theory): हर मंजिल पर, हर जगह से 30% कमजोर विशेषज्ञों को काट दें।
- "अर्ली कट" थ्योरी (The "Early Cut" Theory): शायद निचली मंजिलें सबसे महत्वपूर्ण हैं?
- "लेट कट" थ्योरी (The "Late Cut" Theory): शायद ऊपरी मंजिलें केवल वही दोहरा रही हैं जो निचली मंजिलें पहले ही कर चुकी हैं?
परिणाम "फ्लैट कट" विचार के लिए एक पूर्ण झटका थे।
जब उन्होंने फ्लैट कट (सभी 40 मंजिलों से 30% विशेषज्ञों को हटाना) आज़माया, तो मॉडल बुनियादी रूप से अपना काम करना भूल गया। 300 कोडिंग पहेलियों में से, इसने केवल 150 को सही (या "अच्छा/समान") किया। यह मतिभ्रम (hallucinating) करने लगा, अपनी आंतरिक सोच की प्रक्रिया को अंतिम कोड में लीक करने लगा, और सिंटैक्स त्रुटियां करने लगा। यह नींव, मध्य कार्यालयों और शीर्ष मंजिल में एक साथ 30% स्टाफ को निकालने जैसा था—पूरी इमारत डगमगाने लगी।
लेकिन फिर, उन्हें "मैजिक ज़ोन" मिला।
शोधकर्ताओं ने पाया कि मॉडल की संवेदनशीलता इस बात पर नाटकीय रूप से बदल जाती है कि आप किस मंजिल पर हैं:
- मंजिल 0–9 (नींव): ये अत्यंत नाजुक हैं। यदि आप यहाँ विशेषज्ञों को काटते हैं, तो मॉडल तुरंत टूट जाता है।
- मंजिल 10–29 (मध्य): यह भी बहुत नाजुक है।
- मंजिल 30–39 (पेंटहाउस): ये ऊपरी मंजिलें आश्चर्यजनक रूप से मजबूत हैं! यहाँ के विशेषज्ञ काफी हद तक ओवरलैपिंग (एक जैसा) काम कर रहे हैं। "रूटर" (मैनेजर) यहाँ पहले से ही भ्रमित है, जो कम आत्मविश्वास वाले विशेषज्ञों को चुन रहा है, जिसका अर्थ है कि विशेषज्ञ कुछ हद तक एक-दूसरे के स्थान पर लेने योग्य (interchangeable) हैं।
जीतने वाली रणनीति: "टॉप-डाउन" ट्रिम (The "Top-Down" Trim)
टीम ने एक परफेक्ट ट्रिमिंग शेड्यूल खोजने के लिए 300 प्रॉम्प्ट्स के साथ एक बड़ा प्रयोग चलाया। उन्होंने पाया कि यदि आप अपने कट केवल ऊपरी मंजिलों पर केंद्रित करते हैं, तो मॉडल स्वस्थ रहता है।
- "लेट रैंप" रणनीति (The "Late Ramp" Strategy): उन्होंने मंजिलों 30–34 पर 35% विशेषज्ञों को काटा, और बिल्कुल ऊपरी मंजिलों (35–39) पर 55% को।
- परिणाम: 300 प्रॉम्प्ट्स में से, इस रणनीति ने 255 आउटपुट को सही ढंग से काम करने में मदद की! यह फ्लैट कट से कहीं बेहतर है, और इसने 1,100 से अधिक विशेषज्ञों को हटा दिया।
लेकिन रुकिए, वे वहीं नहीं रुके। वे सुनिश्चित करना चाहते थे कि यह केवल एक भाग्यशाली संयोग नहीं है, इसलिए उन्होंने अपने सबसे अच्छे विचारों का परीक्षण एक नए, अनदेखे 500 प्रॉम्प्ट्स के सेट पर किया। यहीं पर कहानी और भी दिलचस्प हो गई।
बड़े परीक्षण पर, "लेट रैंप" अभी भी अच्छा था, लेकिन एक संकीर्ण रणनीति ने पुरस्कार जीता:
- "वेरी-लेट ओनली" रणनीति (The "Very-Late Only" Strategy): उन्होंने केवल ऊपरी 5 मंजिलों (35–39) को छुआ और वहां 50% विशेषज्ञों को काटा।
- परिणाम: इस छोटी, सर्जिकल स्ट्राइक ने 500 में से 419 आउटपुट को पूरी तरह से काम करने में मदद की! इससे भी बेहतर, इसने कुल मिलाकर केवल 640 विशेषज्ञों को हटाया (पूरे मॉडल के 10,240 विशेषज्ञों में से)।
इसका मतलब है कि शोधकर्ताओं ने पाया कि वे मॉडल की "मांसपेशियों" के एक बड़े हिस्से को बिल्कुल ऊपर से हटा सकते हैं, और मॉडल को इसकी रत्ती भर भी परवाह नहीं हुई। यह ऐसा है जैसे यह महसूस करना कि एक गगनचुंबी इमारत की ऊपरी 5 मंजिलें ज्यादातर सजावटी बालकनियाँ हैं; आप रेलिंग का आधा हिस्सा हटा सकते हैं, और इमारत उतनी ही ऊँची खड़ी रहेगी।
एक साइड क्वेस्ट: "सोचने" बनाम "जवाब देने" का रहस्य
टीम ने यह भी देखने की कोशिश की कि क्या मॉडल "सोचते" समय (समस्या के माध्यम से तर्क करना) बनाम "जवाब देते" समय (अंतिम कोड लिखना) अलग-अलग विशेषज्ञों का उपयोग करता है। उन्होंने यह देखने के लिए मॉडल के थोड़े पुराने संस्करण (Qwen3.5) को देखा कि क्या वे अंतर देख सकते हैं।
उन्होंने पाया कि "सोचने" के चरण के दौरान, मॉडल विशेषज्ञों की एक विस्तृत, अव्यवस्थित भीड़ का उपयोग करता है। लेकिन जब "जवाब देने" का समय आता है, तो यह अधिक केंद्रित हो जाता है और कम विशेषज्ञों का उपयोग करता है। यह सुझाव देता है कि यदि हम भविष्य में मॉडल को प्रून करना चाहते हैं, तो हमें "सोचने" वाले विशेषज्ञों को काटने में सावधान रहना होगा, भले ही वे कागज पर कमजोर दिखें। हालांकि, लेखक सावधानी बरतते हुए कहते हैं कि यह भविष्य के लिए केवल एक संकेत है, अभी तक कोई सिद्ध नियम नहीं है।
गति के बारे में क्या?
उन्होंने एक अलग ट्रिक भी आजमाई: विशेषज्ञों को काटने के बजाय, उन्होंने मॉडल को हर शब्द के लिए सामान्य 8 के बजाय केवल 6 विशेषज्ञों को चुनने के लिए कहा। 100 प्रॉम्प्ट्स के एक छोटे परीक्षण पर, इसने मॉडल को बिना किसी गुणवत्ता को खोए बहुत तेज़ी से चलने में मदद की (कम "वॉल-क्लॉक टाइम")। लेकिन, जब उन्होंने इस स्पीड-अप को आक्रामक विशेषज्ञ कटिंग के साथ जोड़ने की कोशिश की, तो मॉडल भ्रमित हो गया। ऐसा लगता है कि आप इन शॉर्टकट्स को सावधानीपूर्वक परीक्षण किए बिना एक दूसरे के ऊपर नहीं रख सकते।
निचोड़ (The Bottom Line)
इस शोध पत्र का मुख्य निष्कर्ष एक स्पष्ट "ऐसा न करें" (यूनिफॉर्म प्रूनिंग के लिए) और एक "यह करें" (स्मार्ट प्रूनिंग के लिए) है।
- मत करें: हर लेयर से समान रूप से 30% विशेषज्ञों को बस काट दें; यह मॉडल की सोचने की क्षमता को नष्ट कर देता है।
- करें: अपना ध्यान बहुत ऊपरी परतों (मंजिल 35–39) पर केंद्रित करें। मॉडल अपने आधे विशेषज्ञों को खोने के बावजूद आश्चर्यजनक रूप से सहनशील है।
लेखक सावधानी से नोट करते हैं कि उन्होंने अभी तक कंप्यूटर की मेमोरी से वजन (weights) को वास्तव में हटाया नहीं है (उन्होंने बस रूटर को उन्हें अनदेखा करने के लिए कहा है)। इसलिए, जबकि मॉडल काम छोटा और अधिक कुशल दिखता है, यह हार्ड ड्राइव पर अभी भी उतनी ही जगह लेता है। अगला कदम, जिसे वे भविष्य के कार्य के लिए सुझाते हैं, उन अप्रयुक्त विशेषज्ञों को स्थायी रूप से हटाने के लिए वास्तविक "फिजिकल वेट सर्जरी" करना है ताकि वास्तविक स्टोरेज स्पेस बचाया जा सके।
संक्षेप में, शोधकर्ताओं ने पाया है कि इस AI मॉडल के "मस्तिष्क" में एक बहुत ही विशिष्ट कमजोर बिंदु है: ऊपरी मंजिलें निचली मंजिलों की तुलना में बहुत अधिक रेडंडेंट (redundant) हैं। ऊपर से ट्रिम करके, हम बिना मॉडल को तोड़े छोटे, तेज़ और सस्ते AI मॉडल बना सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।