Multi-Granular Node Pruning for Causal Circuit Discovery
यह शोध पत्र एक स्केलेबल, मल्टी-ग्रैनुलर नोड प्रूनिंग फ्रेमवर्क प्रस्तावित करता है जो मौजूदा एज-प्रूनिंग विधियों की तुलना में मेमोरी आवश्यकताओं को काफी कम करते हुए, प्रासंगिक व्यक्तिगत न्यूरॉन्स की पहचान करके बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में छोटे और अधिक सटीक कॉज़ल सर्किट्स खोजने के लिए सीखने योग्य मास्क (लर्नएबल मास्क) और स्पर्सिटी पेनल्टीज़ का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक लार्ज लैंग्वेज मॉडल (जैसे कि वे जो कहानियाँ लिखते हैं या सवालों के जवाब देते हैं) की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें। इस शहर में लाखों इमारतें (न्यूरॉन्स), सड़कें (कनेक्शन) और जिले (लेयर्स) हैं। जब मॉडल एक विशिष्ट कार्य करता है—जैसे कि यह पता लगाना कि कहानी में "क्रिस्टी" ने आम किसे दिया था—तो वह पूरे शहर का उपयोग नहीं करता है। वह केवल एक बहुत ही छोटा, विशिष्ट मोहल्ला इस्तेमाल करता है।
इस विशिष्ट मोहल्ले को खोजना सर्किट डिस्कवरी (Circuit Discovery) कहलाता है। इसका लक्ष्य यह मानचित्र बनाना है कि शहर के कौन से हिस्से वास्तव में काम कर रहे हैं और कौन से हिस्से बस वहां बिना कुछ किए खड़े हैं।
पुराने मानचित्रों के साथ समस्या
पहले, शोधकर्ता इन मोहल्लों को खोजने के लिए इमारतों के बीच के रास्तों (कनेक्टिवन्स) को देखते थे। वे यह देखने के लिए सड़कें बंद करने की कोशिश करते थे कि क्या शहर अभी भी काम कर रहा है।
- दोष: यह एक शहर में किसी विशिष्ट घर को खोजने के लिए हर एक सड़क को ब्लॉक करने जैसा है। इसमें बहुत समय लगता है, इसके लिए भारी मात्रा में मेमोरी की आवश्यकता होती है (जैसे दुनिया की हर एक सड़क का नक्शा रखने की जरूरत हो), और यह बहुत ही मोटा-ताजा तरीका है। यदि आप एक सड़क को ब्लॉक करते हैं, तो आप अनजाने में घरों का एक पूरा ब्लॉक ही काट सकते हैं, भले ही उस ब्लॉक का केवल एक विशिष्ट घर ही आवश्यक रहा हो।
- परिणाम: पुराने मानचित्र "कोर्स" (coarse) थे। वे आपको बता सकते थे कि एक पूरा जिला (जैसे कि एक "अटेंशन हेड") महत्वपूर्ण था, लेकिन वे यह नहीं बता सकते थे कि उस जिले के भीतर एक विशिष्ट इमारत का केवल एक विशेष कमरा ही वास्तव में काम कर रहा था।
नया समाधान: मल्टी-ग्रैनुलर नोड प्रूनिंग (Multi-Granular Node Pruning)
इस शोध के लेखकों ने शहर का मानचित्र बनाने का एक स्मार्ट तरीका प्रस्तावित किया है। सड़कों को देखने के बजाय, वे सीधे इमारतों (नोड्स) को देखते हैं, और वे इसे एक साथ विभिन्न स्तरों के विवरण पर करते हैं।
इसे रूसी नेस्टिंग डॉल्स (Russian nesting dolls) या एक ज़ूम लेंस की तरह समझें:
- बड़ी तस्वीर: वे पूरे जिलों (ट्रांसफॉर्मर ब्लॉक्स) को बंद कर सकते हैं।
- मोहल्ला: वे एक जिले के भीतर विशिष्ट सड़कों (अटेंशन हेड्स) को बंद कर सकते हैं।
- घर: वे एक घर के भीतर विशिष्ट कमरों (व्यक्तिगत न्यूरॉन्स) को बंद कर सकते हैं।
वे प्रत्येक इमारत के लिए एक विशेष "लर्नेबल मास्क" (एक डिजिटल स्विच) का उपयोग करते हैं, सबसे बड़े जिले से लेकर सबसे छोटे कमरे तक। वे एक सिमुलेशन चलाते हैं जहाँ वे शहर के एक "साफ" संस्करण को एक "भ्रष्ट" संस्करण (जहाँ कहानी का कोई अर्थ नहीं निकलता) के साथ मिलाते हैं। यह देखकर कि कहानी को सही रखने के लिए कौन सी इमारतें चालू रहना अनिवार्य हैं, वे सटीक रूप से पता लगा लेते हैं कि क्या आवश्यक है।
उन्होंने क्या पाया (परिणाम)
जब उन्होंने विभिन्न "शहरों" (GPT-2 और Llama जैसे मॉडल्स) पर इसका परीक्षण किया, तो उन्हें कुछ आश्चर्यजनक बातें पता चलीं:
- भारी बचत: उनके तरीके ने ऐसे सर्किट खोजे जो अन्य सभी तरीकों की तुलना में बहुत छोटे थे। सबसे खराब स्थिति में, उन्होंने पिछले तरीकों की तुलना में 33% अधिक बिल्डिंग ब्लॉक्स और 60% अधिक व्यक्तिगत कमरे हटा दिए।
- मेमोरी दक्षता: क्योंकि उन्हें हर एक सड़क के नक्शे (इंटरमीडिएट एक्टिवेशन्स) को स्टोर करने की आवश्यकता नहीं है, इसलिए उनके तरीके का उपयोग करने के लिए 3 से 11 गुना कम कंप्यूटर मेमोरी लगती है। यह एक नक्शा बनाने के लिए एक लाइब्रेरी के बजाय एक छोटी नोटबुक की आवश्यकता होने जैसा है।
- कार्य-विशिष्ट ब्लूप्रिंट: उन्होंने पाया कि अलग-अलग कार्यों के लिए शहर के लेआउट अलग होते हैं:
- इनडायरेक्ट ऑब्जेक्ट आइडेंटिफिकेशन (किसने क्या किया): यह कार्य पूरे शहर में फैले हुए "MLP" भवनों (गैर-रेखीय प्रसंस्करण कक्षों) पर बहुत अधिक निर्भर करता है, जबकि "अटेंशन" सड़कें ज्यादातर खाली रहती हैं।
- जेंडर वाले सर्वनाम (He vs. She): यह कार्य एक बहुत ही विरल (sparse), बिखरे हुए नेटवर्क का उपयोग करता है। अधिकांश शहर को बंद कर दिया गया है; केवल कुछ विशिष्ट लेयर्स और कमरे सक्रिय हैं।
- ग्रेटर देन (गणित/संख्या): यह सबसे चरम है। यह एक "स्किप" तंत्र का उपयोग करता है, जहाँ शहर मध्य लेयर्स के बड़े हिस्सों को अनदेखा करता है और गणना करने के लिए सीधे अंत तक कूद जाता है।
मुख्य निष्कर्ष (The Takeaway)
शोध पत्र का दावा है कि व्यक्तिगत "कमरों" (न्यूरॉन्स) के स्तर पर मॉडल को देखकर, हम मशीनरी के एक विशाल अनावश्यक हिस्से को हटा सकते हैं।
उन्होंने साबित किया कि इन AI मॉडल्स के कई हिस्से जिन्हें हम आवश्यक समझते थे, वास्तव में केवल बेकार भार (dead weight) हैं। उन्हें सूक्ष्म स्तर तक छाँटने (pruning) से, उन्होंने वास्तविक, न्यूनतम "सर्किट" खोज लिया, जो पहले के तरीकों की तुलना में बहुत तेज़ी से और बहुत कम कंप्यूटर शक्ति के साथ काम करता है। उन्होंने यह भी दिखाया कि यह बहुत बड़े मॉडल्स (जैसे Llama 3.1-8B) पर एक सिंगल कंप्यूटर कार्ड पर भी काम करता है, जो पहले अन्य तरीकों के लिए बहुत कठिन था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।