← नवीनतम पेपर
🤖 machine learning

Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers

यह शोध पत्र "सुपरनोड्स" (supernodes) की पहचान करता है—जो कि ट्रांसफॉर्मर फीड-फॉरवर्ड नेटवर्क के भीतर नुकसान-महत्वपूर्ण (loss-critical) चैनलों का एक छोटा, अत्यधिक केंद्रित सेट है—और यह प्रदर्शित करता है कि स्ट्रक्चर्ड प्रूनिंग के दौरान इन चैनलों की सुरक्षा करना पारंपरिक तरीकों की तुलना में मॉडल के प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Audrey Cherilyn, Houman Safaai

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Audrey Cherilyn, Houman Safaai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विशाल, हलचल भरे शहर (लार्ज लैंग्वेज मॉडल) की कल्पना करें जहाँ लाखों नन्हे कर्मचारी (पैरामीटर्स) शहर को सुचारू रूप से चलाने के लिए लगातार काम कर रहे हैं, बातें कर रहे हैं और कार्य निष्पादित कर रहे हैं।

इनमें से अधिकांश कर्मचारी औसत नागरिकों की तरह हैं: वे अपना काम करते हैं, लेकिन यदि एक या दो छुट्टी पर चले जाएं, तो शहर को शायद ही कोई फर्क पड़ता है। हालाँकि, इस शोध पत्र ने खोजा है कि शहर के "कारखानों" (फीड-फॉरवर्ड नेटवर्क) के भीतर एक बहुत ही अजीब और विशिष्ट सामाजिक संरचना मौजूद है।

यहाँ रोजमर्रा की उपमाओं का उपयोग करके उनकी खोज का विवरण दिया गया है:

1. "सुपरनोड्स": कारखाने के वीआईपी (VIPs)

शोधकर्ताओं ने पाया कि प्रत्येक कारखाने में, "सुपरनोड्स" का एक छोटा सा समूह होता है। यदि किसी कारखाने में 10,000 कर्मचारी हैं, तो उनमें से केवल लगभग 100 ही सुपरनोड्स हैं।

उपमा: एक विशाल ऑर्केस्ट्रा की कल्पना करें। अधिकांश संगीतकार मानक भाग बजा रहे हैं, लेकिन कलाकारों का एक छोटा समूह होता है—मुख्य वायलिन वादक, मुख्य सेलो वादक और स्टार पियानो वादक। यदि तालवाद्य (परकशनिस्ट) एक बीट चूक जाए, तो संगीत जारी रहता है। लेकिन यदि मुख्य वायलिन वादक बजाना बंद कर दे, तो पूरी सिम्फनी शोर में बदल जाती है।

एक LLM में, ये सुपरनोड्स "सोलिस्ट" (एकल कलाकार) हैं। वे महत्व (जिसे शोधकर्ता लॉस प्रॉक्सी कहते हैं) का एक असमान हिस्सा वहन करते हैं। यदि आप गलती से इन विशिष्ट कर्मचारियों को "निकाल" (प्रून) देते हैं, तो मॉडल की बुद्धिमत्ता केवल कम नहीं होती—बल्कि वह पूरी तरह से ध्वस्त हो जाती है।

2. "हेलो" (Halos): वीआईपी का आंतरिक घेरा

शोधकर्ताओं ने यह भी देखा कि ये सुपरनोड्स अकेले काम नहीं करते हैं। उनके चारों ओर "हेलो" होते हैं।

उपमा: एक सेलिब्रिटी के बारे में सोचें। एक सेलिब्रिटी के चारों ओर सहायकों, बॉडीगार्डों और जनसंपर्क प्रबंधकों (पब्लिसिस्ट) का एक "हेलो" होता है। ये लोग खुद सितारे नहीं होते, लेकिन वे लगातार उस सितारे को सहारा देने वाला काम कर रहे होते हैं।

मॉडल में, ये "हेलो" चैनल वे कर्मचारी हैं जो शायद सुपरस्टार न हों, लेकिन वे सुपरनोड्स के समान कार्य कर रहे हैं। क्योंकि वे बहुत अधिक रेडंडेंट (अतिरेक) हैं, इसलिए आप कभी-कभी उन्हें जाने दे सकते हैं, लेकिन आपको सावधान रहना होगा कि आप गलती से सितारे और उसके सहायक दोनों को एक साथ न निकाल दें।

3. समस्या: "भद्दा प्रूनर" (The Clumsy Pruner)

जब इंजीनियर AI को छोटा और तेज़ बनाने की कोशिश करते हैं (एक प्रक्रिया जिसे प्रूनिंग कहा जाता है), तो वे आमतौर पर "कम महत्वपूर्ण" कर्मचारियों को बाहर निकालने की कोशिश करते हैं ताकि जगह बचाई जा सके।

उपमा: कल्पना कीजिए कि आप पैसा बचाने के लिए एक कंपनी के आकार को कम करने की कोशिश कर रहे हैं। एक "भद्दा प्रूनर" कुल पेरोल को देखता है और कहता है, "आइए हम उन 50% लोगों को काट देते हैं जो कम कागजी कार्रवाई कर रहे हैं।"

समस्या यह है कि भंडे प्रूनर को यह एहसास नहीं होता कि उन "कम-कागजी कार्रवाई" करने वाले लोगों के बीच, उसने अभी-अभी सीईओ और लीड इंजीनियर को निकाल दिया है। कंपनी (AI) तुरंत दिवालिया हो जाती है। यही कारण है कि प्रूनिंग के वर्तमान तरीके अक्सर मॉडल को "मूर्ख" या निरर्थक बना देते हैं।

4. समाधान: SCAR (स्मार्ट मैनेजर)

शोधकर्ताओं ने SCAR नामक एक नई विधि बनाई है।

उपमा: SCAR एक अत्यधिक परिष्कृत एचआर (HR) मैनेजर की तरह है। किसी को भी निकालने से पहले, SCAR "वीआईपी सूची" (सुपरनोड्स) की जाँच करता है। वह कहता है, "मुझे परवाह नहीं कि हम कितने पैसे बचाते हैं; मुख्य वायलिन वादक यहीं रहेगा। बस।"

एक बार जब वीआईपी सुरक्षित हो जाते हैं, तो SCAR यह तय करने के लिए "हेलो" और नियमित कर्मचारियों को देखता है कि सिम्फनी को तोड़े बिना किसे छोड़ा जा सकता है।

बड़ी तस्वीर (The Big Picture)

इन "सुपरनोड्स" की पहचान करके, शोधकर्ताओं ने एक तरीका खोजा है जिससे वे AI मॉडल की "बुद्धि" खोए बिना उन्हें बहुत छोटा और अधिक कुशल बना सकते हैं। उन्होंने सिद्ध किया कि AI की बुद्धिमत्ता टोस्ट पर मक्खन की तरह समान रूप से नहीं फैली होती है; यह एक खदान में हीरे की तरह केंद्रित होती है। यदि आप जानते हैं कि हीरे कहाँ हैं, तो आप बाकी पत्थर को हटा सकते हैं और फिर भी एक अत्यंत मूल्यवान चीज़ आपके पास रहेगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →