← नवीनतम पेपर
💬 NLP

A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स में एक विशिष्ट "मैसिव इमर्जेंस लेयर" (Massive Emergence Layer) की पहचान करता है जहाँ विशाल सक्रियताएँ (activations) उत्पन्न और प्रसारित होती हैं, जिससे प्रतिनिधित्व की विविधता कम हो जाती है, और विभिन्न कार्यों में प्रदर्शन सुधारने के लिए इस कठोरता और अटेंशन सिंक्स (attention sinks) को कम करने हेतु एक विधि प्रस्तावित करता है।

मूल लेखक: Zeru Shi, Zhenting Wang, Fan Yang, Qifan Wang, Ruixiang Tang

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeru Shi, Zhenting Wang, Fan Yang, Qifan Wang, Ruixiang Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक परत "वॉल्यूम स्पाइक" (आवाज़ का उछाल) पैदा करती है

कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक विशाल, बहु-मंजिला फैक्ट्री है। नीचे से कच्चा माल (शब्द) अंदर जाता है, हर मंजिल पर उसे प्रोसेस किया जाता है, और ऊपर से एक तैयार उत्पाद (एक उत्तर) के रूप में बाहर आता है।

शोधकर्ताओं ने इस फैक्ट्री में कुछ अजीब होते देखा। उनके द्वारा टेस्ट किए गए लगभग हर मॉडल में, एक विशिष्ट मंजिल (जिसे वे ME लेयर, या "मैसिव इमर्जेंस लेयर" कहते हैं) है जहाँ अचानक एक बहुत बड़ा उछाल आता है।

इस विशिष्ट मंजिल पर, वाक्य के बिल्कुल पहले शब्द का "सिग्नल" अन्य सभी शब्दों की तुलना में अचानक 100 गुना या 1,000 गुना अधिक तेज़ कर दिया जाता है। यह ऐसा है जैसे, एक क्वायर (सामूहिक गायन) में, यदि पहला सुर लगाने वाला व्यक्ति अचानक इतनी ज़ोर से चिल्लाने लगे कि बाकी सब दब जाएँ, और फिर वह चिल्लाती हुई आवाज़ पूरी इमारत में ऊपर तक उतनी ही तेज़ बनी रहे।

यह कैसे होता है: "मेगाफोन" और "एम्प्लीफायर"

पेपर इस बात की गहराई से जांच करता है कि उस एक विशिष्ट मंजिल पर ऐसा क्यों होता है। उन्होंने पाया कि यह मशीन के दो हिस्सों की एक टीम वर्क है:

  1. मेगाफोन (RMSNorm): मुख्य प्रोसेसर तक सिग्नल पहुँचने से पहले, यह एक नॉर्मलाइजेशन स्टेप से गुजरता है। इस विशिष्ट मंजिल पर, पहले शब्द के लिए सेटिंग्स गलती से एक विशाल मेगाफोन की तरह ट्यून हो जाती हैं, जो अन्य शब्दों की तुलना में इसकी आवाज़ को काफी बढ़ा देती है।
  2. एम्प्लीफायर (FFN): सिग्नल फिर "फीड-फॉरवर्ड नेटवर्क" (मुख्य सोचने वाला हिस्सा) से टकराता है। यहाँ, मशीन के आंतरिक वेट्स (weights) एक सुपर-एम्प्लीफायर की तरह काम करते हैं जो विशेष रूप से उस पहले से ही तेज़ पहले शब्द को निशाना बनाते हैं, जिससे वह और भी तेज़ हो जाता है।

एक बार जब यह "मैसिव एक्टिवेशन" (विशाल सक्रियण) बन जाता है, तो यह कम नहीं होता। क्योंकि फैक्ट्री "रेसिडुअल कनेक्शंस" (सोचिए वे एक्सप्रेस एलिवेटर की तरह हैं जो प्रोसेसिंग स्टेप्स को छोड़ देते हैं) का उपयोग करती है, यह सुपर-तेज़ सिग्नल बस एलिवेटर की सवारी करता हुआ ऊपर तक पहुँच जाता है, और ऊपर तक बिना बदले तेज़ बना रहता है।

समस्या: एक कठोर, अपरिवर्तनीय आवाज़

यहाँ एक समस्या पैदा होती है: क्योंकि यह पहला शब्द इतना तेज़ है और इसकी दिशा इतनी निश्चित है, यह फैक्ट्री के निर्णय लेने की प्रक्रिया पर हावी होने लगता है।

कल्पना कीजिए कि लोगों का एक समूह यात्रा की योजना बनाने की कोशिश कर रहा है। यदि उनमें से एक व्यक्ति इतनी ज़ोर से चिल्ला रहा है कि बाकी सब की आवाज़ सुनाई नहीं दे रही, तो समूह नए विचारों को सुनना बंद कर देता है। वे बस चिल्लाने वाले व्यक्ति का अनुसरण करते हैं।

AI में, यह "चिल्लाता हुआ" पहला शब्द एक कठोर दिशा बनाता है। यह AI को कम लचीला बनाता है। जब AI वाक्य के विभिन्न हिस्सों पर ध्यान देने की कोशिश करता है (जैसे कि एक इंसान संकेतों को देखता है), तो यह तेज़, अपरिवर्तनीय सिग्नल AI को हर बार चीजों को एक ही तरह से देखने के लिए मजबूर करता है, चाहे संदर्भ (context) कुछ भी हो। इससे AI की बारीकियों को समझने और नए संदर्भों के अनुसार ढलने की क्षमता कम हो जाती है।

समाधान: "म्यूट बटन" (WeMask)

शोधकर्ताओं ने WeMask नामक एक सरल समाधान प्रस्तावित किया है।

पूरी फैक्ट्री को फिर से बनाने के बजाय, उन्होंने उन विशिष्ट "चैनलों" (डायमेंशन) को धीरे से म्यूट करने का तरीका खोजा जो पहले शब्द को इतना ज़ोर से चिल्लाने के लिए जिम्मेदार हैं।

  • यह कैसे काम करता है: वे उन सेटिंग्स को देखते हैं जो पहले शब्द को तेज़ बनाती हैं (वेट्स) और उन विशिष्ट चैनलों पर आवाज़ को चुनिikanly कम कर देते हैं ठीक पहले जब AI अन्य शब्दों पर ध्यान देने की कोशिश करता है।
  • उपमा: यह एक कमरे में सबसे तेज़ स्पीकर पर रणनीतिक रूप से टेप का एक छोटा सा टुकड़ा लगाने जैसा है। स्पीकर अभी भी वहीं है, और कमरा भी काम कर रहा है, लेकिन अब अन्य आवाज़ें स्पष्ट रूप से सुनी जा सकती हैं। AI अंततः पूरी बातचीत को सुन सकता है, न कि केवल पहले शब्द को।

परिणाम: बेहतर सोच और कम "अटेंशन सिंक्स"

जब उन्होंने इस "म्यूट बटन" का उपयोग किया, तो AI ने उनके द्वारा टेस्ट की गई हर चीज़ में बेहतर प्रदर्शन किया:

  • निर्देशों का पालन करना: इसने जटिल प्रॉम्प्ट्स को अधिक सटीकता से फॉलो किया।
  • गणितीय तर्क (Math Reasoning): इसने गणित की समस्याओं को बेहतर ढंग से हल किया।
  • सुरक्षा: यह हानिरहित सवालों को मना करने (जिसे "ओवर-रिफ्यूज़ल" कहा जाता है) की संभावना में कम हो गया।

पेपर इस बात को "अटेंशन सिंक्स" नामक घटना से भी जोड़ता है। पहले वैज्ञानिकों ने देखा था कि AI मॉडल अक्सर पहले टोकन (वाक्य की शुरुआत) पर जुनूनी रूप से ध्यान केंद्रित करते हैं और बाकी को अनदेखा कर देते हैं। यह पेपर बताता है कि ऐसा क्यों होता है: पहला टोकन एक "मैसिव एक्टिवेशन" बन जाता है जो भौतिक रूप से दूसरों को दबा देता है।

अपने तरीके का उपयोग करके, उन्होंने पहले शब्द पर ध्यान को पूरी तरह खत्म नहीं किया (क्योंकि यह बुरा होता, क्योंकि पहले शब्द को सुना जाना ज़रूरी है), बल्कि उन्होंने इसके प्रभुत्व को कम (soften) किया। इसने AI को वाक्य की शुरुआत को सुनने और कहानी के बाकी हिस्सों को सुनने के बीच संतुलन बनाने की अनुमति दी, जिससे अधिक स्मार्ट और लचीला व्यवहार प्राप्त हुआ।

सारांश

  • खोज: AI मॉडल्स में एक विशिष्ट लेयर वाक्य के पहले शब्द के लिए एक "सुपर-तेज़" सिग्नल बनाती है जो अंत तक बना रहता है।
  • कारण: उस विशिष्ट लेयर पर नॉर्मलाइजेशन और प्रोसेसिंग वेट्स का संयोजन।
  • समस्या: यह तेज़ सिग्नल AI को कठोर बनाता है और इसे नए संदर्भों के अनुकूल होने में कम सक्षम बनाता है।
  • समाधान: उस सिग्नल के सबसे तेज़ हिस्सों को चुनि באופן से म्यूट करने का एक सरल तरीका, जो संतुलन बहाल करता है और प्रदर्शन में सुधार करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →