← नवीनतम पेपर
💬 NLP

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

यह शोध पत्र हाइब्रिड लीनियर अटेंशन लार्ज लैंग्वेज मॉडल्स में मैसिव एक्टिवेशंस (massive activations) का पहला व्यवस्थित अध्ययन प्रस्तुत करता है, जो दो विशिष्ट, आर्किटेक्चर-संरेखित रूपाकारों—प्री-अटेंशन स्पाइक्स (pre-attention spikes) और इंटर-स्पाइक प्लेटो (inter-spike plateaus)—को प्रकट करता है—जो प्रशिक्षण के शुरुआती चरणों में उभरते हैं, विविध स्केल्स और डोमेन में बने रहते हैं, और सक्रियण रद्दीकरण (activation cancellation) के एक साझा जीवनचक्र द्वारा यांत्रिक रूप से स्पष्ट किए जाते हैं।

मूल लेखक: Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, Zhongzhu Zhou, Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo

प्रकाशित 2026-08-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, Zhongzhu Zhou, Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट बनाने की कोशिश कर रहे हैं जो एक पूरी लाइब्रेरी पढ़ सके और सब कुछ याद रख सके। ऐसा करने के लिए, इंजीनियर एक विशेष प्रकार के मस्तिष्क सर्किट का उपयोग करते हैं जिसे "ट्रांसफॉर्मर" (Transformer) कहा जाता है। ये सर्किट अद्भुत हैं क्योंकि वे एक वाक्य के हर शब्द को एक साथ देख सकते हैं और समझ सकते हैं कि वे आपस में कैसे जुड़े हैं। हालाँकि, इसमें एक पेंच है: जैसे-जैसे कहानी लंबी होती जाती है, यह मस्तिष्क सर्किट अविश्वसनीय रूप से धीमा और मेमोरी का भूखा हो जाता है, जैसे कि एक हज़ार गेंदों को उछालते हुए (juggling) किताब पढ़ने की कोशिश करना। इसे ठीक करने के लिए, वैज्ञानिकों ने "हाइब्रिड लीनियर अटेंशन" (Hybrid Linear Attention) मॉडल का आविष्कार किया। इन दोनों प्रकार के श्रमिकों की एक टीम के रूप में इसे सोचें: कुछ "सुपर-स्कैनर" (Super-Scanners) हैं जो पूरी किताब को एक साथ देख सकते हैं (लेकिन वे जल्दी थक जाते हैं), और अन्य "फास्ट-रीडर्स" (Fast-Readers) हैं जो तेज़ी से पढ़ते हैं लेकिन एक बार में कहानी का केवल एक छोटा सा हिस्सा ही अपने दिमाग में रख सकते हैं। इन दोनों प्रकार के श्रमिकों को मिलाकर, रोबोट तेज़ और स्मार्ट बना रहता है। हालाँकि, रहस्य यह है कि जब आप उन्हें मिलाते हैं, तो रोबोट की आंतरिक "विचार प्रक्रिया" वास्तव में कैसे काम करती है? क्या मिश्रण से अजीब गड़बड़ियाँ पैदा होती हैं, या यह एक नए प्रकार की लय (rhythm) बनाता है?

यही वह रहस्य है जिसकी जांच करने के लिए शोधकर्ताओं की एक टीम ने ठान ली थी। उन्होंने इन हाइब्रिड रोबोट दिमागों के अंदर झाँका ताकि देख सकें कि वे "मैसिव एक्टिवेशन" (Massive Activations) को कैसे संभालते हैं—जो कि बिजली की ऊर्जा के विशाल, अचानक आने वाले उछाल हैं जो रोबोट के मन में होते हैं। पुराने रोबोट दिमागों में, ये उछाल स्थिर और अनुमानित तरीके से होने के लिए जाने जाते थे। लेकिन शोधकर्ता चाहते थे कि यह जानें कि जब वे "फास्ट-रीडर्स" को शामिल करना शुरू करते हैं, तो क्या होता है? उन्होंने पाया कि हाइब्रिड दिमाग केवल यादृच्छिक (random) व्यवहार नहीं करते हैं; वे ऊर्जा के एक बहुत ही विशिष्ट, लयबद्ध पैटर्न को विकसित करते हैं जो पुराने मॉडलों से पूरी तरह अलग है।

शोधकर्ताओं ने पाया कि ये विशाल ऊर्जा उछाल एक सख्त कार्यक्रम का पालन करते हैं। हर बार जब रोबमान एक "सुपर-स्कैनर" (एक पूर्ण अटेंशन लेयर) का उपयोग करने वाला होता है, तो भारी काम करने से ठीक पहले इसकी ऊर्जा स्तर रॉकेट की तरह ऊपर की ओर जाता है। वे इसे प्री-अटेंशन स्पाइक (Pre-Attention Spike - PAS) कहते हैं। यह बिल्कुल वैसा ही है जैसे रोबोट कुछ भारी काम करने से ठीक पहले एक गहरी सांस लेता है और अपनी मांसपेशियों को खींचता है। लेकिन कहानी और भी दिलचस्प हो जाती है। जब रोबोट को दो "सुपर-स्कैनर्स" के बीच केवल "फास्ट-रीडर्स" का उपयोग करके टेक्स्ट के एक लंबे हिस्से को पढ़ना होता है, तो ऊर्जा केवल शून्य पर वापस नहीं आती। इसके बजाय, यह ऊँची रहती है, जिससे ऊर्जा का एक सपाट, स्थिर पठार (plateau) बन जाता है। वे इसे इंटर-स्पाइक प्लेटो (Inter-Spike Plateau - ISP) कहते हैं।

एक रोलरकोस्टर की कल्पना करें। पुराने मॉडलों में, सवारी सुचारू और स्थिर थी। इन नए हाइब्रिड मॉडलों में, सवारी तेज, नुकीले शिखरों (spikes) की एक श्रृंखला के रूप में दिखती है जो लंबे, ऊंचे, सपाट पुलों (plateaus) से जुड़े होते हैं। शोधकर्ताओं ने कई अलग-अलग प्रकार के हाइब्रिड रोबोटों पर इसका परीक्षण किया, छोटे 1.2 बिलियन पैरामीटर्स वाले रोबोट से लेकर विशाल 397 बिलियन पैरामीटर्स वाले रोबोट तक, और उन्होंने यह "स्पाइक-एंड-प्लेटो" पैटर्न हर जगह पाया। यह होता है चाहे रोबोट गणित के सवाल पढ़ रहा हो, कोडिंग कर रहा हो, या कहानियाँ लिख रहा हो।

टीम ने यह देखने के लिए प्रयोग भी किए कि ये पैटर्न कैसे जन्म लेते हैं। उन्होंने शून्य से रोबोट बनाए और उन्हें सीखते हुए देखा। उन्होंने देखा कि ये स्पाइक्स और प्लेटो रोबोट के प्रशिक्षण के बहुत शुरुआती चरणों में दिखाई देते हैं, लगभग जैसे ही वह पढ़ना शुरू करता है। उन्होंने यह भी देखने के लिए कि क्या होगा, रोबोट के दिमाग में कुछ स्विच "बंद" करने की कोशिश की। उन्होंने पाया कि यदि वे "सुपर-स्कैनर्स" पर एक विशेष गेट लगाते हैं, तो स्पाइक्स बहुत छोटे हो जाते हैं, लेकिन पैटर्न गायब नहीं होता। हालाँकि, यदि वे "फास्ट-रीडर्स" के गेट हटा देते हैं, तो स्पाइक्स वास्तव में थोड़े बड़े हो जाते हैं। यह सुझाव देता है कि "सुपर-स्कैनर्स" इस ऊर्जा लय को व्यवस्थित करने वाले मुख्य बॉस हैं, जबकि "फास्ट-रीडर्स" केवल ऊर्जा को आगे ले जाने में मदद करते हैं।

तो, इसका क्या अर्थ है? शोधकर्ता एक सरल स्पष्टीकरण प्रस्तावित करते हैं: ये ऊर्जा उछाल "राइट-एंड-कैंसिल" (लिखो-और-निरस्त करो) नृत्य की तरह हैं। रोबोट एक भारी गणना करने से ठीक पहले अपनी मेमोरी में सूचना का एक बड़ा टुकड़ा लिखता है, और फिर चीजों को साफ रखने के लिए तुरंत उसे रद्द (cancel) कर देता है। जब रोबोट को बड़ी गणनाओं के बीच लंबे समय तक इंतजार करना पड़ता है (प्लेटो), तो वह बस "कैंसिल" वाले हिस्से को टाल देता है, जिससे अगले बड़े क्षण तक ऊर्जा ऊँची बनी रहती है। जैसे-जैसे रोबोट अधिक "सुपर-स्कैनर्स" का उपयोग करता है और कम "फास्ट-रीडर्स" का, ये प्लेटो लंबे होते जाते हैं जब तक कि वे पुराने मॉडलों की सुचारू, स्थिर सवारी में वापस विलीन नहीं हो जाते।

संक्षेप में, यह पेपर प्रकट करता है कि हाइब्रिड रोबोट दिमागों के पास सोचने का एक अनूठा, लयबद्ध तरीका है जो तेज उछालों से जुड़े ऊंचे पुलों की एक श्रृंखला जैसा दिखता है। यह कोई बग (खराबी) नहीं है; यह उन कुशल, मिश्रित मॉडल के काम करने का एक फीचर (विशेषता) है। यह खोज हमें यह समझने में मदद करती है कि ये शक्तिशाली, कुशल AI मॉडल वास्तव में अंदर से कैसे काम करते हैं, और यह सुझाव देती है कि वे अपने विचारों को कब "निरस्त" करते हैं, उसका समय ही उनके व्यवहार के पीछे का असली रहस्य है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →