← नवीनतम पेपर
💬 NLP

Measuring Maximum Activations in Open Large Language Models

यह शोध पत्र 27 आधुनिक ओपन एलएलएम (LLM) चेकपॉइंट्स में अधिकतम सक्रियण परिमाणों (activation magnitudes) का एक व्यापक मापन प्रस्तुत करता है, जो यह प्रकट करता है कि शिखर मान पैरामीटर संख्या के बजाय मॉडल परिवार और आर्किटेक्चर के आधार पर लगभग चार क्रमों (orders of magnitude) तक भिन्न होते हैं, जिसमें MoE मॉडल अपने डेंस (dense) समकक्षों की तुलना में काफी कम शिखर प्रदर्शित करते हैं, जिससे अधिकतम सक्रियण को एक महत्वपूर्ण, गैर-एकदिष्ट (non-monotonic) गुण के रूप में स्थापित किया गया है जिसे स्थिर लो-बिट क्वांटाइजेशन सुनिश्चित करने के लिए रिपोर्ट किया जाना चाहिए।

मूल लेखक: Luxuan Chen, Han Tian, Xinran Chen, Rui Kong, Fang Wang, Jiamin Chen, Yuchen Li, Jiashu Zhao, Shuaiqiang Wang, Haoyi Xiong, Dawei Yin

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luxuan Chen, Han Tian, Xinran Chen, Rui Kong, Fang Wang, Jiamin Chen, Yuchen Li, Jiashu Zhao, Shuaiqiang Wang, Haoyi Xiong, Dawei Yin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, डिजिटल पुस्तकालय बना रहे हैं जहाँ किताबों को एक बहुत तेज़, लेकिन कुछ हद तक नाजुक रोबोट द्वारा पढ़ा जाता है। यह रोबोट (AI मॉडल) शब्दों को एक-एक करके पढ़ता है और कहानी को समझने के लिए उन्हें कमरों (परतों) की एक श्रृंखला के माध्यम से भेजता है। इन कमरों के भीतर, रोबोट द्वारा प्रोसेस किए गए हर शब्द के लिए "उत्साह के स्तर" (एक्टिवेशन) उत्पन्न करता है।

ज्यादातर समय, उत्साह का स्तर शांत और प्रबंधनीय होता है। लेकिन कभी-कभी, एक सेकंड के अंश के लिए, रोबोट किसी विशिष्ट शब्द के प्रति अत्यधिक उत्साहित हो जाता है, जिससे ऊर्जा का एक विशाल उछाल पैदा होता है।

यह शोध पत्र इन रोबोटों के 27 विभिन्न संस्करणों (छोटे से लेकर विशाल तक, और अलग-अलग निर्माताओं जैसे Qwen, Gemma, और GPT-OSS से) के लिए एक सुरक्षा निरीक्षण रिपोर्ट की तरह है। शोधकर्ता एक सरल लेकिन महत्वपूर्ण प्रश्न का उत्तर देना चाहते थे: इन ऊर्जा के उछालों की ऊंचाई कितनी हो सकती है, और क्या रोबट का आकार उछाल की ऊंचाई निर्धारित करता है?

यहाँ उन्हें क्या मिला, सरल उपमाओं का उपयोग करते हुए:

1. "वॉल्यूम नॉब" की समस्या

सोचिए कि रोबोट की आंतरिक ऊर्जा एक वॉल्यूम नॉब (आवाज़ नियंत्रित करने वाला बटन) की तरह है। जगह बचाने और रोबोट को सस्ते हार्डवेयर पर तेज़ी से चलाने के लिए, इंजीनियर अक्सर वॉल्यूम को कम सेटिंग पर करने की कोशिश करते हैं (क्वांटाइजेशन)।

  • समस्या: यदि रोबोट अचानक 1,000,000 की आवाज़ पर चिल्लाता है, लेकिन आपने अपना वॉल्यूम नॉब केवल 10,000 तक संभालने के लिए सेट किया है, तो वह चीख "क्लिप" या विकृत हो जाएगी। रोबोट उस शब्द की बारीकी को भूल जाएगा, और पूरी कहानी गड़बड़ हो जाएगी।
  • निष्कर्ष: शोधकर्ताओं ने सभी रोबोटों में सबसे तेज़ चीख (अधिकतम एक्टिवेशन) को मापा। उन्होंने पाया कि "तेज़ आवाज़" बहुत अधिक भिन्न होती है। कुछ रोबोट (जैसे Qwen3.5) फुसफुसाहट की तरह हैं, जबकि अन्य (जैसे Gemma3) जेट इंजन के उड़ान भरने की तरह हैं।

2. बड़ा होने का मतलब हमेशा तेज़ होना नहीं होता

आप सोच सकते हैं कि एक बड़ा रोबोट (अधिक पैरामीटर्स) स्वाभाविक रूप से अधिक तेज़ होगा।

  • उपमा: यह यह मानने जैसा है कि एक बड़ी कार का इंजन हमेशा अधिक शोर करता है।
  • वास्तविकता: शोधकर्ताओं ने पाया कि यह सच नहीं है। एक ही परिवार का एक छोटा रोबोट दूसरे परिवार के एक विशाल रोबोट की तुलना में बहुत ज़ोर से चिल्ला सकता है। "तेज़ आवाज़" इस पर निर्भर करती है कि इसे किसने बनाया (आर्किटेक्चर) और इसे कैसे प्रशिक्षित किया गया (रेसिपी), न कि केवल इसके आकार पर।
    • उदाहरण: एक Gemma3 रोबोट को समान आकार के Qwen3.5 रोबोट की तुलना में लगभग 7,00,000 गुना अधिक तेज़ पाया गया।

3. "MoE" का शॉर्टकट

कुछ रोबोट "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) नामक एक विशेष तकनीक का उपयोग करते हैं। कल्पना कीजिए कि एक पुस्तकालय है जहाँ, एक विशाल लाइब्रेरियन के हर किताब को पढ़ने के बजाय, 100 छोटे विशेषज्ञ हैं, और प्रत्येक पुस्तक के लिए केवल सही 2 या 3 विशेषज्ञों को बुलाया जाता है।

  • निष्कर्ष: ये "MoE" रोबोट बहुत शांत पाए गए। उनकी सबसे तेज़ चीखें उनके समान आकार के "डेंस" (गैर-विशेषज्ञ) साथियों की तुलना में 14 से 23 गुना कम थीं। ऐसा लगता है कि विशेषज्ञों का उपयोग करने से ऊर्जा अधिक नियंत्रित रहती है।

4. चीख कहाँ होती है?

शोधकर्ताओं ने ट्रैक किया कि रोबोट के मस्तिष्क में ये उछाल वास्तव में कहाँ होते हैं।

  • निष्कर्ष: लगभग हर मामले में (24 में से 22 रोबोटों में), सबसे तेज़ चीख मुख्य गलियारे (रेसिडुअल स्ट्रीम) में हुई जहाँ सूचना एक कमरे से दूसरे कमरे में प्रवाहित होती है। यह आमतौर पर साइड रूम (जैसे अटेंशन या मैथ रूम) में नहीं थी।
  • पैटर्न: कुछ रोबोट जल्दी उछलते हैं और तेज़ बने रहते हैं (जैसे कूदना और रुक जाना), जबकि अन्य धीरे-धीरे बढ़ते हैं और अंत में सबसे तेज़ होते हैं (जैसे क्रमिक चढ़ाई)।

5. प्रशिक्षण वॉल्यूम को बदल देता है

उन्होंने प्रशिक्षण के विभिन्न चरणों में रोबोटों को भी देखा, जैसे कि एक छात्र नया कौशल सीख रहा हो।

  • निष्कर्ष: जैसे-जैसे रोबोट अधिक प्रशिक्षित होता है (अधिक किताबें देखता है), वह थोड़ा अधिक तेज़ होता जाता है। यह कोई बहुत बड़ा उछाल नहीं है, लेकिन जैसे-जैसे रोबोट स्मार्ट होता जाता है, "वॉल्यूम" धीरे-धीरे बढ़ता जाता है।

बिल्डर्स (निर्माताओं) के लिए मुख्य बात

यह शोध पत्र निष्कर्ष निकालता है कि आप केवल उसके आकार को देखकर यह अनुमान नहीं लगा सकते कि रोबोट कितना तेज़ होगा।

  • सीख: इससे पहले कि आप इन रोबोटों को छोटा बनाने की कोशिश करें (जैसे फोन पर चलाने के लिए), आपको पहले उनकी सबसे तेज़ चीख को मापना होगा। यदि आप ऐसा नहीं करते हैं, तो आप अपने वॉल्यूम नॉब को बहुत कम सेट कर सकते हैं, और रोबोट मतिभ्रम (hallucinations) या गलतियाँ करने लगेगा क्योंकि वह ऊर्जा के अचानक उछाल को संभाल नहीं पाएगा।

लेखकों ने अपने मापने के उपकरण जारी कर दिए हैं ताकि कोई भी जो ये रोबोट बना रहा है, उन्हें संकुचित (compress) करने से पहले इस "तेज़ आवाज़" की जाँच कर सके, जिससे रोबोट स्थिर और सटीक बना रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →