Measuring Maximum Activations in Open Large Language Models
यह शोध पत्र 27 आधुनिक ओपन एलएलएम (LLM) चेकपॉइंट्स में अधिकतम सक्रियण परिमाणों (activation magnitudes) का एक व्यापक मापन प्रस्तुत करता है, जो यह प्रकट करता है कि शिखर मान पैरामीटर संख्या के बजाय मॉडल परिवार और आर्किटेक्चर के आधार पर लगभग चार क्रमों (orders of magnitude) तक भिन्न होते हैं, जिसमें MoE मॉडल अपने डेंस (dense) समकक्षों की तुलना में काफी कम शिखर प्रदर्शित करते हैं, जिससे अधिकतम सक्रियण को एक महत्वपूर्ण, गैर-एकदिष्ट (non-monotonic) गुण के रूप में स्थापित किया गया है जिसे स्थिर लो-बिट क्वांटाइजेशन सुनिश्चित करने के लिए रिपोर्ट किया जाना चाहिए।