← नवीनतम पेपर
💬 NLP

LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs

यह शोध पत्र LATMiX प्रस्तुत करता है, जो माइक्रो-स्केल क्वांटाइजेशन (MX) के लिए एक्टिवेशन डिस्ट्रीब्यूशन को अनुकूलित करने हेतु लर्नबल इनवर्टिबल अफ़ाइन ट्रांसफॉर्मेशन का उपयोग करने वाली एक विधि है, जिससे मौजूदा रोटेशन- या हेडामार्ड-आधारित दृष्टिकोणों की तुलना में लो-बिट लार्ज लैंग्वेज मॉडल्स की सटीकता में उल्लेखनीय सुधार होता है।

मूल लेखक: Ofir Gordon, Lior Dikstein, Arnon Netzer, Idan Achituve, Hai Victor Habi

प्रकाशित 2026-04-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ofir Gordon, Lior Dikstein, Arnon Netzer, Idan Achituve, Hai Victor Habi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय (एक लार्ज लैंग्वेज मॉडल, या LLM) की कल्पना करें जो किसी भी प्रश्न का उत्तर देने, कोड लिखने या कहानियाँ सुनाने में सक्षम है। समस्या यह है कि यह पुस्तकालय इतना विशाल और भारी है कि इसे संग्रहीत करना महंगा और पढ़ना धीमा है। इसे तेज़ और सस्ता बनाने के लिए, इंजीनियर किताबों को छोटे, सरल स्वरूपों में सारांशित करके उन्हें सिकोड़ने का प्रयास करते हैं। इस प्रक्रिया को क्वांटाइजेशन (Quantization) कहा जाता है।

हालाँकि, इसमें एक पेंच है: इन विशाल पुस्तकालयों में, कुछ पृष्ठों में "आउटलेयर्स" (outliers) होते हैं—अत्यधिक लंबे, जटिल वाक्य जो छोटे, सरल स्वरूप में ठीक से फिट नहीं होते। यदि आप उन लंबे वाक्यों को एक छोटे से डिब्बे में डालने की कोशिश करते हैं, तो वे दब जाते और विकृत हो जाते हैं, जिससे कहानी बर्बाद हो जाती है।

समस्या: "ब्लॉक" की बाधा (The "Block" Bottleneck)

हाल ही में, इन किताबों को व्यवस्थित करने का एक नया तरीका जिसे माइक्रोस्केलिंग (Microscaling - MX) कहा जाता है, पेश किया गया। पूरी लाइब्रेरी को एक एकल विशाल सारांश के साथ सिकोड़ने के बजाय, MX किताबों को छोटे ब्लॉक्स (blocks) में तोड़ता है और प्रत्येक ब्लॉक को शब्दों को मापने के लिए अपना स्वयं का एक छोटा सा पैमाना (स्केलिंग फैक्टर) देता है। यह टेक्स्ट के विभिन्न हिस्सों को अधिक लचीले ढंग से संभालने के लिए बहुत अच्छा है।

लेकिन यहाँ एक पेंच है: पिछले तरीकों ने "आउटलेयर" समस्या को हल करने के लिए पूरी लाइब्रेरी को एक घूमते हुए लट्टू की तरह घुमाने (rotate करने) का प्रयास किया। जब उन्होंने इस रोटेशन को नए "ब्लॉक" पैमानों के साथ मिलाने की कोशिश की, तो अराजकता फैल गई। रोटेशन ने ब्लॉक के माप को बाधित कर दिया, जिससे लाइब्रेरी अपठनीय हो गई।

इसे ठीक करने के लिए, शुरुआती शोधकर्ताओं ने एक वर्कअराउंड (जुगाड़) आजमाया: उन्होंने केवल प्रत्येक छोटे ब्लॉक के भीतर के पृष्ठों को घुमाया और लाइब्रेरी के बाकी हिस्सों को अनदेखा कर दिया। हालाँकि इसने अराजकता को रोक दिया, लेकिन यह एक पार्किंग लॉट के भीतर की कारों को ठीक करने के लिए अगली लेन में फंसी कारों को अनदेखा करने जैसा था। इसने बड़े पैमाने पर समस्या का समाधान नहीं किया।

समाधान: LATMiX (बुद्धिमान पुनर्गठनकर्ता)

इस शोध पत्र के लेखक, LATMiX, प्रस्तावित करते हैं कि किताबों को सिकोड़ने से पहले उन्हें व्यवस्थित करने का एक स्मार्ट तरीका क्या है।

मॉडल में डेटा को एक कमरे में लोगों की भीड़ की तरह कल्पना करें। कुछ लोग एक विशाल, घने समूह (आउटलेयर्स) में खड़े हैं, जबकि अन्य बिखरे हुए हैं।

  • पुराने तरीकों ने या तो पूरे कमरे को घुमाने का प्रयास किया या केवल छोटे समूहों के भीतर लोगों को मिलाया।
  • LATMiX एक मास्टर कोरियोग्राफर (नर्तक प्रशिक्षक) की तरह कार्य करता है। यह एक कस्टम, लचीला नृत्य कदम (एफाइन ट्रांसफॉर्मेशन - affine transformation) सीखता है जो घने समूह को पूरे कमरे में समान रूप से वितरित करता है।

इस कोरियोग्राफी की दो विशेष विशेषताएं हैं:

  1. यह सीखने योग्य (Learnable) है: एक पूर्व-निर्धारित नृत्य (जैसे एक सरल रोटेशन) के बजाय, LATMiX विशिष्ट डेटा के लिए विशेष रूप से पूर्ण नृत्य कदम सीखने के लिए मानक AI उपकरणों का उपयोग करता है। यह पता लगाता है कि ऊर्जा को ठीक से कैसे वितरित किया जाए ताकि कोई भी बिंदु बहुत अधिक भीड़भाड़ वाला न हो जाए।
  2. यह ब्लॉक्स का सम्मान करता है: यह "ब्लॉक" पैमानों (MX फॉर्मेट) को जानता है। यह केवल लोगों को बेतरतीब ढंग से नहीं मिलाता; यह उन्हें इस तरह से मिलाता है जो ब्लॉक सिस्टम के साथ पूरी तरह से काम करता है, यह सुनिश्चित करता है कि छोटे पैमाने हर किसी को सटीक रूप से माप सकें।

यह कैसे काम करता है (जादुई ट्रिक)

शोध पत्र बताता है कि LATMiX वास्तव में बाद में लाइब्रेरी को पढ़ने के दौरान इसे धीमा नहीं करता है। यह एक जादूगर की तरह है जो ट्रिक शुरू होने से पहले कार्डों को पुनर्व्यवस्थित करता है और फिर इस पुनर्गठन को सीधे डेक (ताश की गड्डी) में ही समाहित कर देता है। एक बार जब ट्रिक सेट हो जाती है, तो जादूगर (कंप्यूटर) को कार्डों को फिर से शफल करने के लिए कोई अतिरिक्त काम नहीं करना पड़ता; कार्ड पहले से ही सही क्रम में होते हैं। इसका मतलब है कि गति और मेमोरी का उपयोग पहले जितना ही तेज़ रहता है, लेकिन "सिकुड़ी हुई" किताबों की गुणवत्ता बहुत बेहतर होती है।

परिणाम

लेखकों ने विभिन्न मॉडलों (जैसे Llama और Qwen) पर इसका परीक्षण किया और पाया कि LATMiX लगातार अन्य तरीकों से बेहतर प्रदर्शन करता है।

  • बेहतर सटीकता: "सिकुड़े हुए" मॉडल पुराने संकुचन तकनीकों का उपयोग करने वाले मॉडलों की तुलना में कम गलतियाँ करते हैं और प्रश्नों को बेहतर ढंग से समझते हैं।
  • मजबूती (Robustness): यह छोटे से लेकर बहुत बड़े मॉडलों तक, विभिन्न मॉडल आकारों में अच्छी तरह से काम करता है।
  • दक्षता (Efficiency): इसने मॉडल चलाने के लिए अतिरिक्त समय या लागत जोड़े बिना इन सुधारों को प्राप्त किया।

संक्षेप में, LATMiX एक बुद्धिमान, सीखने योग्य उपकरण है जो संकुचित करने से ठीक पहले डेटा को सही ढंग से पुनर्व्यवस्थित करता है, यह सुनिश्चित करता है कि सबसे चरम "आउटलेयर" जानकारी भी बिना खोए जीवित रहे, और आधुनिक हार्डवेयर प्रारूपों के साथ सहजता से सामंजस्य बिठा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →