TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization
यह शोध पत्र TORQ को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो MXFP4 एक्टिवेशन क्वांटाइजेशन में संरचनात्मक असंतुलन को सैद्धांतिक रूप से संबोधित करने के लिए दो-स्तरीय ऑर्थोगोनल रोटेशन का उपयोग करता है, जिससे बड़े भाषा मॉडलों (LLMs) पर 4-बिट इन्फरेंस और फुल-प्रिसिजन मॉडलों के बीच सटीकता के अंतर को महत्वपूर्ण रूप से कम किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अराजक पुस्तकालय की किताबों (एक स्मार्ट AI के भीतर की "एक्टिवेशन्स") को छोटे, एक समान शिपिंग बॉक्स ( "MXFP4" फॉर्मेट) में पैक करने की कोशिश कर रहे हैं ताकि उन्हें जल्दी और सस्ते में भेजा जा सके।
यह पेपर तर्क देता है कि इन किताबों को बस बॉक्सों में ठूस देना काम नहीं करता है। किताबें बहुत अव्यवस्त हैं, और बॉक्स का आकार बहुत विशिष्ट और कठोर है। इससे दो मुख्य समस्याएँ होती हैं, जिन्हें लेखक TORQ (टू-लेवल ऑर्थोगोनल रोटेशन) कहते हैं।
यहाँ यह पेपर समस्या और उसके समाधान को सरल उपमाओं (analogies) का उपयोग करके समझाता है:
समस्या: पैकिंग विफल होने के दो तरीके
1. "एक शोर मचाने वाला पड़ोसी" की समस्या (इंटर-ब्लॉक वेरिएंस इम्बैलेंस)
कल्पना कीजिए कि आपके पुस्तकालय को 32 किताबों के समूहों में विभाजित किया गया है। वर्तमान प्रणाली में, प्रत्येक समूह को पूरे समूह के लिए एक एकल "आकार लेबल" (स्केलिंग फैक्टर) मिलता है।
- समस्या: अधिकांश समूहों में किताबें छोटी और हल्की हैं। लेकिन कुछ समूहों में, एक विशाल, भारी विश्वकोश (encyclopedia) है।
- परिणाम: उस एक भारी किताब के कारण, पूरे समूह के लिए लेबल को "एक्स्ट्रा लार्ज" पर सेट करना पड़ता है। इसका मतलब है कि उसी समूह की सभी छोटी, हल्की किताबों को अब एक विशाल बॉक्स में फिट होने के लिए मजबूर किया जाता है। वे कुचल जाती हैं, खो जाती हैं या शून्य में बदल जाती हैं क्योंकि बॉक्स उनके सूक्ष्म विवरणों को रखने के लिए बहुत बड़ा है। कुछ "शोर मचाने वाले" समूह बाकी सभी के लिए सटीकता को खराब कर देते हैं।
2. "खाली शेल्फ" की समस्या (इंट्रा-ब्लॉक कोडबुक यूटिलाइजेशन इम्बैलेंस)
शिपिंग बॉक्स (MXFP4) के पास पहले से छपी हुई विशिष्ट आकारों की एक सूची (एक "कोडबुक") होती है। ये आकार एक सीढ़ी के डंडों की तरह व्यवस्थित हैं: छोटा, मध्यम, बड़ा, एक्स्ट्रा-लार्ज।
- समस्या: वास्तविक दुनिया का AI डेटा लोगों की भीड़ की तरह है जहाँ 90% लोग बहुत छोटे हैं और केवल 10% ही लंबे हैं।
- परिणाम: लगभग सारा डेटा सीढ़ी के "छोटे" डंडों में ही गिर जाता है। "मध्यम" और "बड़े" डंडे पूरी तरह खाली और अप्रयुक्त रह जाते हैं। यह एक विशाल स्थान की बर्बादी और क्षमता का नुकसान है। यह ऐसा है जैसे आपके पास बड़े क्रेट्स (crates) से भरा गोदाम हो, लेकिन आप केवल छोटे वाले ही उपयोग कर रहे हों, जबकि बड़े वाले धूल फांक रहे हों।
समाधान: TORQ (महान पुनर्गठन)
किताबों को बॉक्स में पैक करने से पहले उन्हें जबरदस्ती फिट करने के बजाय, लेखक किताबों को रोटेट (घुमाने) करने का प्रस्ताव देते हैं। इसे ताश के पत्तों को फेंटने (shuffle) की तरह समझें ताकि भारी कार्ड और हल्के कार्ड आपस में मिल जाएं, और लंबे लोग और छोटे लोग भी समान रूप से फैल जाएं।
वे इसे दो चरणों में करते हैं:
चरण 1: मैक्रो शफल ( "शोर मचाने वाले पड़ोसी" को ठीक करना)
- उपमा: कल्पना कीजिए कि आपके पास 100 समूहों के किताबें हैं। कुछ समूह भारी हैं, कुछ हल्के। लेखक किताबों को समूहों के बीच बदलने के लिए एक गणितीय ट्रिक (शूर-हॉर्न प्रमेय पर आधारित) का उपयोग करते हैं।
- लक्ष्य: वे भारी समूहों से "भारी" किताबों को हल्के समूहों में, और इसके विपरीत, किताबों को स्थानांतरित करते हैं।
- परिणाम: अब, प्रत्येक समूह का कुल वजन लगभग समान है। कोई भी एक समूह एक विशाल पुस्तक द्वारा हावी नहीं है। यह प्रत्येक समूह के लिए "आकार लेबल" को एक आदर्श, मध्यम आकार पर सेट करने की अनुमति देता है, जिससे छोटी किताबों के विवरण सुरक्षित रहते हैं।
चरण 2: माइक्रो शफल ( "खाली शेल्फ" को ठीक करना)
- उपमा: अब जब समूह संतुलित हो गए हैं, तो एक समूह के अंदर देखें। किताबें अभी भी एक साथ गुच्छे में "छोटे" भाग में हैं। लेखक समूह के अंदर किताबों को रोटेट करते हैं।
- लक्ष्य: वे किताबों को इस तरह घुमाते हैं कि वे आकारों की पूरी सीढ़ी पर समान रूप से फैल जाएं। 90% किताबें "छोटी" होने के बजाय, अब वे इस तरह वितरित होती हैं कि कुछ "मध्यम" डंडों पर और कुछ "बड़े" डंडों पर पहुँचती हैं।
- परिणाम: वे सीढ़ी के हर डंडे का उपयोग करते हैं। कोई भी स्थान बर्बाद नहीं होता। "कोडबुक" का पूर्ण उपयोग होता है।
परिणाम
AI को कंप्रेस करने (एक प्रक्रिया जिसे पोस्ट-ट्रेनिंग क्वांटाइजेशन कहा जाता है, जिसका अर्थ है कि उन्हें AI को फिर से सिखाने की आवश्यकता नहीं है) से पहले इस दो-चरणीय रोटेशन को करने से, वे अद्भुत परिणाम प्राप्त करते हैं:
- सटीकता (Accuracy): वे अपने AI को 4-बिट प्रिसिजन (छोटे बॉक्स) तक सिकोड़ने में सफल रहे बिना उसकी "बौद्धिक शक्ति" को बहुत कम किए। परीक्षणों में, उनकी विधि (TORQ) पिछले तरीकों की तुलना में बहुत स्मार्ट थी, जो पूर्ण आकार वाले, अनकंप्रेस्ड AI के करीब स्कोर प्राप्त करती है।
- गति और आकार (Speed & Size): क्योंकि बॉक्स छोटे हैं, इसलिए AI फोन या सर्वर जैसे उपकरणों पर तेजी से चलता है और कम मेमोरी लेता है।
- कोई अतिरिक्त काम नहीं (No Extra Work): "रोटेशन" को एक बार गणना करके AI के वेट्स (weights) में ही समाहित कर दिया जाता है। जब AI चलता है, तो उसे कोई अतिरिक्त धीमापन महसूस नहीं होता; रोटेशन गणित के हिस्से के रूप में स्वचालित रूप से होता है।
संक्षेप में: पेपर कहता है, "एक अव्यवस्थित, असमान भीड़ को एक कठोर बॉक्स में दबाने की कोशिश न करें। इसके बजाय, भीड़ को धीरे से इस तरह व्यवस्थित करें कि वे समान रूप से फैल जाएं, और फिर उन्हें बॉक्स में रखें। यह बॉक्स को पूरी तरह से काम करने में मदद करता है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।