← नवीनतम पेपर
🤖 machine learning

TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization

यह शोध पत्र TORQ को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो MXFP4 एक्टिवेशन क्वांटाइजेशन में संरचनात्मक असंतुलन को सैद्धांतिक रूप से संबोधित करने के लिए दो-स्तरीय ऑर्थोगोनल रोटेशन का उपयोग करता है, जिससे बड़े भाषा मॉडलों (LLMs) पर 4-बिट इन्फरेंस और फुल-प्रिसिजन मॉडलों के बीच सटीकता के अंतर को महत्वपूर्ण रूप से कम किया जा सकता है।

मूल लेखक: Zukang Xu, Xing Hu, Dawei Yang

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zukang Xu, Xing Hu, Dawei Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अराजक पुस्तकालय की किताबों (एक स्मार्ट AI के भीतर की "एक्टिवेशन्स") को छोटे, एक समान शिपिंग बॉक्स ( "MXFP4" फॉर्मेट) में पैक करने की कोशिश कर रहे हैं ताकि उन्हें जल्दी और सस्ते में भेजा जा सके।

यह पेपर तर्क देता है कि इन किताबों को बस बॉक्सों में ठूस देना काम नहीं करता है। किताबें बहुत अव्यवस्त हैं, और बॉक्स का आकार बहुत विशिष्ट और कठोर है। इससे दो मुख्य समस्याएँ होती हैं, जिन्हें लेखक TORQ (टू-लेवल ऑर्थोगोनल रोटेशन) कहते हैं।

यहाँ यह पेपर समस्या और उसके समाधान को सरल उपमाओं (analogies) का उपयोग करके समझाता है:

समस्या: पैकिंग विफल होने के दो तरीके

1. "एक शोर मचाने वाला पड़ोसी" की समस्या (इंटर-ब्लॉक वेरिएंस इम्बैलेंस)
कल्पना कीजिए कि आपके पुस्तकालय को 32 किताबों के समूहों में विभाजित किया गया है। वर्तमान प्रणाली में, प्रत्येक समूह को पूरे समूह के लिए एक एकल "आकार लेबल" (स्केलिंग फैक्टर) मिलता है।

  • समस्या: अधिकांश समूहों में किताबें छोटी और हल्की हैं। लेकिन कुछ समूहों में, एक विशाल, भारी विश्वकोश (encyclopedia) है।
  • परिणाम: उस एक भारी किताब के कारण, पूरे समूह के लिए लेबल को "एक्स्ट्रा लार्ज" पर सेट करना पड़ता है। इसका मतलब है कि उसी समूह की सभी छोटी, हल्की किताबों को अब एक विशाल बॉक्स में फिट होने के लिए मजबूर किया जाता है। वे कुचल जाती हैं, खो जाती हैं या शून्य में बदल जाती हैं क्योंकि बॉक्स उनके सूक्ष्म विवरणों को रखने के लिए बहुत बड़ा है। कुछ "शोर मचाने वाले" समूह बाकी सभी के लिए सटीकता को खराब कर देते हैं।

2. "खाली शेल्फ" की समस्या (इंट्रा-ब्लॉक कोडबुक यूटिलाइजेशन इम्बैलेंस)
शिपिंग बॉक्स (MXFP4) के पास पहले से छपी हुई विशिष्ट आकारों की एक सूची (एक "कोडबुक") होती है। ये आकार एक सीढ़ी के डंडों की तरह व्यवस्थित हैं: छोटा, मध्यम, बड़ा, एक्स्ट्रा-लार्ज।

  • समस्या: वास्तविक दुनिया का AI डेटा लोगों की भीड़ की तरह है जहाँ 90% लोग बहुत छोटे हैं और केवल 10% ही लंबे हैं।
  • परिणाम: लगभग सारा डेटा सीढ़ी के "छोटे" डंडों में ही गिर जाता है। "मध्यम" और "बड़े" डंडे पूरी तरह खाली और अप्रयुक्त रह जाते हैं। यह एक विशाल स्थान की बर्बादी और क्षमता का नुकसान है। यह ऐसा है जैसे आपके पास बड़े क्रेट्स (crates) से भरा गोदाम हो, लेकिन आप केवल छोटे वाले ही उपयोग कर रहे हों, जबकि बड़े वाले धूल फांक रहे हों।

समाधान: TORQ (महान पुनर्गठन)

किताबों को बॉक्स में पैक करने से पहले उन्हें जबरदस्ती फिट करने के बजाय, लेखक किताबों को रोटेट (घुमाने) करने का प्रस्ताव देते हैं। इसे ताश के पत्तों को फेंटने (shuffle) की तरह समझें ताकि भारी कार्ड और हल्के कार्ड आपस में मिल जाएं, और लंबे लोग और छोटे लोग भी समान रूप से फैल जाएं।

वे इसे दो चरणों में करते हैं:

चरण 1: मैक्रो शफल ( "शोर मचाने वाले पड़ोसी" को ठीक करना)

  • उपमा: कल्पना कीजिए कि आपके पास 100 समूहों के किताबें हैं। कुछ समूह भारी हैं, कुछ हल्के। लेखक किताबों को समूहों के बीच बदलने के लिए एक गणितीय ट्रिक (शूर-हॉर्न प्रमेय पर आधारित) का उपयोग करते हैं।
  • लक्ष्य: वे भारी समूहों से "भारी" किताबों को हल्के समूहों में, और इसके विपरीत, किताबों को स्थानांतरित करते हैं।
  • परिणाम: अब, प्रत्येक समूह का कुल वजन लगभग समान है। कोई भी एक समूह एक विशाल पुस्तक द्वारा हावी नहीं है। यह प्रत्येक समूह के लिए "आकार लेबल" को एक आदर्श, मध्यम आकार पर सेट करने की अनुमति देता है, जिससे छोटी किताबों के विवरण सुरक्षित रहते हैं।

चरण 2: माइक्रो शफल ( "खाली शेल्फ" को ठीक करना)

  • उपमा: अब जब समूह संतुलित हो गए हैं, तो एक समूह के अंदर देखें। किताबें अभी भी एक साथ गुच्छे में "छोटे" भाग में हैं। लेखक समूह के अंदर किताबों को रोटेट करते हैं।
  • लक्ष्य: वे किताबों को इस तरह घुमाते हैं कि वे आकारों की पूरी सीढ़ी पर समान रूप से फैल जाएं। 90% किताबें "छोटी" होने के बजाय, अब वे इस तरह वितरित होती हैं कि कुछ "मध्यम" डंडों पर और कुछ "बड़े" डंडों पर पहुँचती हैं।
  • परिणाम: वे सीढ़ी के हर डंडे का उपयोग करते हैं। कोई भी स्थान बर्बाद नहीं होता। "कोडबुक" का पूर्ण उपयोग होता है।

परिणाम

AI को कंप्रेस करने (एक प्रक्रिया जिसे पोस्ट-ट्रेनिंग क्वांटाइजेशन कहा जाता है, जिसका अर्थ है कि उन्हें AI को फिर से सिखाने की आवश्यकता नहीं है) से पहले इस दो-चरणीय रोटेशन को करने से, वे अद्भुत परिणाम प्राप्त करते हैं:

  • सटीकता (Accuracy): वे अपने AI को 4-बिट प्रिसिजन (छोटे बॉक्स) तक सिकोड़ने में सफल रहे बिना उसकी "बौद्धिक शक्ति" को बहुत कम किए। परीक्षणों में, उनकी विधि (TORQ) पिछले तरीकों की तुलना में बहुत स्मार्ट थी, जो पूर्ण आकार वाले, अनकंप्रेस्ड AI के करीब स्कोर प्राप्त करती है।
  • गति और आकार (Speed & Size): क्योंकि बॉक्स छोटे हैं, इसलिए AI फोन या सर्वर जैसे उपकरणों पर तेजी से चलता है और कम मेमोरी लेता है।
  • कोई अतिरिक्त काम नहीं (No Extra Work): "रोटेशन" को एक बार गणना करके AI के वेट्स (weights) में ही समाहित कर दिया जाता है। जब AI चलता है, तो उसे कोई अतिरिक्त धीमापन महसूस नहीं होता; रोटेशन गणित के हिस्से के रूप में स्वचालित रूप से होता है।

संक्षेप में: पेपर कहता है, "एक अव्यवस्थित, असमान भीड़ को एक कठोर बॉक्स में दबाने की कोशिश न करें। इसके बजाय, भीड़ को धीरे से इस तरह व्यवस्थित करें कि वे समान रूप से फैल जाएं, और फिर उन्हें बॉक्स में रखें। यह बॉक्स को पूरी तरह से काम करने में मदद करता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →