← नवीनतम पेपर
🤖 machine learning

The Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane Algorithm

यह शोध पत्र यह स्थापित करता है कि GPTQ, इनपुट हेसियन (Hessian) द्वारा परिभाषित एक लैटिस (lattice) पर क्लोजेस्ट वेक्टर प्रॉब्लम (closest vector problem) को हल करने के लिए बाबाई (Babai) के नियरएस्ट प्लेन एल्गोरिदम (nearest plane algorithm) के गणितीय रूप से समकक्ष है, जिससे एक ज्यामितीय व्याख्या, सैद्धांतिक त्रुटि सीमाएं, और बेहतर, क्लिपिंग-मुक्त क्वांटाइजेशन विधियों को विकसित करने के लिए एक आधार प्राप्त होता है।

मूल लेखक: Jiale Chen, Yalda Shabanzadeh, Elvir Crnčević, Torsten Hoefler, Dan Alistarh

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiale Chen, Yalda Shabanzadeh, Elvir Crnčević, Torsten Hoefler, Dan Alistarh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: विशाल मस्तिष्क को सिकोड़ना

कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है जिसमें सैकड़ों अरब पुस्तकें (पैरामीटर्स) हैं। इस पुस्तकालय को एक मानक कंप्यूटर या फोन पर चलाने के लिए, आपको उन पुस्तकों को एक छोटी शेल्फ में फिट करने के लिए सिकोड़ना होगा। इस प्रक्रिया को क्वांटाइजेशन (quantization) कहा जाता है।

वर्तमान में, कहानी खोए बिना इन पुस्तकों को सिकोड़ने का उद्योग मानक तरीका GPTQ है। यह अच्छा काम करता है, लेकिन अब तक, वास्तव में कोई नहीं जानता था कि यह इतना अच्छा क्यों काम करता है। यह एक मास्टर शेफ की तरह था जो रेसिपी का पूरी तरह से पालन तो कर रहा है, लेकिन यह नहीं जानता कि सामग्री इतनी अच्छी तरह से क्यों मिल रही है क्योंकि उसके पीछे का रसायन विज्ञान क्या है।

यह शोध पत्र GPTQ के लिए "रसायन विज्ञान की पाठ्यपुस्तक" के रूप में कार्य करता है। लेखकों ने पाया कि GPTQ केवल गणित के कुछ रैंडम ट्रिक्स का समूह नहीं है; यह वास्तव में क्रिप्टोग्राफी और ज्यामिति (geometry) के क्षेत्र का एक प्रसिद्ध, दशकों पुराना एल्गोरिदम है, जिसे बेबाई का नियरएस्ट प्लेन एल्गोरिदम (Babai's Nearest Plane Algorithm) कहा जाता है।

मुख्य खोज: एक ज्यामितीय मानचित्र

लेखकों ने महसूस किया कि जब आप वेट्स (मॉडल के भीतर की संख्याएँ) को सिकोड़ने की कोशिश करते हैं, तो आप एक विशिष्ट ज्यामितीय पहेली हल कर रहे होते हैं जिसे क्लोजेस्ट वेक्टर प्रॉब्लम (CVP) कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप एक विशाल, बहु-आयामी जंगल में खड़े हैं। पेड़ एक आदर्श ग्रिड (लैटिस) में व्यवस्थित हैं। आप हवा में एक लक्ष्य बिंदु (मूल, उच्च-परिशुद्धता वाला वेट) पकड़े हुए हैं। आपका लक्ष्य उस लक्ष्य बिंदु के सबसे करीब वाली पेड़ की शाखा (क्वांटाइज्ड, लो-बिट इंटीजर) को खोजना है।
  • समस्या: एक सामान्य जंगल में, पेड़ झुके हुए या घने हो सकते हैं, जिससे यह बताना मुश्किल हो जाता है कि कौन सी शाखा वास्तव में सबसे करीब है।
  • GPTQ का संबंध: शोध पत्र यह सिद्ध करता है कि जब GPTQ वेट्स को अंतिम आयाम से पहले आयाम की ओर (पीछे से आगे की ओर) प्रोसेस करता है, तो यह गणितीय रूप से बेबाई के एल्गोरिदम के समान होता है। बेबाई की विधि पेड़ों द्वारा परिभाषित निकटतम "प्लेन" (एक सपाट कागज की शीट) पर आपके लक्ष्य बिंदु को एक-एक करके प्रोजेक्ट करने का एक चतुर तरीका है, जब तक कि आपको सबसे करीबी शाखा न मिल जाए।

यह क्यों मायने रखता है: "नो-क्लिपिंग" नियम

इस खोज से पहले, GPTQ में एक सुरक्षा तंत्र था जिसे क्लिपिंग (clipping) कहा जाता था। यदि कोई वेट नए, छोटे फॉर्मेट में फिट होने के लिए बहुत बड़ा था, तो एल्गोरिदम बस अतिरिक्त बिट्स को काट देता था (जैसे किसी लंबे व्यक्ति को कार में फिट करने के लिए उसकी ऊंचाई काट देना)। इससे त्रुटियां (errors) पैदा होती थीं।

क्योंकि लेखकों अब GPTQ को एक ज्यामितीय प्रोजेक्शन (बेबाई का एल्गोरिदम) के रूप में समझते हैं, उन्होंने महसूस किया कि यदि आप वेट्स को क्लिप नहीं करते हैं, तो इसमें एक अंतर्निहित "गारंटी" आती है कि यह कितनी त्रुटि करेगा। यह एक ऐसे मानचित्र की तरह है जो आपको बताता है कि आप वास्तविक गंतव्य से कितनी दूर हो सकते हैं।

नए उपकरण: बेहतर शेल्फ बनाना

इस नई ज्यामितीय समझ का उपयोग करते हुए, लेखकों ने दो नए तरीके डिजाइन किए जो "क्लिपिंग" की समस्या से पूरी तरह बचते हैं, जिसके परिणामस्वरूप अधिक स्मार्ट, अधिक सटीक मॉडल मिलते हैं:

  1. एसएसक्यूआर (SSQR - Scale-Adjusted SpQR):

    • उपमा: कल्पना कीजिए कि आप एक सूटकेस पैक कर रहे हैं। आपके अधिकांश कपड़े छोटे बक्सों (लो-बिट इंटीजर्स) में करीने से फिट हो जाते हैं। लेकिन आपके पास कुछ अजीब आकार की वस्तुएं (आउटलेयर्स) हैं जो फिट नहीं होती हैं।
    • पुराना तरीका: आप उन्हें बक्सों में जबरदस्ती डालते हैं, जिससे वे दब जाते हैं (क्लिपिंग), जो उन्हें खराब कर देता है।
    • नया तरीका (SSQR): आप साफ कपड़ों को बक्सों में रखते हैं, लेकिन उन अजीब आकार की वस्तुओं को एक अलग, लचीले बैग (फ्लोटिंग-पॉइंट स्टोरेज) में रखते हैं और उसे सूटकेस से चिपका देते हैं। आप बक्सों के आकार को बस इतना एडजस्ट करते हैं कि केवल आवश्यक वस्तुएं ही बैग में जाएं। यह सूटकेस को हल्का रखता है लेकिन अजीब वस्तुओं को पूरी तरह सुरक्षित रखता है।
  2. एचपीटीक्यू (HPTQ - Huffman-encoded Post-Training Quantization):

    • उपमा: कल्पना कीजिए कि आप एक पुस्तक लिख रहे हैं, लेकिन आप जगह बचाना चाहते हैं। आप देखते हैं कि कुछ शब्द बहुत बार आते हैं, जबकि अन्य दुर्लभ हैं।
    • विधि: हर शब्द को समान संख्या में अक्षर देने के बजाय, आप सामान्य शब्दों को छोटे कोड और दुर्लभ शब्दों को लंबे कोड देते हैं। HPTQ मॉडल के नंबरों के साथ यही करता है। यह संख्याओं को कुशलतापूर्वक दर्शाने के लिए एक स्मार्ट कोडिंग सिस्टम (हफमैन एनकोडिंग) का उपयोग करता है, जिससे सटीकता खोए बिना मॉडल को एक संपीड़ित (compressed) फ़ाइल की तरह माना जाता है, न कि एक कठोर ग्रिड की तरह।

परिणाम: तेज़ और स्मार्ट

लेखकों ने केवल गणित नहीं किया; उन्होंने इन तरीकों का उपयोग करने के लिए उपकरण बनाए।

  • सटीकता (Accuracy): उनके नए तरीके (SSQR और HPTQ) पुराने GPTQ तरीके की तुलना में AI के "मस्तिष्क" को अधिक तेज रखते हैं, विशेष रूप से जब वे मॉडल को बहुत छोटे आकार (जैसे 3 बिट्स) तक सिकोड़ते हैं।
  • गति (Speed): उन्होंने ग्राफिक्स कार्ड (GPUs) पर इन नए तरीकों को चलाने के लिए विशेष कंप्यूटर कोड (CUDA kernels) लिखा। उन्होंने पाया कि उनके डेटा को पैक करने का नया तरीका वास्तव में इन मॉडलों को चलाने के मानक तरीके की तुलना में दोगुना तेज़ है, भले ही इसमें "लचीले बैग" के लिए अतिरिक्त चीज़ें शामिल हों।

सारांश

यह शोध पत्र एक लोकप्रिय AI टूल (GPTQ) को लेता है, यह महसूस करता है कि यह वास्तव में एक क्लासिक ज्यामितीय पहेली सॉल्वर (बेबाई का एल्गोरिदम) है, और इस अंतर्दृष्टि का उपयोग करके बड़े AI मॉडल को बिना तोड़े बेहतर, तेज़ और अधिक सटीक तरीके से सिकोड़ने के तरीके बनाता है। यह एक "ब्लैक बॉक्स" ट्रिक को एक पारदर्शी, गणितीय रूप से गारंटीकृत प्रक्रिया में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →