← नवीनतम पेपर
🤖 AI

Model-Preserving Adaptive Rounding

यह शोध पत्र YAQA को प्रस्तुत करता है, जो एक अनुकूली राउंडिंग क्वांटाइजेशन एल्गोरिदम है जो हेसियन सन्निकटन (Hessian approximations) पर आधारित सैद्धांतिक एंड-टू-एंड त्रुटि सीमाओं का लाभ उठाता है ताकि बिना किसी इन्फरेंस ओवरहेड के GPTQ और क्वांटाइजेशन-अवेयर ट्रेनिंग जैसे मौजूदा तरीकों से काफी बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Albert Tseng, Zhaofeng Sun, Christopher De Sa

प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Albert Tseng, Zhaofeng Sun, Christopher De Sa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Model-Preserving Adaptive Rounding" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी तस्वीर: एक विशाल पुस्तकालय को छोटा करना

कल्पthought करें कि आपके पास एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है (यह आपका Large Language Model, या LLM है)। इसमें अरबों किताबें (पैरामीटर्स) हैं जो अत्यंत सटीक स्याही (हाई-प्रिसिजन नंबर्स जैसे 32-bit फ्लोटिंग पॉइंट) से लिखी गई हैं। यह पुस्तकालय इतना बड़ा है कि इसे रखना महंगा है, ले जाना कठिन है, और इसमें खोजना धीमा है।

इसे उपयोग करने के लिए सस्ता और तेज़ बनाने के लिए, हम इस पुस्तकालय को छोटा करना चाहते हैं। हम किताबों को सरल, मोटे अक्षरों वाली स्याही (लो-प्रिसिजन नंबर्स, जैसे 4-bit इंटीजर्स) का उपयोग करके फिर से लिखना चाहते हैं। इस प्रक्रिया को Quantization कहा जाता है।

समस्या:
जब आप सरल स्याही के साथ एक किताब को फिर से लिखते हैं, तो आप अनिवार्य रूप से कुछ विवरण खो देते हैं। यदि आप केवल हर नंबर को निकटतम सरल मान (value) पर आँख मूंदकर राउंड कर देते हैं, तो कहानी बदल जाती है। पुस्तकालय का "अर्थ" बदल जाता है, और AI गलत या अजीब जवाब देने लगता है।

अधिकांश वर्तमान तरीके इस समस्या को ठीक करने की कोशिश करते हैं, लेकिन वे एक समय में एक किताब को देखते हैं। वे कहते हैं, "आइए सुनिश्चित करें कि यह विशिष्ट किताब बहुत अधिक न बदले।" लेकिन यह एक पूरे उपन्यास को अध्याय दर अध्याय पढ़ने के बिना संपादित करने जैसा है। आप अध्याय 1 को ठीक कर सकते हैं, लेकिन आपने अनजाने में अध्याय 10 के प्लॉट ट्विस्ट को बिगाड़ दिया क्योंकि आपने यह नहीं सोचा कि वे आपस में कैसे जुड़े हैं।

समाधान: YAQA (Yet Another Quantization Algorithm)

लेखक YAQA नामक एक नई विधि पेश करते हैं। एक अलग इकाई (लेयर) के रूप में एक किताब को देखने के बजाय, YAQA पूरे पुस्तकालय को देखता है ताकि यह देखा जा सके कि एक किताब को बदलने से पूरी कहानी पर क्या प्रभाव पड़ता है।

यहाँ बताया गया है कि YAQA कैसे काम करता है, जिसे तीन सरल अवधारणाओं में विभाजित किया गया है:

1. "महत्व का मानचित्र" (The Hessian)

यह तय करने के लिए कि किन विवरणों को रखना है और किन को छोड़ देना है, आपको एक ऐसे मानचित्र की आवश्यकता है जो बताता हो कि सबसे महत्वपूर्ण क्या है। गणित में, इस मानचित्र को Hessian कहा जाता है।

  • पुराना तरीका (GPTQ/LDLQ): ये तरीके एक "लोकल मैप" का उपयोग करते हैं। वे केवल लेयर के तत्काल इनपुट को देखते हैं। यह एक ऐसे लाइब्रेरियन की तरह है जिसे केवल इस बात की परवाह है कि किताब शेल्फ में फिट बैठती है या नहीं, इस बात की नहीं कि वह किताब वास्तव में कहानी के लिए उपयोगी है या नहीं।
  • YAQA का तरीका: YAQA एक "ग्लोबल मैप" बनाता है। यह गणना करता है कि जब आप वेट्स (weights) में थोड़ा सा बदलाव करते हैं, तो AI के अंतिम आउटपुट में कितना बदलाव आता है। यह पूछता है, "यदि मैं यहाँ इस नंबर को बदल दूँ, तो क्या अंतिम उत्तर खराब हो जाएगा?"

2. "स्मार्ट राउंडिंग" रणनीति

एक बार जब आपके पास मानचित्र आ जाता है, तो आपको नंबरों को राउंड करने की आवश्यकता होती है।

  • उपमा: कल्पना करें कि आप एक सूटकेस पैक कर रहे हैं। आपके पास सीमित जगह (लो प्रिसिजन) है।
  • पुराना तरीका: आप एक-एक करके चीजें पैक करते हैं। आप एक शर्ट रखते हैं, फिर पैंट, फिर एक मोजा। आप यह नहीं सोचते कि शर्ट से पैंट में सिलवटें पड़ सकती हैं।
  • YAQA: यह Adaptive Rounding नामक तकनीक का उपयोग करता है। यह "ग्लोबल मैप" को देखता है और पैकिंग के क्रम को समायोजित करता है। इसे एहसास होता है, "यदि मैं इस शर्ट को दबाता हूँ, तो मुझे कुल आयतन (volume) को समान रखने के लिए पैंट को ढीला करना होगा।" यह पूरे मॉडल में त्रुटियों (errors) को संतुलित करता है ताकि अंतिम परिणाम सटीक बना रहे।

3. "Kronecker" शॉर्टकट

एक विशाल AI मॉडल के लिए "ग्लोबल मैप" की गणना करना सामान्य रूप से बहुत धीमा होता है और इसके लिए बहुत अधिक मेमोरी की आवश्यकता होती है। यह समुद्र तट पर रेत के हर एक कण का मानचित्र बनाने की कोशिश करने जैसा है।

  • ट्रिक: YAQA एक गणितीय शॉर्टकट का उपयोग करता है जिसे Kronecker-factored approximation कहा जाता है।
  • उपमा: रेत के हर कण का मानचित्र बनाने के बजाय, आप समुद्र तट और सागर का अलग-अलग मानचित्र बनाते हैं, और फिर उन्हें मिला देते हैं। यह गणना करने में बहुत तेज़ है, फिर भी यह पूरे परिदृश्य की आश्चर्यजनक रूप से सटीक तस्वीर देता है। यह YAQA को इतना तेज़ बनाता है कि इसे वास्तव में उपयोग किया जा सके।

YAQA बेहतर क्यों है?

पेपर दावा करता है कि YAQA की तीन मुख्य जीतें हैं:

  1. यह गणितीय रूप से बेहतर होने के लिए सिद्ध है:
    लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने इसे सिद्ध किया। उन्होंने एक गणितीय "बाउंड" (गारंटी) बनाई है जो दिखाती है कि YAQA हमेशा पुराने तरीकों (जैसे GPTQ या LDLQ) की तुलना में मूल मॉडल के अधिक करीब रहेगा। यह एक गारंटी होने जैसा है कि आपका छोटा किया गया पुस्तकालय 99% सटीक होगा, जबकि पुराना तरीका केवल 90% का वादा करता था।

  2. यह मॉडल की "आत्मा" को बनाए रखता है:
    उन्होंने KL Divergence नामक एक मीट्रिक का उपयोग करके मापा कि क्वांटाइज्ड मॉडल मूल मॉडल से कितना भिन्न है (इसे "मूल व्यक्तित्व से दूरी" के रूप में सोचें)।

  • YAQA मौजूदा सर्वोत्तम तरीकों की तुलना में इस दूरी को लगभग 30% कम कर देता है।
  • यह Quantization Aware Training (QAT) को भी मात देता है। QAT एक ऐसी विधि है जहाँ आप AI को कम प्रिसिजन के अनुकूल होने के लिए पुन: प्रशिक्षित (re-train) करते हैं। YAQA बिना मॉडल को पुन: प्रशिक्षित किए बेहतर सटीकता प्राप्त करता है, जिससे समय और ऊर्जा की भारी बचत होती है।
  1. उपयोगकर्ताओं के लिए कोई अतिरिक्त लागत नहीं:
    एक बार जब मॉडल को YAQA का उपयोग करके छोटा कर दिया जाता है, तो यह किसी भी अन्य छोटे किए गए मॉडल की तरह ही तेज़ी से चलता है। "स्मार्ट राउंडिंग" केवल तैयारी चरण के दौरान होती है। जब आप AI का उपयोग करते हैं, तो इसमें कोई अतिरिक्त ओवरहेड नहीं होता है।

संक्षेप में

  • लक्ष्य: AI मॉडल को उनकी बुद्धिमत्ता खोए बिना सस्ता और तेज़ बनाने के लिए छोटा करना।
  • पुरानी समस्या: पिछले तरीके स्थानीय विवरणों पर ध्यान केंद्रित करते थे, जिससे समग्र रूप से मॉडल अपने मूल व्यवहार से भटक जाता था।
  • YAQA का समाधान: यह मॉडल के एरर (त्रुटि) के वैश्विक दृश्य और एक स्मार्ट गणितीय शॉर्टकट (Kronecker factorization) का उपयोग करता है ताकि नंबरों को इस तरह राउंड किया जा सके कि मॉडल का समग्र आउटपुट सुरक्षित रहे।
  • परिणाम: एक ऐसा मॉडल जो पहले के किसी भी तरीके की तुलना में मूल उच्च-गुणवत्ता वाले संस्करण के काफी करीब है, जिसे गणित द्वारा सिद्ध किया गया है और वास्तविक कार्यों पर परखा गया है, और इसे चलाने के लिए कोई अतिरिक्त लागत नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →