← नवीनतम पेपर
🤖 machine learning

ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization

ReRound एक कैलिब्रेशन-मुक्त पोस्ट-ट्रेनिंग क्वांटाइजेशन विधि है जो लो-बिट LLM वेट्स में मिडपॉइंट राउंडिंग अस्पष्टताओं को हल करने के लिए एक कंडीशनल डिफ्यूजन मॉडल का लाभ उठाती है, जो ऑफलाइन दक्षता बनाए रखते हुए 3-बिट और 4-बिट क्वांटाइजेशन के लिए मानक तकनीकों से लगातार बेहतर प्रदर्शन करती है।

मूल लेखक: He-Yen Hsieh, H. T. Kung

प्रकाशित 2026-08-12
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: He-Yen Hsieh, H. T. Kung

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप ज्ञान के एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय को एक छोटे, पोर्टेबल बैकपैक में फिट करने के लिए सिकोड़ने की कोशिश कर रहे हैं। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है, जो सुपर-स्मार्ट AI दिमाग हैं जो कहानियाँ लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं, और इंसानों की तरह चैट कर सकते हैं। ये दिमाग अरबों छोटे नंबरों से बने होते हैं जिन्हें "वेट्स" (weights) कहा जाता है, और इन्हें सामान्य फोन या लैपटॉप पर तेजी से और सस्ते में चलाने के लिए, वैज्ञानिक इन नंबरों को छोटे बक्सों में दबाने की कोशिश करते हैं। इस प्रक्रिया को क्वांटाइजेशन (quantization) कहा जाता है।

मूल, पूर्ण आकार के नंबरों को हाई-रिज़ॉल्यूशन फोटो की तरह समझें। जगह बचाने के लिए, हम उन्हें लो-रिज़ॉल्यूशन पिक्सेल आर्ट में बदलना चाहते हैं। इसे करने का मानक तरीका "राउंड-टू-नियरएस्ट" (RTN) कहलाता है। यह एक नंबर को देखने और पूछने जैसा है, "क्या यह 1 के करीब है या 2 के?" यदि यह 1.4 है, तो हम इसे 1 तक राउंड डाउन करते हैं। यदि यह 1.6 है, तो हम इसे 2 तक राउंड अप करते हैं। यह एक सरल, स्वचालित नियम है। लेकिन एक पेचीदा जगह है: क्या होगा यदि नंबर ठीक 1.5 है? या इसके बहुत करीब है, जैसे 1.48? इस "मिडपॉइंट" (मध्य बिंदु) पर, निर्णय संदिग्ध होता है। राउंड डाउन करना या राउंड अप करना लगभग समान मात्रा में त्रुटि पैदा करता है, इसलिए सरल नियम बस मनमाने ढंग से एक को चुन लेता है। अरबों नंबरों वाले एक विशाल पुस्तकालय में, इन हजारों छोटे, मनमाने अनुमानों को लगाने से अनजाने में पूरे पुस्तक का अर्थ बिगड़ सकता है, जिससे AI कम बुद्धिमान हो सकता है।

यहीं पर एक नई विधि आती है जिसे ReRound कहा जाता है। इन पेचीदा मिडपॉइंट्स पर अंधाधुंध अनुमान लगाने के बजाय, ReRound एक जासूस की तरह काम करता है जो नंबरों के आसपास के पड़ोस को देखता है ताकि सबसे अच्छा विकल्प पता लगाया जा सके। यह एक विशेष प्रकार के AI प्रशिक्षण का उपयोग करता है जिसे "डिफ्यूजन मॉडल" (वही तकनीक जिसका उपयोग टेक्स्ट से इमेज बनाने के लिए किया जाता है) कहा जाता है, ताकि यह सीखा जा सके कि AI के दिमाग में नंबरों की व्यवस्था के छिपे हुए पैटर्न कैसे हैं। जब यह एक नंबर को मिडपॉइंट के पास देखता है, तो यह पूछता है, "इस नंबर की जो कंपनी (साथी नंबर) है, उसके आधार पर, क्या इसे वास्तव में नीचे राउंड किया जाना चाहिए, या यह ऊपर होना चाहिए?" इन पैटर्न का उपयोग करके राउंडिंग को निर्देशित करके, ReRound बिना पूरे AI को फिर से प्रशिक्षित किए या नए उदाहरण दिए, मानक विधि की गलतियों को ठीक कर सकता है। यह एक चतुर तरीका है जिससे आप एक छोटे बैकपैक से अधिक सटीकता निकाल सकते हैं, जिससे शक्तिशाली AI को महंगे सुपरकंप्यूटरों की आवश्यकता के बिना सभी के लिए सुलभ बनाया जा सके।

बेहतर AI के लिए जासूसी गाइड

आर्टिफिशियल इंटेलिजेंस की दुनिया में, मॉडल्स को छोटा और तेज़ बनाने की खोज अक्सर एक दीवार से टकरा जाती है: "मिडपॉइंट समस्या"। जब वैज्ञानिक AI के भीतर के विशाल नंबरों को सिकोड़ने की कोशिश करते हैं (एक प्रक्रिया जिसे क्वांटाइजेशन कहा जाता है), तो वे आमतौर पर एक सरल नियम का उपयोग करते हैं: यदि कोई नंबर फर्श (floor) के करीब है, तो नीचे राउंड करें; यदि यह छत (ceiling) के करीब है, तो ऊपर राउंड करें। लेकिन क्या होता है जब एक नंबर कमरे के बिल्कुल बीच में होता है? मानक नियम बस एक सिक्का उछाल देते हैं। पेपर ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization तर्क देता है कि यह सिक्का उछालना एक छूटा हुआ अवसर है।

हार्वर्ड यूनिवर्सिटी के ही-येन ह्सिएह (He-Yen Hsieh) और एच. टी. कुंग (H. T. Kung) ने एक नई रणनीति प्रस्तावित की है जिसे ReRound कहा जाता है। मिडपॉइंट के पास नंबरों को अंधाधुंध राउंड करने के बजाय, ReRound एक "डिफ्यूजन प्रायर" (diffusion prior) का उपयोग करता है—जो एक सीखा हुआ अनुमान है कि सिकुड़ने से पहले मूल, पूर्ण-आकार के नंबर कैसे दिखते थे। कल्पना कीजिए कि आपके पास एक बिल्ली की धुंधली, पिक्सेलेटेड फोटो है। एक मानक राउंडिंग नियम केवल अपने निकटतम पड़ोसियों के आधार पर एक धुंधले पिक्सेल के रंग का अनुमान लगा सकता है। हालाँकि, ReRound एक प्रशिक्षित AI (विशेष रूप से एक U-Net डिफ्यूजन मॉडल) का उपयोग करता है ताकि यह "हैलुसिनेट" (कल्पना) या पुनर्निर्मित कर सके कि मूल, उच्च-गुणवत्ता वाली छवि के आधार पर पूरे फोटो का पैच कैसा दिखना चाहिए।

यहाँ जादू कैसे होता है, चरण दर चरण:

  1. प्रशिक्षण चरण (The Training Phase): मॉडल के सिकुड़ने से पहले ही, ReRound मॉडल के पूर्ण-आकार, उच्च-परिशुद्धता वाले वेट्स पर एक नज़र डालता है। यह इन वेट्स को छोटे 64x64 पैच में काट देता है और एक डिफ्यूजन मॉडल को प्रशिक्षित करता है ताकि वह इसके लो-बिट, धुंधले संस्करण को देखकर मूल, पूर्ण-आकार के पैच की भविष्यवाणी कर सके। इसे एक जासूस को एक विशिष्ट कपड़े के बनावट को केवल एक छोटे, धुंधले नमूने को छूकर पहचानने के लिए सिखाने के रूप में समझें।
  2. पुनर्निर्माण (The Reconstruction): जब मॉडल को सिकोड़ने का समय आता है, तो ReRound केवल नंबरों को राउंड नहीं करता है। यह अपने प्रशिक्षित जासूस (डिफ्यूजन मॉडल) के माध्यम से धुंधले, लो-बिट नंबरों को चलाता है ताकि वेट्स का एक "पुनर्निर्मित" संस्करण उत्पन्न किया जा सके। यह अंतिम वेट नहीं है; यह एक मार्गदर्शक है। यह एक जासूस की तरह है जो कहता है, "मुझे पता है कि यह धुंधला पिक्सेल एक मिडपॉइंट के पास है, लेकिन पूरे पैच के पैटर्न के आधार पर, इसे थोड़ा ऊपर होना चाहिए।"
  3. स्मार्ट राउंडिंग (The Smart Rounding): ReRound इस जासूस की सलाह का उपयोग तभी करता है जब मानक नियम वास्तव में भ्रमित होता है (मिडपॉइंट के पास)। यदि नंबर स्पष्ट रूप से फर्श या छत के करीब है, तो यह मानक नियम का पालन करता है। लेकिन यदि नंबर बीच में डगमगा रहा है, तो Re-Round पुनर्निर्मित मान की जाँच करता है। यदि पुनर्निर्माण दूसरे तरीके से राउंड करने का सुझाव देता है, और मिडपॉइंट से "दूरी" बहुत अधिक नहीं है, तो ReRound स्विच बदल देता है।
  4. सुरक्षा जाँच (The Safety Check): यह सुनिश्चित करने के लिए कि यह बहुत अधिक स्विच न बदल दे और मॉडल को खराब न कर दे, Re-Round शrunken मॉडल के कुछ अलग संस्करण बनाता है, जिनमें से प्रत्येक में जासूस पर विश्वास करने के लिए थोड़ा अलग "सहनशीलता" (tolerance) होती है। फिर यह मैट्रिक्स के "कंकाल" (इसके सिंगुलर वैल्यूज) को देखकर विजेता का चयन करता है। यह उस संस्करण को चुनता है जो मूल, पूर्ण-आकार के मॉडल के सबसे महत्वपूर्ण संरचनात्मक पैटर्न को यथावत रखता है।

परिणाम प्रभावशाली हैं, विशेष रूप से छोटे AI मॉडल्स के लिए। पेपर दिखाता है कि Re-Round लगातार मानक "राउंड-टू-नियरएस्ट" पद्धति को 3-बिट और 4-बिट परिशुद्धता पर कंप्रेस करने में मात देता है। उदाहरण के लिए, Gemma 2 2B और Gemma 3 1B जैसे मॉडल्स पर, Re-Round ने विभिन्न भाषा कार्यों में सटीकता में 0.1 से 1.3 अंक का सुधार किया। कुछ मामलों में, इसने उन तरीकों को भी पीछे छोड़ दिया जिन्हें "कैलिब्रेशन डेटा" (AI को राउंडिंग सीखने के लिए हजारों उदाहरण वाक्य खिलाना) की आवश्यकता होती है, जबकि Re-Round ने बिना किसी अतिरिक्त डेटा के काम किया। इसने पूरी तरह से ऑफलाइन, केवल मॉडल के अपने वेट्स का उपयोग करके काम किया।

लेखक सावधानीपूर्वक नोट करते हैं कि यह हर एक समस्या के लिए जादुई समाधान नहीं है। यह विधि तब सबसे अच्छा काम करती है जब क्वांटाइजेशन पैरामीटर्स (जैसे स्केल और ज़ीरो-पॉइंट) पहले से ही फिक्स्ड हों। इसके लिए प्रत्येक विशिष्ट AI के लिए एक अलग डिफ्यूजन मॉडल को प्रशिक्षित करने की भी आवश्यकता होती है, जिसमें शुरू में कुछ समय और कंप्यूटिंग पावर (प्रत्येक मॉडल के लिए लगभग 2 से 3 घंटे का प्रशिक्षण और कुछ घंटों का इन्फरेंस) लगता है। हालाँकि, एक बार जब यह हो जाता है, तो मॉडल को सिकोड़ने की वास्तविक प्रक्रिया तेज़ होती है, जिसमें केवल सेकंड या मिनट लगते हैं।

महत्वपूर्ण रूप से, Re-Round यह नहीं बदलता है कि आपका AI आपके फोन या लैपटॉप पर कैसे चलता है। यह केवल मेमोरी में संग्रहीत अंतिम पूर्णांक (integer) नंबरों को बदलता है। इसका मतलब है कि AI पहले की तरह ही तेज़ चलता है, लेकिन थोड़े अधिक 'ब्रेनपावर' के साथ। पेपर सुझाव देता है कि "पुनर्निर्मित वेट्स" का उपयोग करने का यह दृष्टिकोण राउंडिंग के लिए एक नया मानक बन सकता है, जो यह साबित करता है कि कभी-कभी, निर्णय लेने का सबसे अच्छा तरीका केवल एक नंबर को अलग-थलग देखना नहीं है, बल्कि यह पूछना है कि उसका पड़ोस क्या सोचता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →