← नवीनतम पेपर
🤖 AI

ReSpinQuant: Efficient Layer-Wise LLM Quantization via Subspace Residual Rotation Approximation

ReSpinQuant लार्ज लैंग्वेज मॉडल्स के लिए एक कुशल लेयर-वाइज पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो रेसिडुअल सबस्पेस रोटेशन के माध्यम से ऑफलाइन एक्टिवेशन रोटेशन फ्यूजन का लाभ उठाकर लो-बिट सेटिंग्स में स्टेट-ऑफ-द-आर्ट सटीकता प्राप्त करता है, जिससे यह उच्च अभिव्यक्ति क्षमता और नगण्य इन्फरेंस ओवरहेड के बीच सामंजस्य स्थापित करता है।

मूल लेखक: Suyoung Kim, Sunghyun Wee, Hyeonjin Kim, Kyomin Hwang, Hyunho Lee, Nojun Kwak

प्रकाशित 2026-04-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Suyoung Kim, Sunghyun Wee, Hyeonjin Kim, Kyomin Hwang, Hyunho Lee, Nojun Kwak

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM)। यह पुस्तकालय इतना बड़ा और भारी है कि इसे अपनी जेब में रखना या एक सामान्य लैपटॉप पर चलाना असंभव है। इसे पोर्टेबल बनाने के लिए, आप इन किताबों को छोटे, हल्के पेपरबैक में सिकोड़ना चाहते हैं। इस प्रक्रिया को क्वांटाइजेशन (Quantization) कहा जाता है।

हालाँकि, एक समस्या है: इन किताबों के कुछ पन्नों में "आउटलेयर्स" (outliers) हैं। ये उन विशाल, नियॉन की तरह चमकने वाले शब्दों की तरह हैं जो बहुत अधिक उभर कर आते हैं, जिससे जब आप पूरे बुक को सिकोड़ने की कोशिश करते हैं, तो वे चमकीले शब्द कुचल जाते या विकृत हो जाते हैं, जिससे अर्थ बिगड़ जाता है।

इसे ठीक करने के लिए, पिछले तरीकों ने किताब को सिकोड़ने से पहले उसे "रोटेट" (घुमाने) करने की कोशिश की, ताकि उन चमकीले शब्दों को फैलाया जा सके ताकि वे एक-दूसरे को कुचल न सकें। लेकिन उन्हें एक दुविधा का सामना करना पड़ा:

  1. "एक ही आकार सबके लिए" दृष्टिकोण (ग्लोबल रोटेशन): कल्पना कीजिए कि आप किताब के हर एक अध्याय के लिए एक ही रोटेशन ट्रिक का उपयोग करते हैं। यह पैक करने में तेज़ और आसान है, लेकिन यह हर अध्याय के लिए पूरी तरह से काम नहीं करता क्योंकि हर अध्याय के अपने अनूठे अजीब शब्द होते हैं।
  2. "कस्टम-टेलरड" दृष्टिकोण (लेयर-वाइज): कल्पना कीजिए कि आप हर एक अध्याय के लिए एक अनूठी रोटेशन ट्रिक बनाने के लिए एक दर्जी को काम पर रखते हैं। यह पूरी तरह से फिट बैठता है और अर्थ को बरकरार रखता है, लेकिन यह इतना धीमा और भारी है कि आप अब किताब को वास्तव में ले जा ही नहीं सकते। "टेलरिंग" (सिलाई) का काम तब होता है जब आप पढ़ रहे होते हैं, जिससे आपकी गति धीमी हो जाती है।

ReSpinQuant एक नया समाधान है जो आपको दोनों दुनियाओं का सर्वश्रेष्ठ देता है। यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:

समस्या: "भारी सूटकेस"

"कस्टम-टेलरड" दृष्टिकोण को एक ऐसा सूटकेस पैक करने के रूप में सोचें जहाँ आपको अपने घर के हर एक कमरे के लिए एक अलग, भारी टूलबॉक्स ले जाना पड़ता है। आपके पास हर कमरे के लिए सही उपकरण हैं, लेकिन सूटकेस उठाने के लिए बहुत भारी है।

ReSpinQuant समाधान: "जादुई ब्लूप्रिंट"

ReSpinQuant एक चतुर ट्रिक का उपयोग करता है जिसे सबस्पेस रेसिडुअल रोटेशन एप्रोक्सिमेशन (Subspace Residual Rotation Approximation) कहा जाता है। आइए इसे समझते हैं:

1. "ऑफलाइन" जादू (टूल्स को मिलाना)

अपने साथ यात्रा करते समय (ऑनलाइन) भारी टूलबॉक्स ले जाने के बजाय, ReSpinQuant सारा भारी काम आपके निकलने से पहले कर देता है।

  • यह क्या करता है: यह प्रत्येक अध्याय के लिए कस्टम रोटेशन ट्रिक्स को लेता है और उन्हें स्थायी रूप से पुस्तक के पन्नों में "गोंद" की तरह चिपका देता है।
  • परिणाम: जब आप अंततः पढ़ने के लिए किताब खोलते हैं (इन्फरेंस), तो आपको किसी अतिरिक्त टूल की आवश्यकता नहीं होती है। किताब पहले से ही रोटेटेड है। यह इसे "एक ही आकार सबके लिए" विधि जितना तेज़ बनाता है।

2. "रेसिडुअल" समस्या (बेमेल होना)

यहाँ एक पेच है। जब आप रोटेशन को पन्नों में चिपका देते हैं, तो अध्याय 1 और अध्याय 2 के बीच का संबंध ("रेसिडुअल कनेक्शन") थोड़ा गलत संरेखित (misaligned) हो सकता है। यह ऐसा है जैसे आपने अध्याय 1 के पन्नों को घुमाया, लेकिन अध्याय 2 अभी भी मूल ओरिएंटेशन में है। कहानी थोड़ी झटकेदार हो जाती है।

3. "सबस्पेस" शॉर्टकट (छोटा सा समायोजन)

यहीं पर इस शोध पत्र की प्रतिभा चमकती है। शोधकर्ताओं ने गौर किया कि भले ही उन्होंने प्रत्येक अध्याय के लिए एक अनूठा रोटेशन बनाया था, लेकिन नए रोटेशन और पुराने रोटेशन के बीच का अंतर वास्तव में बहुत छोटा और सरल था। यह कोई जटिल, अराजक गड़बड़ी नहीं थी; यह केवल एक छोटा, लो-रैंक एडजस्टमेंट था।

  • उपमा: कल्पना कीजिए कि आप दो विशाल, घूमते हुए गियर्स (gears) को संरेखित करने की कोशिश कर रहे हैं। एक पूर्ण रोटेशन के लिए गियर के हर एक दांत को हिलाने की आवश्यकता होगी (महंगा और धीमा)। लेकिन ReSpinQuant ने महसूस किया कि आपको बस उन्हें पूरी तरह से जोड़ने के लिए एक या दो विशिष्ट दांतों को समायोजित करने की आवश्यकता है।
  • क्रियान्वयन: पूरे गियर के संरेखण की पुनर्गणना करने के बजाय (जो धीमा है), ReSpinQuant केवल उस छोटे से "सबस्पेस" के लिए समायोजन की गणना करता है।
  • परिणाम: यह बिना किसी अतिरिक्त प्रयास के लगभग तुरंत संरेखण को ठीक कर देता है।

यह क्यों मायने रखता है

  • गति: यह सरल तरीकों जितना तेज़ है क्योंकि सारा भारी काम पहले ही कर लिया जाता है।
  • सटीकता: यह जटिल तरीकों जितना स्मार्ट है क्योंकि यह अभी भी प्रत्येक लेयर के लिए रोटेशन को कस्टमाइज़ करता है।
  • दक्षता: यह "मिसमैच" की समस्या को हल करता है क्योंकि यह पूरे डेटा के बजाय डेटा के एक बहुत छोटे हिस्से पर गणित करता है।

निचोड़

ReSpinQuant एक स्मार्ट पैकिंग सर्विस की तरह है।

  • पुराने तरीकों ने या तो सब कुछ ढीला पैक किया (तेज़ लेकिन अव्यवस्थित) या सब कुछ पूरी तरह से पैक किया लेकिन लोड होने में बहुत समय लगा (सटीक लेकिन धीमा)।
  • ReSpinQuant सब कुछ आपके पहुँचने से पहले पूरी तरह से पैक करता है, और फिर एक छोटे, जादुई टूल का उपयोग करके उस एक या दो चीज़ों को ठीक करता है जो ठीक से फिट नहीं हुई थीं।

परिणाम? आपको एक उच्च-गुणवत्ता वाली, पूरी तरह से पैक की गई लाइब्रेरी मिलती है जो आपकी जेब में समा जाती है और आपके फोन पर तुरंत चलती है, यहाँ तक कि सबसे चरम कंप्रेशन (3-बिट या 4-बिट) के साथ भी। यह शक्तिशाली AI को सुपरकंप्यूटरों की आवश्यकता के बिना रोजमर्रा के उपकरणों पर चलाने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →