← नवीनतम पेपर
🤖 machine learning

FPTQuant: Function-Preserving Transforms for LLM Quantization

FPTQuant हल्के, फंक्शन-प्रिजर्विंग ट्रांसफॉर्म्स पेश करता है जो लार्ज लैंग्वेज मॉडल्स के कुशल स्टैटिक INT4 क्वांटाइजेशन को सक्षम करने के लिए एक्टिवेशन डिस्ट्रीब्यूशंस को नया आकार देते हैं, जिससे न्यूनतम सटीकता ह्रास और बिना किसी कस्टम कर्नेल ओवरहेड के 3.9X तक की स्टेट-ऑफ-द-आर्ट स्पीड-अप प्राप्त होती है।

मूल लेखक: Boris van Breugel, Yelysei Bondarenko, Paul Whatmough, Markus Nagel

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Boris van Breugel, Yelysei Bondarenko, Paul Whatmough, Markus Nagel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, उच्च-स्तरीय पुस्तकालय के रूप में करें। इस पुस्तकालय को उपयोगी बनाने के लिए, आपको किताबों को (टेक्स्ट जेनरेट करना) तेज़ी से पढ़ना होगा। हालाँकि, किताबें एक बहुत ही जटिल, उच्च-परिशुद्धता वाली भाषा (फ्लोटिंग-पॉइंट नंबर्स) में लिखी गई हैं, जिसमें बहुत अधिक जगह लगती है और उन्हें प्रोसेस करने के लिए बहुत अधिक ऊर्जा की आवश्यकता होती है।

समस्या: "आउटलायर" (Outlier) किताब
जगह और ऊर्जा बचाने के लिए, आप इन किताबों को एक सरल, छोटी भाषा (क्वांटाइजेशन, जैसे कि केवल 4-बिट इंटीजर्स का उपयोग करना) में अनुवादित करना चाहते हैं। यह एक 500 पन्नों के उपन्यास को 10 पन्नों के पर्चे (pamphlet) में सारांशित करने जैसा है। आमतौर पर, यह बहुत अच्छा काम करता है।

लेकिन, LLMs के पास एक अजीब समस्या है: कुछ विशिष्ट शब्द या नंबर विशाल आउटलायर्स (massive outliers) होते हैं। कल्पना कीजिए कि एक पुस्तकालय है जहाँ 99% किताबें पतले पर्चे हैं, लेकिन एक अकेली किताब 10,000 पन्नों का विश्वकोश (encyclopedia) है। यदि आप सब कुछ एक 10-पन्ने के पर्चे में सारांशित करने की कोशिश करते हैं, तो आपके पास दो बुरे विकल्प होते हैं:

  1. पर्चे का आकार बढ़ा दें ताकि विश्वकोश उसमें समा जाए, लेकिन फिर 99% पतले पर्चे धुंधले हो जाएंगे और अपने विवरण खो देंगे।
  2. पर्चे को छोटा रखें और बस उस विश्वकोश को फेंक दें (क्लिप कर दें), लेकिन फिर आप महत्वपूर्ण जानकारी खो देंगे।

यह "रेंज बनाम परिशुद्धता" (range vs. precision) का ट्रेड-ऑफ आमतौर पर मॉडल की बुद्धिमत्ता को खराब कर देता है।

समाधान: FPTQuant (एक "जादुई अनुवादक")
यह पेपर FPTQuant पेश करता है, जो एक नया तरीका है जो सारांशित करने से पहले एक चतुर अनुवादक की तरह काम करता है। पुस्तकालय को एक छोटे पर्चे में फिट करने के लिए मजबूर करने के बजाय, FPTQuant किताबों को इस तरह से पुनर्व्यवस्थित करता है कि सारांश (summarization) होने से पहले वे सभी लगभग एक ही आकार की हो जाएं।

यह तीन "फंक्शन-प्रिजर्विंग ट्रांसफॉर्म्स" (FPTs) का उपयोग करके ऐसा करता है। इन्हें ऐसे जादुई ट्रिक्स के रूप में सोचें जो डेटा का आकार बदल देते हैं बिना उसकी कहानी बदले।

तीन जादुई ट्रिक्स

1. "Pre-RoPE" शफल (Queries और Keys के लिए)

  • रूपक (Metaphor): कल्पना कीजिए कि पुस्तकालय किताबों को उनके स्थान के आधार पर खोजने के लिए एक विशेष इंडेक्सिंग सिस्टम (RoPE) का उपयोग करता है। आप किताबों को बेतरतीब ढंग से शफल नहीं कर सकते, अन्यथा इंडेक्स टूट जाएगा।
  • ट्रिक: FPTQuant इंडेक्सिंग होने से पहले एक बहुत ही विशिष्ट, गणितीय रूप से सटीक शफल करता है। यह "Query" और "Key" किताबों को इस तरह से घुमाता (rotate) और स्केल करता है कि बाद में इंडेक्स लागू होने पर, परिणाम बिल्कुल वैसा ही होता है जैसा कि आपने बिना शफल किए होता।
  • लाभ: यह खोज डेटा में मौजूद विशाल विश्वकोश-आकार के आउटलायर्स को सुचारू बनाता है, जिससे उन्हें विवरण खोए बिना सारांशित करना आसान हो जाता है।

2. "Value" रीशफल (Values के लिए)

  • रूपक: एक बार जब पुस्तकालय सही किताबें ढूंढ लेता है, तो वह वास्तविक सामग्री (Values) निकाल लेता है।
  • ट्रिक: पेपर का तर्क है कि इन किताबों की सामग्री को इस तरह से पुनर्व्यवस्थित किया जा सकता है (रोटेट और स्केल) जो खोज इंडेक्स से पूरी तरह स्वतंत्र है। यह प्रत्येक "हेड" (पुस्तकालय का एक विशिष्ट खंड) के लिए एक अनूठा रीशफल लागू करता है।
  • लाभ: यह सामग्री डेटा में आने वाले उतार-चढ़ाव (wild spikes) को सपाट कर देता है, जिससे यह एकसमान और संकुचित करने में आसान हो जाता है।

3. "डायनेमिक टोकन" स्केल (Residuals के लिए)

  • रूपक: जैसे-जैसे आप पुस्तकालय के माध्यम से पढ़ते हैं, आप जो कुछ भी सीख रहे हैं उसका एक रनिंग नोट (residual) रखते हैं। कभी-कभी, एक विशिष्ट वाक्य के लिए, यह नोट बहुत बड़ा और अव्यवस्थित हो जाता है।
  • ट्रिक: FPTQuant हर एक वाक्य के गुजरने के दौरान उसमें एक छोटा, डायनेमिक "वॉल्यूम नॉब" जोड़ता है। यदि किसी वाक्य का नोट बहुत तेज़ (outlier) है, तो यह नॉब उसकी आवाज़ कम कर देता है। यदि यह शांत है, तो यह इसे बढ़ा देता है। महत्वपूर्ण रूप से, यह अंतिम कहानी अपरिवर्तित रखने के लिए अगले चरण के वॉल्यूम को एडजस्ट करता है।
  • लाभ: यह सुनिश्चित करता है कि कोई भी एकल वाक्य सारांश पर हावी न हो, जिससे पूरा टेक्स्ट संतुलित और क्वांटाइजेशन-अनुकूल बना रहता है।

यह क्यों मायने रखता है (परिणाम)

पेपर दावा करता है कि इन तीन ट्रिक्स का उपयोग करके, वे मॉडल को INT4 (बहुत छोटा आकार) तक कंप्रेस कर सकते हैं बिना किसी कस्टम, महंगे कंप्यूटर चिप की आवश्यकता के या गति धीमी किए।

  • गति (Speed): यह मूल, अन-कंप्रेस्ड वर्ज़न की तुलना में 3.9 गुना तेज़ है।
  • सटीकता (Accuracy): यह उन पिछले तरीकों के समान या उनसे बेहतर प्रदर्शन करता है जो बहुत धीमे थे।
  • कोई ओवरहेड नहीं (No Overhead): क्योंकि ये "जादुई ट्रिक्स" मॉडल के मौजूदा वेट्स (weights) में सीधे मर्ज करने के लिए डिज़ाइन की गई हैं, इसलिए वे वास्तविक रीडिंग प्रक्रिया के दौरान कोई अतिरिक्त कदम नहीं जोड़ती हैं। यह गोदाम में किताबों को इस तरह व्यवस्थित करने जैसा है कि वे ट्रक में पूरी तरह फिट हो जाएं, बजाय इसके कि ट्रक में लोड करने के लिए एक नया स्टेप जोड़ा जाए।

सारांश:
FPTQuant एक स्मार्ट प्री-प्रोसेसिंग स्टेप है जो AI मॉडल्स में "अजीब, बहुत बड़े नंबर्स" को सुचारू बनाता है। ऐसा करके, यह मॉडल्स को उनकी सोचने या बोलने की स्पष्टता खोए बिना, बहुत छोटे और ऊर्जा-कुशल आकार में सिकोड़ने की अनुमति देता है। यह एक अराजक पुस्तकालय को व्यवस्थित करने जैसा है ताकि एक छोटा, कुशल रोबोट भी एक मानव लाइब्रेरियन की तरह ही उसे पढ़ सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →