← नवीनतम पेपर
🤖 machine learning

STaR-Quant: State-Time Consistent Post-Training Quantization for Diffusion Large Language Models

यह शोध पत्र STaR-Quant का प्रस्ताव करता है, जो एक पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो स्टेट-गाइडेड एक्टिवेशन ट्रांसफॉर्मेशन और टेम्पोरल अटेंशन कंपनसेशन के माध्यम से डिफ्यूजन लार्ज लैंग्वेज मॉडल्स में स्टेट-डिपेंडेंट एक्टिवेशन डिस्पैरिटी और टेम्पोरल एरर एक्युमुलेशन को संबोधित करता है, जिससे लो-बिट क्वांटाइजेशन प्रदर्शन को बनाए रखते हुए महत्वपूर्ण मेमोरी बचत और स्पीडअप प्राप्त होता है।

मूल लेखक: Xin Yan, Aqiang Wang, Zhenglin Wan, Xingrui Yuand Ivor Tsang

प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xin Yan, Aqiang Wang, Zhenglin Wan, Xingrui Yuand Ivor Tsang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके STaR-Quant पेपर की व्याख्या दी गई है।

बड़ी तस्वीर: एक नए प्रकार का लेखक

दो प्रकार के लेखकों की कल्पना करें:

  1. आत्मकथा लेखक (Autoregressive LLMs): वे एक कहानी को एक बार में एक शब्द करके, सख्ती से बाएं से दाएं लिखते हैं। एक बार जब वे एक शब्द लिख देते हैं, तो वे पीछे जाकर उसे बदल नहीं सकते।
  2. संपादक (Diffusion Large Language Models या DLLMs): वे खाली स्थानों (या "मास्क्ड" शब्दों) और कुछ बिखरे हुए संकेतों वाले एक पूरे पन्ने से शुरुआत करते हैं। वे पूरे पन्ने को एक साथ देखते हैं, अनुमान लगाते हैं कि गायब शब्द क्या होने चाहिए, उन्हें भरते हैं, और फिर अपने अनुमानों को तब तक सुधारते रहते हैं जब जब तक कि कहानी समझ में न आने लगे।

"संपादक" (DLLM) बेहतरीन है क्योंकि यह पूरे संदर्भ को देख सकता है और चलते समय अपनी गलतियों को सुधार सकता है। लेकिन एक समस्या है: यह भारी और धीमा है। इसे चलाने के लिए एक विशाल कंप्यूटर की आवश्यकता होती है क्योंकि इसे सही करने के लिए टेक्स्ट को कई बार "फिर से पढ़ने" और "फिर से संपादित करने" की आवश्यकता होती है।

समस्या: "लो-बिट" (Low-Bit) बाधा

इन संपादकों को साधारण कंप्यूटरों (जैसे लैपटॉप या फोन) पर चलाने के लिए, वैज्ञानिक क्वांटाइजेशन (Quantization) नामक तकनीक का उपयोग करके उन्हें छोटा करने की कोशिश करते हैं। इसे एक हाई-डेफिनिशन मूवी को कम रिज़ॉल्यूशन वाली फ़ाइल में कंप्रेस करने जैसा समझें ताकि जगह बचाई जा सके।

हालाँकि, जब आप इन विशिष्ट "संपादक" मॉडलों को बहुत अधिक छोटा करने की कोशिश करते हैं (बहुत कम प्रिसिजन, जैसे 4-बिट का उपयोग करके), तो वे भयानक गलतियाँ करने लगते हैं। यह पेपर पहचानता है कि ऐसा क्यों होता है, जिसके दो विशिष्ट कारण हैं:

1. "भ्रमित भीड़" की समस्या (State-Dependent Disparity)

एक संपादक मॉडल में, कुछ शब्द पहले से लिखे हुए (दृश्यमान) होते हैं, और कुछ अभी भी खाली (मास्क्ड) होते हैं।

  • उपमा: एक कक्षा की कल्पना करें। जिन छात्रों ने हाथ ऊपर किए हुए हैं (वे "मास्क्ड" शब्द जो अनुमान लगाने का इंतज़ार कर रहे हैं) वे घबराए हुए हैं और शोर मचा रहे हैं। जो छात्र शांति से बैठे हैं और जिनके उत्तर लिखे जा चुके हैं (अनमास्क्ड शब्द) वे शांत हैं।
  • समस्या: यदि आप दोनों प्रकार के छात्रों के लिए एक ही "शांत करने वाला नियम" उपयोग करने की कोशिश करते हैं, तो यह विफल हो जाता है। शोर मचाने वाले छात्रों को शांत बैठे छात्रों की तुलना में एक अलग दृष्टिकोण की आवश्यकता होती। मानक कंप्रेशन टूल्स सभी के साथ एक जैसा व्यवहार करते हैं, जिससे "शोर मचाने वाले" डेटा में विकृति आ जाती है।

2. "फुसफुसाने का खेल" की समस्या (Temporal Error Accumulation)

संपादक चरणों (steps) में काम करता है। वह एक अनुमान लगाता है, फिर उस अनुमान का उपयोग अपने अगले अनुमान के लिए करता है।

  • उपमा: "टेलीफोन" (Telephone) खेल के बारे में सोचें। आप अगले व्यक्ति को एक संदेश फुसफुसाते हैं, जो अगले व्यक्ति को फुसफुसाता है। यदि पहला व्यक्ति थोड़ा गलत फुसफुसाता है, तो अंत तक पहुँचते-पहुँचते त्रुटि बढ़ती जाती है।
  • समस्या: इन मॉडलों में, संपादन के पहले चरण में की गई छोटी सी गलती अगले हर चरण में पास की जाती है और बढ़ जाती है। जब तक मॉडल कहानी पूरी करता है, कहानी बिगड़ चुकी होती है क्योंकि त्रुटियां समय के साथ जमा हो जाती हैं।

समाधान: STaR-Quant

लेखकों ने इन दो समस्याओं को हल करने के लिए STaR-Quant नामक एक नया टूलकिट प्रस्तावित किया है। इसका अर्थ है State-Time Reconsistent Quantization।

समाधान #1: SGAT (एक "स्मार्ट सॉर्टिंग हैट")

"भ्रमित भीड़" की समस्या को हल करने के लिए, उन्होंने State-Guided Activation Transformation (SGAT) का आविष्कार किया।

  • यह कैसे काम करता है: सभी शब्दों के साथ एक जैसा व्यवहार करने के बजाय, SGAT एक स्मार्ट सॉर्टिंग हैट की तरह काम करता है। यह तुरंत पहचान लेता है कि कोई शब्द "मास्क्ड" (शोर मचा रहा) है या "अनमास्क्ड" (शांत है)।
  • जादू: यह "शोर मचाने वाले" शब्दों को सुचारू बनाने के लिए एक रास्ते पर भेजता है और "शांत" शब्दों को दूसरे रास्ते पर। महत्वपूर्ण बात यह है कि वे अभी भी एक ही भारी काम (weights) साझा करते हैं, इसलिए मॉडल बड़ा नहीं होता। यह सुनिश्चित करता है कि दोनों प्रकार के शब्दों को डेटा को विकृत किए बिना सटीक रूप से कंप्रेस किया जाए।

समाधान #2: TAC (एक "त्रुटि सुधारक")

"फुसफुसाने के खेल" की समस्या को हल करने के लिए, उन्होंने Temporal Attention Compensation (TAC) का आविष्कार किया।

  • यह कैसे काम करता है: हर बार जब मॉडल संपादन का एक चरण पूरा करता है, तो TAC एक फैक्ट-चेकर (तथ्य-जांचकर्ता) की तरह आता है। यह "अटेंशन" (मॉडल का वह हिस्सा जो तय करता है कि कौन से शब्द सबसे महत्वपूर्ण हैं) को देखता है और जाँचता है कि क्या कंप्रेस्ड संस्करण उस पूर्ण, उच्च-गुणवत्ता वाले संस्करण जैसा है जैसा कि वह होना चाहिए था।
  • जादू: यदि कोई विचलन या त्रुटि होती है, तो TAC अगले चरण पर जाने से पहले उसे ठीक करने के लिए एक त्वरित, हल्का गणितीय "ट्वीक" (सुधार) लागू करता है। यह रोकता है कि त्रुटियां कहानी आगे बढ़ने के साथ बढ़ती रहें।

परिणाम: तेज़, छोटा और स्मार्ट

टीम ने तीन लोकप्रिय "संपादक" मॉडलों (LLaDA और Dream) पर परीक्षण किया। यहाँ हुआ:

  • सटीकता (Accuracy): जब उन्होंने मॉडलों को बहुत छोटा (4-bit) कंप्रेस किया, तो STaR-Quant ने पिछले तरीकों की तुलना में मॉडलों को बहुत अधिक स्मार्ट बनाए रखा। यह सामान्य ज्ञान, गणित और कोड लिखने में बेहतर था।
  • गति (Speed): क्योंकि मॉडल कुशलतापूर्वक कंप्रेस किए गए थे, वे मूल उच्च-गुणवत्ता वाले संस्करणों की तुलना में 1.69 गुना तेज़ चले।
  • मेमोरी (Memory): मॉडलों ने 3.14 गुना कम मेमोरी ली।
    • वास्तविक दुनिया का प्रभाव: एक मॉडल जिसे चलने के लिए पहले 16GB कंप्यूटर मेमोरी की आवश्यकता थी, अब लगभग 5GB में आसानी से फिट हो जाता है, जिससे इसे छोटे उपकरणों पर चलाना संभव हो जाता है।

सारांश

STaR-Quant शक्तिशाली "संपादक" AI मॉडलों को सिकोड़ने का एक नया तरीका है ताकि वे रोजमर्रा के उपकरणों पर चल सकें। यह इस बात को समझते हुए काम करता है कि "अनुमान लगाने" वाले शब्दों और "पढ़ने" वाले शब्दों को अलग-अलग हैंडलिंग की आवश्यकता होती है, और यह छोटी गलतियों को बड़ी बनने से पहले लगातार ठीक करता है। परिणाम एक ऐसा मॉडल है जो तेज़, छोटा और आश्चर्यजनक रूप से सटीक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →