← नवीनतम पेपर
💬 NLP

Depth Registers Unlock W4A4 on SwiGLU: A Reader/Generator Decomposition

यह शोध पत्र यह प्रदर्शित करता है कि एक 300M-पैरामीटर वाले SwiGLU मॉडल में 'रीडर' (reader) घटकों को स्थिर करके अवशिष्ट-अक्ष (residual-axis) सक्रियणों को नियंत्रित करने के लिए प्रशिक्षण-समय के "डेप्थ रजिस्टर्स" (Depth Registers) हस्तक्षेप को लागू करने से W4A4 क्वांटाइजेशन त्रुटि में भारी कमी आती है, फिर भी यह प्रकट करता है कि शेष प्रदर्शन अंतराल मौलिक रूप से अनबाउंडेड "जेनरेटर" (generator) द्वैरेखीय अंतःक्रियाओं (bilinear interactions) के कारण है जिन्हें ऑर्थोगोनल रोटेशन हल नहीं कर सकते।

मूल लेखक: Ziyang Liu

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल लाइब्रेरी (एक लार्ज लैंग्वेज मॉडल) को सिकोड़ने की कोशिश कर रहे हैं ताकि वह एक छोटे से बैकपैक (एक मानक कंप्यूटर चिप) में समा सके, बिना किताबों के अर्थ खोए। इस प्रक्रिया को क्वांटाइजेशन (quantization) कहा जाता है।

जो शोध पत्र आपने साझा किया है, वह एक विशिष्ट, कठिन चुनौती के बारे में है: लाइब्रेरी को 4-बिट आकार तक सिकोड़ना (बहुत छोटा) जबकि किताबों को पठनीय बनाए रखना।

यहाँ उनकी खोज की कहानी है, जिसे सरल उपमाओं के साथ समझाया गया है।

1. समस्या: "सिकुड़ने" की आपदा

जब शोधकर्ताओं ने अपने मॉडल को मानक, "नाइव" (naive) विधि का उपयोग करके सिकोड़ने की कोशिश की (बस संख्याओं को निकटतम फिट के लिए राउंड करना), तो लाइब्रेरी ढह गई।

  • सिकुड़ने से पहले: मॉडल सुरीला और बुद्धिमान था (परप्लेक्सिटी स्कोर 23.6)।
  • नाइव सिकुड़ने के बाद: मॉडल बड़बड़ाने लगा, बेतुकी बातें करने लगा (परप्लेक्सिटी स्कोर 1727)।

यह एक हाई-डेफिनिशन 4K मूवी को एक छोटे टेक्स्ट फ़ाइल में फिट करने की कोशिश करने जैसा था; परिणाम केवल स्टैटिक (static) था।

2. निदान: दो प्रकार के कार्यकर्ता

शोधकर्ताओं ने महसूस किया कि मॉडल केवल संख्याओं का एक ढेर नहीं है। मॉडल के हर "ब्लॉक" के अंदर, सूचना संभालने के लिए दो अलग-अलग प्रकार के कार्यकर्ता होते हैं:

  • पाठक (लाइब्रेरियन): ये कार्यकर्ता (q_kv, w1, w3) मुख्य गलियारे (रेसिडुअल स्ट्रीम) से सीधे जानकारी लेते हैं। वे देखते हैं कि क्या आ रहा है।
    • उपमा: इन्हें उस व्यक्ति के रूप में सोचें जो उन्हें थमाए गए समाचार पत्र को पढ़ रहा है। यदि आप समाचार पत्र के आकार को नियंत्रित करते हैं, तो आप नियंत्रित करते हैं कि वे क्या पढ़ते हैं।
  • जनरेटर (शेफ/रसोइया): ये कार्यकर्ता (o_proj, w2) कमरे के अंदर बनाई गई जानकारी लेते हैं।
    • द "शेफ" (w2): यह समस्या पैदा करने वाला है। यह दो सामग्रियों (अन्य कार्यकर्ताओं के आउटपुट) को लेता है और उन्हें आपस में गुणा (multiply) करता है ताकि एक नया व्यंजन बनाया जा सके।
    • उपमा: यदि आपके पास नमक की एक चुटकी और काली मिर्च की एक चुटकी है, तो उन्हें गुणा करने से थोड़ा सा मसाला नहीं बनता; यह एक विशाल, अत्यधिक प्रभाव वाला विस्फोट पैदा कर सकता है। यह "गुणा" डेटा के बड़े स्पाइक्स (उछाल) बनाता है जो 4-बिट सिकुड़ने की प्रक्रिया को तोड़ देते हैं।

3. समाधान: "डेप्थ रजिस्टर" (एक सुरक्षा वाल्व)

शोधकर्ताओं ने डेप्थ रजिस्टर + सिंक लॉस (DR+sink) नामक एक प्रशिक्षण ट्रिक का आविष्कार किया।

  • सेटअप: उन्होंने मुख्य गलियारे में एक विशेष "ओवरफ्लो बाल्टी" (रजिस्टर) जोड़ी।
  • नियम: उन्होंने मॉडल को बताया, "यदि संख्याएं बहुत बड़ी हो जाती हैं, तो उन्हें गलियारे को बाढ़ से बचाने के बजाय इस बाल्टी में डाल दें।"
  • परिणाम:
    • पाठक (लाइब्रेरियन) अचानक शांत हो गए। "बाल्टियों" ने सभी पागलपन भरे स्पाइक्स को पकड़ लिया। पाठक बहुत स्थिर हो गए, और मॉडल का प्रदर्शन 1727 से वापस 119 पर आ गया।
    • जनरेटर (शेफ), हालांकि, अभी भी अपने आंतरिक तत्वों के साथ खाना बना रहे थे। बाल्टी ने शेफ को अपनी दो बड़ी संख्याओं को गुणा करने से नहीं रोका।

4. बड़ी खोज: "शेफ" ही असली समस्या है

यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है।

भले ही उन्होंने पाठकों को पूरी तरह से ठीक कर दिया था, फिर भी मॉडल अपने मूल पूर्णता (23.6) तक वापस नहीं पहुँच सका। यह 39.9 (या 119 यदि उन्होंने अन्य ट्रिक्स का उपयोग नहीं किया) पर अटक गया।

क्यों? क्योंकि शेफ (w2) अभी भी संख्याओं को इस तरह से गुणा कर रहा था जिससे "विस्फोट" पैदा हो रहे थे जिन्हें 4-बिट फॉर्मेट संभाल नहीं सकता था।

  • उपमा: कल्पना करें कि आपने डिलीवरी ट्रकों (पाठकों) को ठीक कर दिया है ताकि वे बिल्कुल समय पर पहुँचें। लेकिन इसके अंदर की फैक्ट्री (शेफ) अभी भी ऐसे रसायन मिला रही है जो विस्फोट करते हैं। चाहे ट्रक कितनी भी अच्छी तरह से आएँ, फैक्ट्री अभी भी फट रही है।
  • प्रमाण: उन्होंने सामग्री को घुमाने (एक विधि जिसे QuaRot कहा जाता है) के माध्यम से शेफ को ठीक करने की कोशिश की, लेकिन यह काम नहीं आया। आप केवल एक गुणा विस्फोट को "रोटेट" करके दूर नहीं कर सकते; गणित कहता है कि विस्फोट गुणा (multiplication) के भीतर ही निहित है।

5. निष्कर्ष (Takeaway)

यह शोध पत्र हमें तीन मुख्य बातें सिखाता है:

  1. निदान: मॉडल को सिकोड़ने से होने वाला अधिकांश नुकसान "पाठकों" (इनपुट) से आता है। उन्हें ठीक करने से आप 90% तक पहुँच जाते हैं।
  2. कठोर सीमा: शेष 10% नुकसान "शेफ" (मॉडल के अंदर का गुणा) से आता है। यह एक "बाइलीनियर टेल" (bilinear tail) है—एक गणितीय विस्फोट जो सिकुड़ने के लिए बहुत कठिन है।
  3. भविकी: पूर्ण 4-बिट मॉडल प्राप्त करने के लिए, हम केवल मानक ट्रिक्स का उपयोग नहीं कर सकते। हमें "शेफ" के साथ अलग तरह से व्यवहार करने की आवश्यकता है, शायद उसे एक बड़ा बैकपैक (मिक्स्ड प्रिसिजन) देने की या उसे विस्फोट को संभालने के लिए विशेष रूप से प्रशिक्षित करने की (क्वांटाइजेशन अवेयर ट्रेनिंग)।

संक्षेप में:
शोधकर्ताओं ने एक "सुरक्षा वाल्व" बनाया जिसने मॉडल को सिकुड़ने पर क्रैश होने से रोक दिया। उन्होंने पाया कि जबकि सुरक्षा वाल्व ने इनपुट की समस्याओं को ठीक कर दिया, मॉडल के भीतर का आंतरिक गुणा अभी भी एक अनियंत्रित तत्व है जो मानक सिकुड़ने की तकनीकों द्वारा वश में होने से इनकार करता है। उन्होंने पूरा पहेली हल नहीं की, लेकिन उन्होंने अंततः यह पता लगा लिया कि कौन सा हिस्सा गायब है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →