← नवीनतम पेपर
🤖 machine learning

Max-Window Scale Estimation for Near-Lossless HiF8 W8A8 Quantization-Aware Training

यह शोध पत्र एक मैक्स-विंडो स्केल एस्टीमेशन रणनीति और एक BF16 वॉर्मअप शेड्यूल को पेश करके HiF8 W8A8 क्वांटाइजेशन-अवेयर ट्रेनिंग में दो विशिष्ट विफलता मोड—amax सैचुरेशन और कैटास्ट्रोफिक फॉरगेटिंग—की पहचान और समाधान करता है, जिससे OpenPangu-Embedded-1B मॉडल पर लगभग लॉसलेस प्रदर्शन प्राप्त होता है।

मूल लेखक: Yingying Cheng, Jinquan Shi, Li Zhou, Zhiyang He, Zhaoyi Sun, Fan Zhang, Jie Sun

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yingying Cheng, Jinquan Shi, Li Zhou, Zhiyang He, Zhaoyi Sun, Fan Zhang, Jie Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान और विद्वान लाइब्रेरियन (AI मॉडल) है, जिसने वर्षों तक किताबों के एक विशाल पुस्तकालय को याद करने में बिताए हैं। अब, आप इस विशाल पुस्तकालय को इतना छोटा करना चाहते हैं कि यह एक छोटे, पोर्टेबल बैकपैक (एक लो-पावर डिवाइस) में समा जाए, बिना इसके अंदर की कहानियों या तथ्यों को खोए। इस प्रक्रिया को क्वांटाइजेशन (Quantization) कहा जाता है।

इस शोध पत्र में एक विशिष्ट प्रयोग का वर्णन किया गया है जहाँ शोधकर्ताओं ने एक नए, कॉम्पैक्ट फॉर्मेट जिसे HiF8 (हाई-प्रिसिजन फ्लोट 8) कहा जाता है, का उपयोग करके 1-बिलियन पैरामीटर वाले AI मॉडल को छोटा करने का प्रयास किया। सोचिए कि HiF8 एक "स्मार्ट कंप्रेशन" की तरह है जो बाकी हिस्सों को कंप्रेस करते हुए भी सबसे महत्वपूर्ण विवरणों को स्पष्ट रखता है।

हालाँकि, शोधकर्ताओं ने पाया कि केवल लाइब्रेरी को छोटा करना ही काफी नहीं था। उन्होंने पाया कि दो छिपे हुए "जाल" (traps) थे जो मॉडल की याददाश्त को बर्बाद कर सकते थे, भले ही कागज़ पर प्रशिक्षण प्रक्रिया एकदम सही दिख रही हो।

यहाँ उनकी यात्रा का विवरण दिया गया है, जिसे सरल भाषा में समझाया गया है:

दो छिपे हुए जाल

1. "ब्लाइंड स्पॉट" (Blind Spot) का जाल (Amax Saturation)
कल्पना कीजिए कि लाइब्रेरियन किताबों को शेल्फ पर व्यवस्थित करने की कोशिश कर रहा है, लेकिन वह एक ऐसे रूलर (पैमाने) का उपयोग कर रहा है जो थोड़ा छोटा है।

  • समस्या: AI को यह जानने की आवश्यकता होती है कि वह जो नंबर देख रहा है उनमें सबसे "तेज़" या "बड़ा" क्या है, ताकि वह कंप्रेशन के लिए स्केल निर्धारित कर सके। शोधकर्ताओं ने डिलेड टेंसर स्केलिंग (Delayed Tensor Scaling - DTS) नामक विधि का उपयोग किया। यह ऐसा है जैसे लाइब्रेरियन वर्तमान किताब का आकार अनुमान लगाने के लिए पिछली किताब को देखता है।
  • विफलता: यदि वर्तमान किताब अचानक बहुत बड़ी (एक "स्पाइक") हो जाती है, तो लाइब्रेरियन का अनुमान (जो पिछली किताब पर आधारित था) बहुत छोटा होता है। परिणामतः, किताब "क्लिप" हो जाती है या शेल्फ के किनारे पर कट जाती है।
  • चालाकी: AI का आंतरिक "स्कोरकार्ड" (ट्रेनिंग लॉस) यह नहीं दिखा रहा था कि ऐसा हो रहा है। यह ऐसा था जैसे लाइब्रेरियन कह रहा हो, "मैं ठीक से व्यवस्थित कर रहा हूँ!" जबकि वह गुप्त रूप से किताबों के पन्ने फाड़ रहा था। यह नुकसान बाद में तब दिखाई दिया जब उन्होंने विशिष्ट क्विज़ (जैसे ARC या MMLU) पर लाइब्रेरियन के ज्ञान का परीक्षण किया।

2. "अति-उत्साही छात्र" (Over-Eager Student) का जाल (Catastrophic Forgetting)
कल्पना कीजिए कि लाइब्रेरियन किताबों के एक नए सेट से नई कहानियाँ सीखने के लिए इतना उत्सुक है कि वह नई जगह बनाने के लिए पुरानी क्लासिक्स को अपनी याददाश्त से मिटाना शुरू कर देता है।

  • समस्या: शोधकर्ता मॉडल को एक "लर्निंग रेट" (सीखने की गति) के साथ सिखा रहे थे जो बहुत आक्रामक थी।
  • विफलता: मॉडल नए डेटा को इतनी तेज़ी से सीख रहा था कि वह उस सामान्य ज्ञान और तथ्यों को पूरी तरह भूल गया जो उसने अपने मूल प्रशिक्षण के दौरान सीखे थे।
  • चालाकी: यह कंप्रेशन के बिना भी हुआ था। यदि वे केवल सामान्य रूप से इस उच्च गति पर मॉडल को प्रशिक्षित करते, तो भी यह सब कुछ भूल जाता। लेकिन क्योंकि वे मॉडल को कंप्रेस भी कर रहे थे, इसलिए उन्होंने विफलता के लिए कंप्रेशन को जिम्मेदार ठहराया, न कि सीखने की गति को।

समाधान: दो-चरणीय सुधार

शोधकर्ताओं ने इन जालों को ठीक करने के लिए आठ अलग-अलग प्रयोग चलाए। उन्होंने पाया कि केवल एक को ठीक करना पर्याप्त नहीं था; उन्हें दोनों को एक साथ ठीक करना था।

सुधार #1: "सुरक्षा जाल" (Max-Window Strategy)
"ब्लाइंड स्पॉट" को रोकने के लिए, उन्होंने किताबों के आकार का अनुमान लगाने के तरीके को बदल दिया।

  • केवल पिछली किताब को देखने के बजाय, उन्होंने लाइब्रेरियन को पिछले 64 किताबों में देखे गए सबसे बड़े आकार को देखने के लिए कहा।
  • यह एक "रूढ़िवादी" (conservative) दृष्टिकोण है। यह शेल्फ को आवश्यक से थोड़ा बड़ा बनाता है (थोड़ा अधिक सुरक्षित), लेकिन यह गारंटी देता है कि कोई भी किताब कभी कटेगी नहीं। यह छोटा सा "अतिरिक्त स्थान" वास्तव में मॉडल को स्थिर रहने में मदद करता है, जो एक सौम्य रेगुलराइज़र (regularizer) की तरह काम करता है।

सुधार #2: "कूल-डाउन" (Warmup and Slower Learning)
"अति-उत्साही छात्र" को रोकने के लिए, उन्होंने प्रशिक्षण कार्यक्रम को बदल दिया।

  • वॉर्मअप (Warmup): पहले 500 स्टेप्स के लिए, उन्होंने मॉडल को कंप्रेस नहीं किया। उन्होंने इसे अपने पूर्ण, उच्च-गुणवत्ता वाले फॉर्मेट (BF16) में नए डेटा के साथ सहज होने दिया। इसने मॉडल को "बैकपैक" कंप्रेशन लागू होने से पहले एक स्थिर अवस्था में सेट होने दिया।
  • धीमा होना (Slow Down): उन्होंने सीखने की गति को बहुत कम कर दिया (लर्निंग रेट को कम किया)। इसने मॉडल को नए डेटा के साथ अपने पुराने, मूल्यवान ज्ञान को तेज़ी से ओवरराइट करने से रोका।

परिणाम

जब उन्होंने इन दोनों सुधारों को मिलाया, तो परिणाम लगभग लॉसलेस (near-lossless) रहा।

  • कंप्रेस्ड मॉडल (HiF8) अनकंप्रेस्ड, फुल-साइज़ मॉडल के समान ही प्रदर्शन करता है।
  • कठिन क्विज़ पर प्रदर्शन में गिरावट बहुत मामूली थी (ज्यादातर मामलों में 0.5% से भी कम)।
  • महत्वपूर्ण रूप से, उन्होंने साबित किया कि यदि आप केवल "सुरक्षा जाल" का उपयोग करते लेकिन "अति-उत्साही" गति रखते, तो मॉडल फिर भी विफल हो जाता। और यदि आप गति को धीमा करते लेकिन "ब्लाइंड स्पॉट" रूलर को रखते, तो भी यह विफल हो जाता। दोनों सुधार आवश्यक थे।

क्या काम नहीं आया (और क्यों)

  • केवल पिछले बुक को देखना: इससे किताबें कट जाती थीं।
  • अनुमान को स्मूथ करना (Smoothing the guess): पिछले किताबों का औसत निकालने की कोशिश की गई, लेकिन जब डेटा अप्रत्याशित रूप से बदला, तो यह विफल रहा।
  • वर्तमान बुक को तुरंत चेक करना: इसके लिए डेटा को दोबारा देखने की आवश्यकता थी, जो बहुत धीमा था और शेल्फ के आकार को बहुत अधिक ऊपर-नीचे कर रहा था, जिससे मॉडल भ्रमित हो रहा था।
  • उच्च-गति प्रशिक्षण: कंप्रेशन के बिना भी, इसने मॉडल को सब कुछ भुला दिया।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र हमें सिखाता है कि जब आप एक स्मार्ट AI मॉडल को छोटा कर रहे हों, तो आप केवल "ट्रेनिंग स्कोर" को देखकर यह नहीं जान सकते कि यह काम कर रहा है या नहीं। आपको इस बात का ध्यान रखना होगा कि आप डेटा को कैसे मापते हैं (क्लिपिंग से बचने के लिए) और आप उसे कितनी तेज़ी से सिखाते हैं (भूलने से बचने के लिए)। डेटा के आकार के लिए "सुरक्षा जाल" और सीखने की "धीमी, स्थिर" गति का उपयोग करके, आप एक विशाल मस्तिष्क को उसके विवेक को खोए बिना एक छोटे बैकपैक में फिट कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →