← नवीनतम पेपर
🤖 AI

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

यह शोध पत्र गैर-समान (non-uniform) E2M1 FP4 प्रारूपों में एक मौलिक "श्रिंकेज बायस" (Shrinkage Bias) की पहचान करता है जो प्रशिक्षण अस्थिरता का कारण बनता है, और UFP4 प्रस्तावित करता है, जो एक समान 4-बिट (E1M2/INT4) प्रशिक्षण रेसिपी है जो मौजूदा E2M1-आधारित दृष्टिकोणों की तुलना में विभिन्न मॉडल स्केल्स पर बेहतर प्रीट्रेनिंग प्रदर्शन प्राप्त करने के लिए रैंडम हैडामार्ड ट्रांसफॉर्म (Random Hadamard Transform) का लाभ उठाती है।

मूल लेखक: Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

प्रकाशित 2026-06-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अविश्वसनीय रूप से जटिल लेगो (LEGO) किला बनाने की कोशिश कर रहे हैं (एक लार्ज लैंग्वेज मॉडल)। निर्माण को तेज़ और सस्ता बनाने के लिए, आप मानक, भारी और सटीक ईंटों का उपयोग करना बंद करने और एक नए, अत्यंत हल्के और छोटे 4-बिट ईंटों के सेट पर स्विच करने का निर्णय लेते हैं।

समस्या यह है कि वर्तमान "मानक" हल्के ईंटों (जिन्हें E2M1 कहा जाता है) का आकार थोड़ा अजीब और असंतुलित है। इस पेपर के लेखकों ने खोजा कि इन ईंटों में एक छिपा हुआ दोष है: ये हर बार उपयोग किए जाने पर चीजों को थोड़ा छोटा कर देते हैं।

इस खोज और समाधान का विवरण यहाँ दिया गया, जिसे सरल भाषा में समझाया गया है:

1. समस्या: "सिकुड़ने वाली" ईंटें

मानक E2M1 ईंटों को असमान अंतराल वाली ईंटों के रूप में सोचें। कुछ अंतराल बहुत छोटे हैं, जबकि अन्य बहुत बड़े हैं।

  • दोष: इस असमान अंतराल के कारण, जब आप डेटा के एक टुकड़े को इन ईंटों में फिट करने की कोशिश करते हैं, तो गणित उसे ऊपर की ओर राउंड करने के बजाय थोड़ा नीचे की ओर राउंड करने के लिए मजबूर करता है।
  • परिणाम: यह एक "सिकुड़ने वाला पूर्वाग्रह" (Shrinkage Bias) पैदा करता है। यह एक लीक होती बाल्टी की तरह है; हर बार जब आप मॉडल के एक लेयर (परत) के माध्यम से एक संदेश भेजते हैं, तो संदेश थोड़ा छोटा और कमजोर हो जाता है।
  • संचयी प्रभाव (Compounding Effect): सैकड़ों परतों वाले एक गहरे मॉडल में, यह मामूली सिकुड़न बार-बार होती है। जब तक संदेश अंत तक पहुँचता है, वह इतना सिकुड़ चुका होता है कि मॉडल अपना नियंत्रण खोने लगता है (ट्रेनिंग अस्थिर हो जाती है)।

2. "जादुई घुमाव" जिसने इसे और खराब कर दिया

इंजीनियरों ने डेटा के बहुत बड़ा या अजीब (आउटलेयर्स) होने की समस्या को ठीक करने के लिए एक ट्रिक का उपयोग किया जिसे रैंडम हैडामार्ड ट्रांसफॉर्म (RHT) कहा जाता है।

  • उपमा: कल्पना करें कि आपके पास रेत का एक ढेर है जहाँ अधिकांश रेत एक बड़े टीले के रूप में है (आउटलेयर्स)। RHT एक मिक्सर की तरह है जो रेत को चारों ओर घुमाता है ताकि वह पूरी ट्रे में समान रूप से फैल जाए।
  • टकराव: जब आप रेत को मिलाते हैं (RHT) और फिर उसे इन असंतुलित E2M1 ईंटों में डालने की कोशिश करते हैं, तो रेत सबसे खराब अंतराल में जाकर गिरती है। ये असमान अंतराल वाली ईंटें मिश्रित रेत को पकड़ लेती हैं और उसे पहले की तुलना में और भी अधिक सिकोड़ देती हैं। पेपर ने पाया कि यह मानक रेसिपी इस मिक्सर का उपयोग करके "लीकी बकेट" (लीक होती बाल्टी) की समस्या को और भी बदतर बना देती है।

3. समाधान: "समान" ईंटें (UFP4)

लेखक एक नया नुस्खा प्रस्तावित करते हैं जिसे UFP4 कहा जाता है। असंतुलित E2M1 ईंटों का उपयोग करने के बजाय, वे एक नया सेट उपयोग करते हैं जिसे E1M2/INT4 कहा जाता है।

  • अंतर: ये नई ईंटें पूरी तरह से समान (uniform) हैं। इनके बीच के अंतराल बिल्कुल एक समान आकार के हैं।
  • यह क्यों काम करता है: क्योंकि अंतराल समान हैं, इसलिए कोई "सिकुड़ने वाला पूर्वाग्रह" नहीं है। जब "मिश्रित रेत" (RHT डेटा) इन समान ईंटों में गिरती है, तो यह बिना किसी आकार के नुकसान के बिल्कुल फिट बैठ जाती है।
  • रणनीति: इन नई समान ईंटों के साथ, लेखकों ने महसूस किया कि वे निर्माण प्रक्रिया के हर हिस्से (फॉरवर्ड पास, बैकवर्ड पास और वेट अपडेट्स) पर सुरक्षित रूप से "मिक्सर" (RHT) का उपयोग कर सकते हैं। पहले, उन्हें सावधान रहना पड़ता था और मिक्सर का उपयोग केवल एक ही जगह पर करना पड़ता था ताकि मॉडल टूट न जाए। अब, वे इसे हर जगह उपयोग कर सकते हैं।

4. प्रमाण

टीम ने तीन अलग-अलग आकारों के AI मॉडलों (छोटे, मध्यम और विशाल) पर इस नए नुस्खे का परीक्षण किया।

  • परिणाम: UFP4 (समान ईंटों) के साथ बनाए गए मॉडल, पुराने E2M1 (असंतुलित ईंटों) से बने मॉडलों की तुलना में, भारी और मानक (BF16) ईंटों के प्रदर्शन के बहुत करीब रहे।
  • निष्कर्ष: समान ग्रिड (grid) मॉडल को अपने सिग्नल को खोए बिना लंबे समय तक और अधिक स्थिरता के साथ प्रशिक्षित होने की अनुमति देता है।

सारांश

यह पेपर तर्क देता है कि उद्योग एक लीक होती बाल्टी को पैच (मरम्मत) करने की कोशिश कर रहा है, लेकिन बाल्टी का आकार ही गलत है। एक ऐसी बाल्टी में स्विच करके जिसमें बिल्कुल समान अंतराल हो (यूनिफॉर्म ग्रिड), वे आखिरकार उन शक्तिशाली मिक्सिंग टूल्स (RHT) का उपयोग कर सकते हैं जो पहले बहुत खतरनाक थे, जिससे AI ट्रेनिंग तेज़, सस्ती और अधिक स्थिर हो जाती है।

मुख्य बात: पुराने, असंतुलित 4-बिट फॉर्मेट को केवल पैच न करें; सिग्नल को सिकुड़ने से रोकने के लिए एक नए, समान 4-बिट फॉर्मेट पर स्विच करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →