← नवीनतम पेपर
🤖 machine learning

Data Predictability Shapes Weibull Weight-Scale Growth in Transformer Training

यह शोध पत्र यह स्थापित करता है कि प्रशिक्षण के दौरान ट्रांसफार्मर वेट स्केल्स (transformer weight scales) का विकास डेटा प्रेडिक्टेबिलिटी (data predictability) के एक पूर्व-गणना किए गए, ट्रेनिंग-मुक्त सांख्यिकीय मान (bigram conditional entropy) द्वारा पूर्वानुमानित रूप से नियंत्रित होता है, जो एक विशिष्ट पावर-लॉ (power-law) संबंध का अनुसरण करता है और विभिन्न लर्निंग रेट्स और आर्किटेक्चर के बीच वेट मैग्नीट्यूड (weight magnitude) में होने वाले परिवर्तनों के सटीक फॉरवर्ड प्रेडिक्शन की अनुमति देता है।

मूल लेखक: Tiexin Ding

प्रकाशित 2026-08-26
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tiexin Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस के विशाल परिदृश्य में, सबसे शक्तिशाली उपकरण लार्ज लैंग्वेज मॉडल्स हैं, जिन्हें अक्सर ट्रांसफॉर्मर कहा जाता है। ये सिस्टम भारी मात्रा में टेक्स्ट पढ़कर और अरबों आंतरिक संख्याओं, जिन्हें 'वेट्स' (weights) कहा जाता है, को समायोजित करके सीखते हैं, ताकि वे अगले शब्द के बारे में बेहतर भविष्यवाणी कर सकें। वर्षों से, शोधकर्ताओं ने इन आंतरिक संख्याओं को एक 'ब्लैक बॉक्स' की तरह माना है: वे जानते हैं कि प्रशिक्षण के दौरान ये संख्याएँ बदलती हैं, लेकिन वे यह समझने में संघर्ष करते रहे हैं कि पढ़े जा रहे टेक्स्ट की प्रकृति उन परिवर्तनों को वास्तव में कैसे आकार देती है। एक प्रमुख प्रश्न अनुत्तरित रह गया था: क्या टेक्स्ट की स्वयं की पूर्वानुमेयता (predictability) यह निर्धारित करती है कि मॉडल की आंतरिक संख्याएँ कितनी बढ़ेंगी या बदलेंगी? यदि एक मॉडल एक अत्यधिक संरचित, पूर्वानुमेय कहानी बनाम शब्दों के एक अराजक, यादृच्छिक मिश्रण को पढ़ता है, तो क्या यह अंतर मशीन के भीतर की संख्याओं के आकार में दिखाई देता है?

स्वतंत्र शोधकर्ता तिएक्सिन डिंग (Tiexin Ding) द्वारा किए गए एक नए अध्ययन ने इस प्रश्न का एक आश्चर्यजनक सटीकता के साथ उत्तर दिया है। शोधकर्ता ने खोजा कि इन आंतरिक संख्याओं की वृद्धि पूरी तरह से एक एकल गुण पर आधारित एक सख्त, पूर्वानुमेय पैटर्न का पालन करती है: कि पिछले शब्द के आधार पर अगले शब्द का अनुमान लगाना कितना आसान है। टेक्स्ट के एक विशिष्ट प्रकार के भ्रष्टाचार (corruption) का विश्लेषण करके, अध्ययन में पाया गया कि टेक्स्ट जितना अधिक पूर्वानुमेय होगा, मॉडल के आंतरिक नंबर एक विशिष्ट, मापने योग्य तरीके से उतने ही अधिक विस्तारित होंगे। यह संबंध प्रशिक्षण के दौरान उपयोग की जाने वाली सीखने की गति (learning speed) से स्वतंत्र है, जो एक मौलिक नियम का सुझाव देता है जो कच्चे डेटा को मशीन की आंतरिक संरचना से जोड़ता है।

शोध एक प्रशिक्षित मॉडल के भीतर की संख्याओं के आकार के बारे में एक सरल अवलोकन से शुरू हुआ। जब शोधकर्ताओं ने मॉडल के विभिन्न परतों (layers) में इन संख्याओं के आकार को देखा, तो उन्होंने पाया कि वे एक सुसंगत पैटर्न का पालन करते हैं जिसे वेबुल वितरण (Weibull distribution) कहा जाता है। यह पैटर्न दो मानों द्वारा परिभाषित है: एक 'शेप फैक्टर' (shape factor) जो उल्लेखनीय रूप से स्थिर रहता है, और एक 'स्केल फैक्टर' (scale factor) जो प्रशिक्षण के साथ बदलता है। स्थिर शेप का अर्थ है कि मॉडल की आंतरिक संरचना सुसंगत रहती है, जबकि बदलता हुआ स्केल फैक्टर एक डायल की तरह कार्य करता है जो प्रशिक्षण के आधार पर ऊपर या नीचे घूमता है। अध्ययन ने इसी स्केल फैक्टर पर ध्यान केंद्रित किया, और यह पूछा कि इसे बढ़ने के लिए क्या प्रेरित करता है।

उत्तर खोजने के लिए, शोधकर्ता ने एक मानक टेक्स्ट डेटासेट का उपयोग करके एक नियंत्रित प्रयोग डिजाइन किया। विभिन्न पुस्तकों या विषयों पर प्रशिक्षण देने के बजाय, शोधकर्ता ने टेक्स्ट को समान रखा लेकिन उसे व्यवस्थित रूप से अस्त-व्यस्त (scramble) कर दिया। उन्होंने टेक्स्ट के एक अंश को शब्दों के क्रम में उलट-पुलट दिया, जिससे पूरी तरह से व्यवस्थित से लेकर पूरी तरह से अराजक तक के डेटासेट्स का एक स्पेक्ट्रम तैयार हुआ। किसी भी मॉडल को प्रशिक्षित करने से पहले, उन्होंने प्रत्येक संस्करण के लिए एक विशिष्ट सांख्यिकी मापी: पिछले एक शब्द के आधार पर अगले शब्द का अनुमान लगाने की औसत कठिनाई। साफ-सुथरे टेक्स्ट में, अगले शब्द का अनुमान लगाना आसान था; अस्त-व्यस्त टेक्स्ट में, यह लगभग असंभव था।

परिणामों ने इस पूर्वानुमेयता और मॉडल के आंतरिक नंबरों की वृद्धि के बीच एक स्पष्ट, गणितीय संबंध प्रकट किया। अध्ययन में पाया गया कि स्केल फैक्टर की वृद्धि यादृच्छिक नहीं थी, बल्कि टेक्स्ट की पूर्वानुमेयता और पूर्ण यादृच्छिकता के आधार रेखा के बीच के अंतर पर आधारित एक विशिष्ट वक्र (curve) का अनुसरण करती थी। महत्वपूर्ण रूप से, यह संबंध केवल एक अनुमान नहीं था; इसे दो अलग-अलग, स्वतंत्र रूप से मापे गए तथ्यों से निकाला गया था। पहला, यह पाया गया कि संख्याओं की वृद्धि सीधे तौर पर टेक्स्ट में शेष संरचना की मात्रा के समानुपाती थी। दूसरा, टेक्स्ट के अधिक अस्त-व्यस्त होने पर अगले शब्द की भविष्यवाणी करने की कठिनाई एक विशिष्ट, वक्राकार संतृप्ति पैटर्न (saturation pattern) का पालन करती थी। जब इन दोनों तथ्यों को मिलाया गया, तो इसने संख्याओं की वृद्धि को एक सटीक, उत्तल वक्र (convex curve) का पालन करने के लिए मजबूर कर दिया। इसका अर्थ है कि वक्र का आकार संयोग से डेटा पर फिट नहीं किया गया था, बल्कि यह एक आवश्यक परिणाम था कि टेक्स्ट की संरचना और सीखने की प्रक्रिया एक साथ कैसे परस्पर क्रिया करती हैं।

अध्ययन ने विभिन्न शिक्षण गतियों (learning speeds) के माध्यम से इस नियम का परीक्षण किया, जो यह नियंत्रित करती हैं कि मॉडल अपने नंबरों को कितनी तेज़ी से अपडेट करता है। जब शोधकर्ता ने इन गतियों के लिए समायोजन किया, तो सभी अलग-अलग प्रशिक्षण रन एक एकल, एकीकृत रेखा पर आकर मिल गए। इस विलय ने सिद्ध किया कि यह संबंध प्रणाली का एक मौलिक गुण है, न कि किसी विशिष्ट सेटिंग का परिणाम। शोधकर्ता ने एक कठोर परीक्षण किया कि क्या यह नियम भविष्य की भविष्यवाणी कर सकता है। केवल प्री-ट्रेनिंग माप (pre-training measurement) और टेक्स्ट की पूर्वानुमेयता का उपयोग करके, उन्होंने एक नए, अनदेखे अस्त-व्यस्त टेक्स्ट संस्करण में आंतरिक नंबरों के बढ़ने की भविष्यवाणी की। भविष्यवाणी बहुत कम त्रुटि मार्जिन के भीतर सटीक थी, जिससे पुष्टि हुई कि टेक्स्ट के गुण अकेले ही मॉडल के आंतरिक विकास का पूर्वानुमान लगाने के लिए पर्याप्त हैं।

हालाँकि, अध्ययन ने एक स्पष्ट सीमा भी खींची जहाँ यह नियम लागू होता है। जब शोधकर्ता ने कंप्यूटर कोड पर मॉडल का परीक्षण किया, तो भविष्यवाणी विफल रही। कोड में कम पूर्वानुमेयता होती है, जिससे सैद्धांतिक रूप से उच्च वृद्धि होनी चाहिए, लेकिन मॉडल के नंबर उम्मीद से बहुत कम बढ़े। शोधकर्ता ने पहचाना कि कोड अत्यधिक पुनरावृत्ति और टेम्पलेट्स पर निर्भर करता है, न कि प्राकृतिक भाषा में पाई जाने वाली समृद्ध, प्रासंगिक मैपिंग पर। यह सुझाव देता है कि जबकि पूर्वानुमेयता एक प्रमुख चालक है, एक दूसरा कारक—रिडंडेंसी (redundancy/अतिरेक)—भी भूमिका निभाता है। कानून प्राकृतिक भाषा के लिए पूरी तरह से काम करता है जहाँ अगला शब्द संदर्भ पर निर्भर करता है, लेकिन यह उस टेक्स्ट के लिए टूट जाता है जहाँ अगला शब्द केवल एक पैटर्न को दोहराने के कारण पूर्वानुमेय होता है।

निष्कर्ष तब भी कायम रहे जब शोधकर्ता ने मॉडल के भीतर व्यक्तिगत परतों को देखा। टेक्स्ट की पूर्वानुमेयता और नंबर ग्रोथ के बीच वही संबंध मॉडल के हर हिस्से में दिखाई दिया, हालांकि प्रभाव की ताकत भिन्न थी। सूचना के प्रवाह को संसाधित करने वाली परतों ने सबसे मजबूत प्रतिक्रिया दिखाई, जबकि अन्य भाग कम संवेदनशील थे। इसने शोधकर्ता को यह मानचित्रित करने की अनुमति दी कि नेटवर्क में कहाँ टेक्स्ट की संरचना को नंबरों में लिखा जा रहा है। इसके अलावा, अध्ययन ने दो अलग-अलग मॉडल आर्किटेक्चर का परीक्षण किया, और जबकि विशिष्ट संख्याएँ बदल गईं, संबंध का अंतर्निहित आकार समान रहा। यह इंगित करता है कि यह नियम कि ये मॉडल कैसे सीखते हैं, एक मजबूत विशेषता है, चाहे मशीन का विशिष्ट डिज़ाइन कुछ भी हो।

अंततः, यह कार्य आर्टिफिशियल इंटेलिजेंस को समझने के लिए एक स्पष्ट, भविष्योन्मुखी उपकरण प्रदान करता है। यह प्रदर्शित करता है कि कोई व्यक्ति मॉडल को प्रशिक्षित करने से पहले ही एक डेटासेट को देखकर सटीक रूप से भविष्यवाणी कर सकता है कि मॉडल के आंतरिक नंबर कैसे विकसित होंगे। यह डेटा और मशीन के बीच एक लंबे समय से चले आ रहे लूप को बंद करता है, यह दिखाते हुए कि टेक्स्ट की संरचना केवल एक निष्क्रिय इनपुट नहीं है बल्कि मॉडल की आंतरिक गतिशीलता का एक सक्रिय चालक है। हालाँकि इस नियम की सीमाएँ हैं, विशेष रूप से कोड जैसे अत्यधिक पुनरावृत्ति वाले डेटा के मामले में, लेकिन यह प्रशिक्षण डेटा की गुणवत्ता और संरचना को मापने का एक शक्तिशाली नया तरीका प्रदान करता है, जो एक जटिल, अदृश्य प्रक्रिया को सरल, ठोस उपकरणों के साथ मापने योग्य, पूर्वानुमानित और समझने योग्य बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →