Data Augmentations for Data-Constrained Language Model Pretraining
यह शोध पत्र यह प्रस्तावित करता है कि टोकन-स्तरीय शोर (token-level noise), अनुक्रम क्रमपरिवर्तन (sequence permutations) और लक्ष्य ऑफसेट भविष्यवाणी (target offset prediction) को डेटा ऑग्मेंटेशन तकनीकों के रूप में संयोजित करना ऑटोरेग्रेसिव लैंग्वेज मॉडल प्रीट्रेनिंग में ओवरफिटिंग को प्रभावी ढंग से कम करता है, जिससे निश्चित, डेटा-सीमित कॉर्पोरा पर उत्पादक मल्टी-एपॉक ट्रेनिंग सक्षम होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन बहुत भूखे छात्र (AI मॉडल) को कहानियाँ लिखना सिखा रहे हैं। अतीत में, इस छात्र को सिखाने का सबसे अच्छा तरीका उन्हें पढ़ने के लिए किताबों का एक विशाल पुस्तकालय देना था। वे जितने अधिक किताबें पढ़ते, वे उतने ही बुद्धिमान होते जाते।
लेकिन अब, हम एक दीवार से टकरा गए हैं। हम इंटरनेट पर उच्च गुणवत्ता वाली किताबों के खत्म होने की कगार पर हैं। इस बीच, हमारे कंप्यूटर (शिक्षक) अविश्वसनीय रूप से शक्तिशाली और तेज़ होते जा रहे हैं। हम ऐसी स्थिति में हैं जहाँ हमारे पास बहुत अधिक कंप्यूटिंग शक्ति है लेकिन पर्याप्त नया डेटा नहीं है।
समस्या: "ज़रूरत से ज़्यादा पढ़ा हुआ" छात्र (The "Over-Read" Student)
क्योंकि हमारे पास नई किताबें नहीं हैं, हमें अपने छात्र को वही 75 मिलियन शब्द बार-बार पढ़ने पड़ते हैं।
पुराने तरीके के प्रशिक्षण (जिसे "ऑटोरेग्रेसिव" या AR कहा जाता है) में, यदि आप छात्र को एक ही टेक्स्ट बहुत अधिक बार पढ़ाते हैं, तो वे कहानी सीखना बंद कर देते हैं और शब्दों को ठीक वैसे ही रटने (memorize) लगते हैं।
- उपमा: कल्पना कीजिए कि आप एक ही पन्ने को 100 बार पढ़ रहे हैं। अंततः, आप केवल कहानी ही नहीं जानते; आप जानते हैं कि हर कॉमा (comma) कहाँ है। यदि आपका परीक्षण किसी नए पन्ने पर किया जाता है जिसे आपने पहले नहीं देखा है, तो आप असफल हो जाते हैं क्योंकि आपने केवल पुराने वाले को रट लिया था।
- परिणाम: AI अपने प्रशिक्षण डेटा (training data) में बहुत अच्छा हो जाता है, लेकिन नए, अनदेखे डेटा पर इसका प्रदर्शन बदतर होता जाता है। यह "ओवरफिट" (overfit) हो जाता है।
समाधान: डेटा ऑग्मेंटेशन (डेटा संवर्धन) - "ट्विस्ट" विधि
लेखकों ने पूछा: हम छात्र को एक ही किताब 100 बार पढ़ने के लिए कैसे प्रेरित कर सकते हैं बिना उसे केवल रटने दिए?
उनका उत्तर है डेटा ऑग्मेंटेशन (Data Augmentation)। उन्हें हर बार छात्र को बिल्कुल एक जैसा टेक्स्ट देने के बजाय, वे छात्र के पढ़ने से पहले टेक्स्ट को थोड़ा "मोड़" (twist) या "बदल" (scramble) देते हैं। यह छात्र को केवल शब्दों के क्रम को रटने के बजाय, वास्तव में अर्थ और संदर्भ को समझने के लिए मजबूर करता है।
उन्होंने टेक्स्ट को मोड़ने के तीन मुख्य तरीके आजमाए:
1. "आंखों पर पट्टी" और "गलत शब्द" का खेल (Token-Level Noise)
- मास्किंग (आंखों पर पट्टी): वे कुछ शब्दों को एक काले बॉक्स (एक `` टोकन) से ढक देते हैं। छात्र को शेष वाक्य के आधार पर गायब शब्द का अनुमान लगाना होता है।
- रैंडम रिप्लेसमेंट (गलत शब्द): एक काले बॉक्स के बजाय, वे एक शब्द को दूसरे शब्द से बदल देते जो व्याकरण की दृष्टि से तो सही लगता है लेकिन तथ्यात्मक रूप से गलत होता है।
- उदाहरण: "The cat sat on the mat" को बदलकर "The cat sat on the hat" कर देना।
- निष्कर्ष: आश्चर्यजनक रूप से, "गलत शब्द" वाला खेल "आंखों पर पट्टी" वाले खेल से बेहतर काम कर गया। क्यों? क्योंकि खाली जगह देखकर गायब शब्द का अनुमान लगाना आसान है। लेकिन यह पहचानना कि "hat" गलत शब्द है जब वाक्य दिखने में बिल्कुल सही लग रहा हो, बहुत कठिन मानसिक व्यायाम है। यह छात्र को और अधिक ध्यान देने के लिए मजबूर करता है।
2. "रिवाइंड" और "खाली स्थान भरें" का खेल (Sequence Permutations)
- दाएं-से-बाएं (रिवाइंड): वे छात्र को वाक्य को उल्टा पढ़ाते हैं, यानी आखिरी शब्द से पहले शब्द की ओर।
- बीच का हिस्सा भरें (Fill-in-the-Middle): वे एक वाक्य लेते हैं, उसके बीच के हिस्से को हटा देते हैं, और छात्र से शुरुआत और अंत के आधार पर बीच के हिस्से का अनुमान लगाने को कहते हैं।
- निष्कर्ष: पीछे की ओर (backward) पढ़ने से नियमितीकरण (regularizer) के रूप में बहुत लाभ हुआ (इसने रटने की प्रक्रिया को रोका)। हालांकि, "बीच का हिस्सा भरें" वाला खेल सामान्य टेक्स्ट के लिए चीज़ों को वास्तव में खराब कर देता है। लेखक सुझाव देते हैं कि ऐसा इसलिए है क्योंकि "फिल-इन" प्रारूप सामान्य रूप से हमारे पढ़ने के तरीके (बाएं-से-दाएं) से इतना अलग है कि इसने छात्र को मदद करने के बजाय भ्रमित कर दिया।
3. "क्रिस्टल बॉल" का खेल (Target Offset Prediction)
- "अगले" शब्द के बजाय, वे पूछते हैं कि तीन कदम आगे वाला शब्द क्या है?
- निष्कर्ष: यह अच्छी तरह से काम करता है, लेकिन केवल तभी जब वे इसे सावधानी से करते हैं। यदि वे बहुत अधिक बार भविष्य के शब्दों के बारे में पूछते हैं, तो छात्र भ्रमित हो जाता है। यदि वे ज्यादातर अगले शब्द के बारे में पूछते हैं लेकिन कभी-कभी थोड़ा आगे का शब्द पूछते हैं, तो यह एक आदर्श शिक्षण पाठ्यक्रम (curriculum) के रूप में कार्य करता है।
जीतने वाली रणनीति: "परफेक्ट स्टॉर्म" (The "Perfect Storm")
लेखकों ने केवल एक खेल नहीं चुना; उन्होंने उन्हें मिला दिया। हालाँकि, उन्होंने पाया कि कुछ खेल आपस में टकराते हैं।
- टकराव: यदि आप शब्दों को ढक देते हैं (Masking) और भविष्य के शब्दों के बारे में पूछते हैं, तो छात्र अभिभूत (overwhelmed) हो जाता है। संदर्भ बहुत अधिक टूट जाता है जिससे एक अच्छा अनुमान लगाना मुश्किल हो जाता है।
- तालमेल: यदि आप रैंडम रिप्लेसमेंट (शब्दों को बदलना) + पीछे की ओर पढ़ना + कभी-कभी आगे देखना का उपयोग करते हैं, तो छात्र सतर्क रहता है।
परिणाम:
इन विशिष्ट "ट्विस्टों" का उपयोग करके, AI 100 इपोक (डेटा को 100 बार पढ़ना) तक प्रशिक्षित करने में सक्षम था बिना अपनी सामान्य क्षमता खोए।
- ट्रिक्स के बिना: AI 16वें इपोक पर अपने शिखर पर पहुँच गया और फिर बदतर होता गया।
- ट्रिक्स के साथ: AI बेहतर होता रहा, और एक बहुत कम त्रुटि दर (बेहतर प्रदर्शन) तक पहुँचा जो किसी भी एकल विधि द्वारा प्राप्त किए जाने वाले स्तर से कहीं अधिक थी।
मुख्य निष्कर्ष
यह शोध पत्र सिद्ध करता है कि जब हमारे पास नया डेटा समाप्त हो जाता है, तो हमें प्रशिक्षण रोकने की आवश्यकता नहीं है। हमें बस यह बदलने की आवश्यकता है कि हम डेटा को कैसे प्रस्तुत करते हैं। टेक्स्ट में छोटे, स्मार्ट "विकृतियों" (distortions) को जोड़कर, हम शक्तिशाली कंप्यूटरों को बहुत लंबे समय तक प्रभावी ढंग से सीखने के लिए प्रेरित कर सकते हैं, जिससे उन्हें केवल प्रशिक्षण सेट को रटने से रोका जा सके।
मुख्य सीख: शब्दों को बेतरतीब ढंग से बदलना (टेक्स्ट को थोड़ा "गलत" बनाना) सबसे प्रभावी एकल ट्रिक थी, और इसे पीछे की ओर पढ़ने और आगे देखने के साथ मिलाने से समग्र प्रदर्शन में सबसे अच्छा परिणाम मिला।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।