HRM-Text: Efficient Pretraining Beyond Scaling
यह शोध पत्र HRM-Text को प्रस्तुत करता है, जो एक 1B-पैरामीटर वाला मॉडल है जो एक पदानुक्रमित आवर्ती (hierarchical recurrent) आर्किटेक्चर, विशिष्ट प्रशिक्षण तकनीकों और केवल निर्देश-आधारित प्रीट्रेनिंग को जोड़कर काफी बड़े मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त करता है ताकि मौलिक भाषा मॉडल अनुसंधान के लिए कंप्यूट और डेटा की आवश्यकताओं को नाटकीय रूप से कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
वर्तमान में आर्टिफिशियल इंटेलिजेंस (AI) की स्थिति की कल्पना एक विशाल, उच्च-गति वाली फैक्ट्री के रूप में करें। एक "स्मार्ट" मशीन बनाने के लिए, ये फैक्ट्रियां खरबों (trillions) कच्चे टेक्स्ट पेज (जैसे पूरा इंटरनेट) को एक ब्लेंडर में डाल देती हैं, और उसे तैयार करने के लिए अरबों डॉलर की बिजली का उपयोग करती हैं। परिणाम एक स्मार्ट मॉडल होता है, लेकिन यह प्रक्रिया इतनी महंगी और ऊर्जा-खपत वाली है कि केवल कुछ बड़ी कंपनियां ही इस फैक्ट्री को चलाने का खर्च उठा सकती हैं।
जिस पेपर को आपने साझा किया है, HRM-Text, वह इन मशीनों को बनाने का एक बिल्कुल अलग तरीका प्रस्तावित करता है। एक विशाल, ज़बरदस्त बल (brute-force) वाली फैक्ट्री के बजाय, उन्होंने एक छोटा, अत्यधिक कुशल वर्कशॉप बनाया है जो मानव मस्तिष्क की तरह सीखता है।
यहाँ इसका विवरण दिया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. मस्तिष्क की उपमा: "धीमा विचारक" और "तेज़ कर्ता"
आज के अधिकांश AI मॉडल एक ही व्यक्ति की तरह हैं जो एक साथ सब कुछ करने की कोशिश कर रहा है: पढ़ना, सोचना और लिखना, सब एक ही विशाल, अराजक दौड़ में।
लेखकों ने देखा कि मानव मस्तिष्क कैसे काम करता है। उन्होंने गौर किया कि हमारे मस्तिष्क में एक फ्रंटोपैरिएटल लूप (frontoparietal loop) होता है: एक ऐसी प्रणाली जो धीमी, रणनीतिक सोच (बड़ी तस्वीर की योजना बनाना) को तेज़, निष्पादन सोच (वास्तविक काम करना) से अलग करती है।
- पुराना तरीका: एक मानक AI एक ऐसे स्प्रिंटर (धावक) की तरह है जो बिना रुके मैराथन दौड़ने की कोशिश कर रहा है। वह थक जाता है और भ्रमित हो जाता है।
- HRM-Text का तरीका: उन्होंने दो परतों वाला एक मॉडल बनाया:
- "H" मॉड्यूल (द जनरल/सेनापति): यह धीमी, रणनीतिक परत है। यह बड़ी तस्वीर को समझने और दिशा निर्धारित करने के लिए थोड़ा समय लेती है।
- "L" मॉड्यूल (द स्पेशलिस्ट/विशेषज्ञ): यह तेज़, निष्पादन परत है। यह जनरल की योजना के आधार पर विवरणों को जल्दी से संभालती है और उत्तर को परिष्कृत करती है।
- परिणाम: "योजना बनाने" को "करने" से अलग करके, मॉडल विवरणों में खो नहीं जाता है। यह तेज़ी से और अधिक कुशलता से सीखता है।
2. प्रशिक्षण पद्धति: प्रश्न को पढ़ना बंद करें, उत्तर देना शुरू करें
वर्तमान AI मॉडल एक किताब पढ़कर और किताब के हर एक शब्द के लिए (प्रश्न सहित) अगले शब्द की भविष्यवाणी करने की कोशिश करके प्रशिक्षित होते हैं। यह एक छात्र के लिए परीक्षा की तैयारी करने जैसा है जहाँ वह समस्याओं को हल करने के बजाय, शिक्षक के प्रश्नों को शब्द-दर-शब्द याद करने की कोशिश कर रहा है।
HRM-Text नियमों को बदल देता है:
- "टास्क-कम्प्लीशन" उद्देश्य: पूरे वाक्य की भविष्यवाणी करने के बजाय, मॉडल को केवल तभी दंडित किया जाता है जब वह उत्तर गलत देता है। यह प्रशिक्षण के दौरान प्रश्न वाले हिस्से को अनदेखा कर देता है।
- "PrefixLM" ट्रिक: कल्पना कीजिए कि एक छात्र प्रश्न पढ़ रहा है। मानक AI के साथ, छात्र केवल उन शब्दों को देख सकता है जिन्हें उसने पहले ही लिख दिया है। HRM-Text के साथ, छात्र को उत्तर लिखने से पहले पूरे प्रश्न को पढ़ने (आगे-पीछे देखने) की अनुमति है। यह उन्हें प्रश्न के टेक्स्ट को याद किए बिना संदर्भ को बहुत बेहतर तरीके से समझने में मदद करता है।
3. "जादुई" स्टेबलाइजर्स (स्थिर करने वाले)
लूप (recurrence) में "सोचने" वाले मॉडल को प्रशिक्षित करना बेहद कठिन होता है; यह ऐसा है जैसे हिलते हुए फर्श पर प्लेटों का ढेर संतुलित करने की कोशिश करना। पेपर में इस ढेर को गिरने से बचाने के लिए दो "स्टेबलाइजर्स" पेश किए गए हैं:
- MagicNorm: इसे एक शॉक एब्जॉर्बर (झटका सहने वाला यंत्र) समझें। यह सुनिश्चित करता है कि जैसे-जैसे मॉडल कई चरणों के माध्यम से "सोचता" है, कंप्यूटर के अंदर के नंबर बहुत बड़े या बहुत छोटे न हो जाएं, जिससे आमतौर पर सीखना क्रैश हो जाता है।
- Warmup Deep Credit Assignment: कल्पना कीजिए कि एक बच्चे को चलना सिखा रहे हैं। आप पहले दिन ही उससे मैराथन दौड़ने के लिए नहीं कहते। आप छोटे कदमों से शुरुआत करते हैं, और जैसे-जैसे वह मजबूत होता है, आप उसे लंबे कदम उठाने देते हैं। HRM-Text पहले कुछ कदमों तक पीछे जाकर गलतियों से सीखने से शुरुआत करता है, और फिर जैसे-जैसे वह स्मार्ट होता जाता है, वह और पीछे तक देखता है। यह मॉडल को बहुत जल्दी अपने इतिहास से भ्रमित होने से रोकता है।
परिणाम: एक "डेविड बनाम गोलियथ" की जीत
पेपर दावा करता है कि इन ट्रिक्स के साथ, उन्होंने एक 1-बिलियन पैरामीटर वाला मॉडल (एक अपेक्षाकृत छोटा AI) बनाया जो केवल 40 बिलियन टोकन (Google या Meta जैसे दिग्गजों द्वारा उपयोग किए जाने वाले ट्रिलियनों की तुलना में बहुत कम डेटा) पर प्रशिक्षित किया गया था।
- लागत: उन्होंने लगभग $1,500 खर्च किए और 16 ग्राफिक्स कार्ड का उपयोग दो दिनों से भी कम समय के लिए किया।
- तुलना: छोटा और सस्ता होने के बावजूद, यह मॉडल उन विशाल मॉडलों के समान (या कभी-कभी बेहतर) प्रदर्शन करता है जिन्हें प्रशिक्षित करने में लाखों डॉलर खर्च हुए और महीनों का समय लगा।
- दक्षता: समान परिणाम प्राप्त करने के लिए, मानक मॉडलों को 100 से 900 गुना अधिक डेटा और 96 से 432 गुना अधिक कंप्यूटिंग पावर की आवश्यकता थी।
बड़ी तस्वीर
लेखक यह नहीं कह रहे हैं कि यह अंतिम पूर्ण AI है। वे कह रहे हैं: "हमने साबित किया कि यह संभव है।"
उन्होंने दिखाया कि एक स्मार्ट AI बनाने के लिए आपको अरबों डॉलर के बजट की आवश्यकता नहीं है। एक आर्किटेक्चर को मस्तिष्क की तरह सोचने के लिए डिज़ाइन करके (धीमी योजना + तेज़ कार्य) और इसे केवल समस्याओं को हल करने पर ध्यान केंद्रित करने के लिए प्रशिक्षित करके (प्रश्न के टेक्स्ट को अनदेखा करके), आप AI अनुसंधान का लोकतंत्रीकरण कर सकते हैं। इसका अर्थ है कि छोटे लैब, विश्वविद्यालय और यहाँ तक कि व्यक्ति भी अब शून्य से अपने स्वयं के फाउंडेशनल मॉडल प्रशिक्षित कर सकते हैं, जिससे उस एकाधिकार को तोड़ा जा सकता है जिसे वर्तमान में केवल अमीर कंपनियां ही रख सकती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।