← नवीनतम पेपर
💬 NLP

HRM-Text: Efficient Pretraining Beyond Scaling

यह शोध पत्र HRM-Text को प्रस्तुत करता है, जो एक 1B-पैरामीटर वाला मॉडल है जो एक पदानुक्रमित आवर्ती (hierarchical recurrent) आर्किटेक्चर, विशिष्ट प्रशिक्षण तकनीकों और केवल निर्देश-आधारित प्रीट्रेनिंग को जोड़कर काफी बड़े मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त करता है ताकि मौलिक भाषा मॉडल अनुसंधान के लिए कंप्यूट और डेटा की आवश्यकताओं को नाटकीय रूप से कम किया जा सके।

मूल लेखक: Guan Wang, Changling Liu, Chenyu Wang, Cai Zhou, Yuhao Sun, Yifei Wu, Shuai Zhen, Luca Scimeca, Yasin Abbasi Yadkori

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guan Wang, Changling Liu, Chenyu Wang, Cai Zhou, Yuhao Sun, Yifei Wu, Shuai Zhen, Luca Scimeca, Yasin Abbasi Yadkori

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

वर्तमान में आर्टिफिशियल इंटेलिजेंस (AI) की स्थिति की कल्पना एक विशाल, उच्च-गति वाली फैक्ट्री के रूप में करें। एक "स्मार्ट" मशीन बनाने के लिए, ये फैक्ट्रियां खरबों (trillions) कच्चे टेक्स्ट पेज (जैसे पूरा इंटरनेट) को एक ब्लेंडर में डाल देती हैं, और उसे तैयार करने के लिए अरबों डॉलर की बिजली का उपयोग करती हैं। परिणाम एक स्मार्ट मॉडल होता है, लेकिन यह प्रक्रिया इतनी महंगी और ऊर्जा-खपत वाली है कि केवल कुछ बड़ी कंपनियां ही इस फैक्ट्री को चलाने का खर्च उठा सकती हैं।

जिस पेपर को आपने साझा किया है, HRM-Text, वह इन मशीनों को बनाने का एक बिल्कुल अलग तरीका प्रस्तावित करता है। एक विशाल, ज़बरदस्त बल (brute-force) वाली फैक्ट्री के बजाय, उन्होंने एक छोटा, अत्यधिक कुशल वर्कशॉप बनाया है जो मानव मस्तिष्क की तरह सीखता है।

यहाँ इसका विवरण दिया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. मस्तिष्क की उपमा: "धीमा विचारक" और "तेज़ कर्ता"

आज के अधिकांश AI मॉडल एक ही व्यक्ति की तरह हैं जो एक साथ सब कुछ करने की कोशिश कर रहा है: पढ़ना, सोचना और लिखना, सब एक ही विशाल, अराजक दौड़ में।

लेखकों ने देखा कि मानव मस्तिष्क कैसे काम करता है। उन्होंने गौर किया कि हमारे मस्तिष्क में एक फ्रंटोपैरिएटल लूप (frontoparietal loop) होता है: एक ऐसी प्रणाली जो धीमी, रणनीतिक सोच (बड़ी तस्वीर की योजना बनाना) को तेज़, निष्पादन सोच (वास्तविक काम करना) से अलग करती है।

  • पुराना तरीका: एक मानक AI एक ऐसे स्प्रिंटर (धावक) की तरह है जो बिना रुके मैराथन दौड़ने की कोशिश कर रहा है। वह थक जाता है और भ्रमित हो जाता है।
  • HRM-Text का तरीका: उन्होंने दो परतों वाला एक मॉडल बनाया:
    • "H" मॉड्यूल (द जनरल/सेनापति): यह धीमी, रणनीतिक परत है। यह बड़ी तस्वीर को समझने और दिशा निर्धारित करने के लिए थोड़ा समय लेती है।
    • "L" मॉड्यूल (द स्पेशलिस्ट/विशेषज्ञ): यह तेज़, निष्पादन परत है। यह जनरल की योजना के आधार पर विवरणों को जल्दी से संभालती है और उत्तर को परिष्कृत करती है।
    • परिणाम: "योजना बनाने" को "करने" से अलग करके, मॉडल विवरणों में खो नहीं जाता है। यह तेज़ी से और अधिक कुशलता से सीखता है।

2. प्रशिक्षण पद्धति: प्रश्न को पढ़ना बंद करें, उत्तर देना शुरू करें

वर्तमान AI मॉडल एक किताब पढ़कर और किताब के हर एक शब्द के लिए (प्रश्न सहित) अगले शब्द की भविष्यवाणी करने की कोशिश करके प्रशिक्षित होते हैं। यह एक छात्र के लिए परीक्षा की तैयारी करने जैसा है जहाँ वह समस्याओं को हल करने के बजाय, शिक्षक के प्रश्नों को शब्द-दर-शब्द याद करने की कोशिश कर रहा है।

HRM-Text नियमों को बदल देता है:

  • "टास्क-कम्प्लीशन" उद्देश्य: पूरे वाक्य की भविष्यवाणी करने के बजाय, मॉडल को केवल तभी दंडित किया जाता है जब वह उत्तर गलत देता है। यह प्रशिक्षण के दौरान प्रश्न वाले हिस्से को अनदेखा कर देता है।
  • "PrefixLM" ट्रिक: कल्पना कीजिए कि एक छात्र प्रश्न पढ़ रहा है। मानक AI के साथ, छात्र केवल उन शब्दों को देख सकता है जिन्हें उसने पहले ही लिख दिया है। HRM-Text के साथ, छात्र को उत्तर लिखने से पहले पूरे प्रश्न को पढ़ने (आगे-पीछे देखने) की अनुमति है। यह उन्हें प्रश्न के टेक्स्ट को याद किए बिना संदर्भ को बहुत बेहतर तरीके से समझने में मदद करता है।

3. "जादुई" स्टेबलाइजर्स (स्थिर करने वाले)

लूप (recurrence) में "सोचने" वाले मॉडल को प्रशिक्षित करना बेहद कठिन होता है; यह ऐसा है जैसे हिलते हुए फर्श पर प्लेटों का ढेर संतुलित करने की कोशिश करना। पेपर में इस ढेर को गिरने से बचाने के लिए दो "स्टेबलाइजर्स" पेश किए गए हैं:

  • MagicNorm: इसे एक शॉक एब्जॉर्बर (झटका सहने वाला यंत्र) समझें। यह सुनिश्चित करता है कि जैसे-जैसे मॉडल कई चरणों के माध्यम से "सोचता" है, कंप्यूटर के अंदर के नंबर बहुत बड़े या बहुत छोटे न हो जाएं, जिससे आमतौर पर सीखना क्रैश हो जाता है।
  • Warmup Deep Credit Assignment: कल्पना कीजिए कि एक बच्चे को चलना सिखा रहे हैं। आप पहले दिन ही उससे मैराथन दौड़ने के लिए नहीं कहते। आप छोटे कदमों से शुरुआत करते हैं, और जैसे-जैसे वह मजबूत होता है, आप उसे लंबे कदम उठाने देते हैं। HRM-Text पहले कुछ कदमों तक पीछे जाकर गलतियों से सीखने से शुरुआत करता है, और फिर जैसे-जैसे वह स्मार्ट होता जाता है, वह और पीछे तक देखता है। यह मॉडल को बहुत जल्दी अपने इतिहास से भ्रमित होने से रोकता है।

परिणाम: एक "डेविड बनाम गोलियथ" की जीत

पेपर दावा करता है कि इन ट्रिक्स के साथ, उन्होंने एक 1-बिलियन पैरामीटर वाला मॉडल (एक अपेक्षाकृत छोटा AI) बनाया जो केवल 40 बिलियन टोकन (Google या Meta जैसे दिग्गजों द्वारा उपयोग किए जाने वाले ट्रिलियनों की तुलना में बहुत कम डेटा) पर प्रशिक्षित किया गया था।

  • लागत: उन्होंने लगभग $1,500 खर्च किए और 16 ग्राफिक्स कार्ड का उपयोग दो दिनों से भी कम समय के लिए किया।
  • तुलना: छोटा और सस्ता होने के बावजूद, यह मॉडल उन विशाल मॉडलों के समान (या कभी-कभी बेहतर) प्रदर्शन करता है जिन्हें प्रशिक्षित करने में लाखों डॉलर खर्च हुए और महीनों का समय लगा।
  • दक्षता: समान परिणाम प्राप्त करने के लिए, मानक मॉडलों को 100 से 900 गुना अधिक डेटा और 96 से 432 गुना अधिक कंप्यूटिंग पावर की आवश्यकता थी।

बड़ी तस्वीर

लेखक यह नहीं कह रहे हैं कि यह अंतिम पूर्ण AI है। वे कह रहे हैं: "हमने साबित किया कि यह संभव है।"

उन्होंने दिखाया कि एक स्मार्ट AI बनाने के लिए आपको अरबों डॉलर के बजट की आवश्यकता नहीं है। एक आर्किटेक्चर को मस्तिष्क की तरह सोचने के लिए डिज़ाइन करके (धीमी योजना + तेज़ कार्य) और इसे केवल समस्याओं को हल करने पर ध्यान केंद्रित करने के लिए प्रशिक्षित करके (प्रश्न के टेक्स्ट को अनदेखा करके), आप AI अनुसंधान का लोकतंत्रीकरण कर सकते हैं। इसका अर्थ है कि छोटे लैब, विश्वविद्यालय और यहाँ तक कि व्यक्ति भी अब शून्य से अपने स्वयं के फाउंडेशनल मॉडल प्रशिक्षित कर सकते हैं, जिससे उस एकाधिकार को तोड़ा जा सकता है जिसे वर्तमान में केवल अमीर कंपनियां ही रख सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →