← नवीनतम पेपर
🤖 machine learning

Training nGPT

यह शोध पत्र नॉर्मलाइज्ड ट्रांसफॉर्मर (nGPT) के लिए एक व्यावहारिक प्रशिक्षण रेसिपी प्रस्तुत करता है जिसमें लॉजिट ग्रेडिएंट प्रीकंडीशनिंग और गेटेडएडमडब्ल्यू (GatedAdamW) जैसी तकनीकों को शामिल किया गया है, जो 14B-पैरामीटर वाले हाइब्रिड मंबा-ट्रांसफॉर्मर MoE मॉडल्स को उनके अननॉर्मलाइज्ड समकक्षों की तुलना में लगभग आधे प्रशिक्षण टोकन का उपयोग करके समान वैलिडेशन लॉस प्राप्त करने में सक्षम बनाता है।

मूल लेखक: Ilya Loshchilov, Boris Ginsburg

प्रकाशित 2026-08-04
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ilya Loshchilov, Boris Ginsburg

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ कंप्यूटर कहानियाँ लिखने, गणित की समस्याएँ हल करने और मनुष्यों की तरह चैट करने की कोशिश कर रहे हैं। ऐसा करने के लिए, वे "न्यूरल नेटवर्क" नामक विशेष गणितीय संरचनाओं का उपयोग करते हैं, जो न्यूरॉन्स के विशाल, आपस में जुड़े हुए जाल की तरह होते हैं। इन जालों के भीतर, जानकारी संख्याओं के रूप में यात्रा करती है, और नेटवर्क इन न्यूरॉन्स के बीच के कनेक्शन की ताकत को बदलकर सीखता है। लंबे समय से, वैज्ञानिकों ने देखा है कि ये संख्याएँ अव्यवस्थित हो सकती हैं—कभी वे बहुत बड़ी हो जाती हैं, कभी शून्य तक सिकुड़ जाती हैं, और पूरा सिस्टम इस बात को लेकर भ्रमित हो जाता है कि स्मार्ट बनने के लिए किस दिशा में आगे बढ़ना है। यह कुछ ऐसा है जैसे एक भारी बैकपैक लेकर खड़ी, धुंधली पहाड़ी पर ऊपर चढ़ने की कोशिश करना; आप एक कदम आगे बढ़ते हैं, केवल इसलिए कि आप वापस नीचे फिसल जाते हैं। इस शोध का लक्ष्य उस बैकपैक को ले जाने का एक बेहतर तरीका खोजना है ताकि कंप्यूटर अधिक तेज़ी से और कुशलता से सीखने की पहाड़ी पर चढ़ सके।

आप जो पेपर पढ़ने जा रहे हैं वह NVIDIA की टीम से है, जिसका नेतृत्व इल्या लोशिलोव और बोरिस गिन्सबर्ग कर रहे हैं। वे एक विशिष्ट समस्या का समाधान कर रहे हैं: कैसे उनके सभी आंतरिक नंबरों को एक पूर्ण, अदृश्य गोले (sphere) पर रहने के लिए मजबूर करके उनके AI मॉडल को बेहतर तरीके से सीखने में मदद की जाए। एक गोले की कल्पना करें। यह एक नियम की तरह है जो कहता है, "चाहे आप कितनी भी दूर चलें, आपको हमेशा शहर के केंद्र से ठीक एक मील की दूरी पर रहना चाहिए।" यह नियम, जिसे "नॉर्मलाइजेशन" (normalization) कहा जाता है, संख्याओं को बहुत बड़ा या बहुत छोटा होने से रोकता है, जिससे कंप्यूटर केंद्रित रह पाता है। लेखकों ने "nGPT" (नॉर्मलाइज्ड GPT) नामक एक पिछले विचार पर काम किया और इसे एक बहुत ही आधुनिक, शक्तिशाली प्रकार के AI पर टेस्ट किया जो दो अलग-अलग तकनीकों का मिश्रण है: "Mamba-2" (जो लंबी अनुक्रमों को याद रखने में बेहतरीन है) और "Transformers" (जो संदर्भ को समझने में उत्कृष्ट हैं)। वे यह देखना चाहते थे कि क्या उनके नए प्रशिक्षण नियम इन हाइब्रिड मॉडलों को मानक तरीके की तुलना में तेज़ी से सीखने में सक्षम बना सकते हैं।

बड़ा विचार: एक नया प्रशिक्षण नुस्खा (A New Training Recipe)

लेखकों ने केवल एक चीज़ में बदलाव नहीं किया; उन्होंने इन AI मॉडलों के लिए एक पूरा नया "प्रशिक्षण नुस्खा" तैयार किया। कल्पना करें कि आप एक रोबोट को चलना सिखा रहे हैं। पुराना तरीका (AdamW नामक एक मानक विधि का उपयोग करना) एक रोबोट को लड़खड़ाते हुए छोड़ने जैसा है, जो कभी बड़े, अनाड़ी कदम उठाता है और कभी छोटे, हिचकिचाते हुए कदम, और इस उम्मीद में रहता है कि वह अंततः रास्ता खोज लेगा। नया नुस्खा, जिसे वे nGPT प्रशिक्षण नुस्खा कहते हैं, एक रोबोट को एक ट्रेडमिल पर रखने जैसा है जिसके पास उसके कदमों को एकदम सही बनाए रखने के लिए नियमों का एक विशिष्ट सेट है।

यहाँ बताया गया है कि उन्होंने इसे सरल, रोजमर्रा की अवधारणाओं में कैसे विभाजित किया है:

1. "लॉगिट ग्रेडिएंट प्रीकंडीशनिंग" (वॉल्यूम नॉब/आवाज़ का नियंत्रण)
जब AI एक वाक्य में अगले शब्द का अनुमान लगाने की कोशिश करता है, तो वह "लॉगिट्स" नामक स्कोर की एक सूची बनाता है। पुराने सिस्टम में, इन स्कोर का वॉल्यूम प्रशिक्षण के दौरान अजीब तरह से तेज़ या धीमा हो सकता था, जिससे रोबोट भ्रमित हो जाता था कि उसे कितनी ज़ोर से धक्का देना है। लेखकों ने एक विशेष "वॉल्यूम नॉब" (एक सीखने योग्य स्केल वेक्टर) जोड़ा जिसे वे समायोजित कर सकते थे। लेकिन यहाँ चतुराई यह है: उन्होंने महसूस किया कि यदि वे केवल नॉब को घुमाते हैं, तो यह रोबोट की चलने की याददाश्त को बिगाड़ देगा। इसलिए, उन्होंने Logit Gradient Preconditioning नामक एक ट्रिक बनाई। यह एक ऐसे वॉल्यूम नॉब की तरह है जो आपके द्वारा सुनी जाने वाली आवाज़ को बदल देता है, लेकिन जब रोबोट गलती से सीखने की कोशिश करता है, तो सिस्टम स्वचालित रूप से वॉल्यूम को सामान्य करने के लिए वापस कम कर देता है ताकि रोबोट भ्रमित न हो। यह सीखने की प्रक्रिया को स्थिर रखता है, भले ही भविष्यवाणियों की "तेज़ी" बदल रही हो।

2. "लॉगारिदमिक लर्निंग रेट डिके" (स्पीड रेसर)
आमतौर पर, एक AI को प्रशिक्षित करते समय, आप तेज़ सीखने की गति से शुरू करते हैं और धीरे-धीरे इसे धीमा कर देते हैं, जैसे एक रेस कार ड्राइवर गैस पेडल से पैर हटाता है। लेखक पाते हैं कि उनके नए "गोले" वाले सिस्टम के लिए मानक तरीका (एक स्मूथ कर्व की तरह) सबसे अच्छा नहीं था। इसके बजाय, उन्होंने "लॉगारिदमिक लर्निंग रेट डिके" का उपयोग किया। एक रेस कार की कल्पना करें जो शुरुआत में बहुत तेज़ी से निकलती है, अपनी स्थिति समझने के लिए शुरू में बहुत तेज़ी से धीमी होती है, और फिर दौड़ के बाकी हिस्से के लिए एक लंबी, स्थिर गति से चलती है। यह "फ्रंट-लोडेड" शेड्यूल मॉडल को बुनियादी बातें जल्दी सीखने देता है और फिर एक लंबी अवधि में अपने कौशल को निखारने देता है, जो कि बहुत अधिक कुशल साबित हुआ।

3. "GatedAdamW" (स्मार्ट गेटकीपर)
रोबोट के मस्तिष्क को अपडेट करने का मानक तरीका AdamW है। लेखकों ने इसे GatedAdamW में अपग्रेड किया है। सोचिए कि मानक तरीका एक गेटकीपर की तरह है जो हर अपडेट को अंदर आने देता है, भले ही वह अपडेट बहुत छोटा और लगभग ध्यान न देने योग्य हो। कभी-कभी, ये छोटे अपडेट केवल शोर (noise) होते हैं। नया GatedAdamW एक "स्मार्ट गेट" वाला है जो प्रत्येक अपडेट को देखता है। यदि कोई अपडेट बहुत छोटा है (जैसे एक फुसफुसाहट), तो गेटकीपर धीरे से कहता है, "आज नहीं," और उसे ब्लॉक कर देता है। यदि अपडेट एक चिल्लाहट है (एक महत्वपूर्ण परिवर्तन), तो गेट पूरी तरह खुल जाता है। यह रोबोट को छोटे, बेकार समायोजनों पर ऊर्जा बर्बाद करने से रोकता है और उसे बड़े, महत्वपूर्ण परिवर्तनों पर ध्यान केंद्रित करने में मदद करता है।

4. "एंगुलर स्टेप कैप" (सुरक्षा पट्टा)
चूंकि रोबोट एक गोले पर चल रहा है, इसलिए बहुत बड़ा कदम उठाना उसे नियंत्रण से बाहर कर सकता है या दुनिया के दूसरी ओर फेंक सकता है। लेखकों ने एक "एंगल स्टेप कैप" जोड़ा है, जो एक सुरक्षा पट्टे (safety leash) की तरह है। यदि रोबм एक बहुत बड़ा कदम उठाने की कोशिश करता है, तो पट्टा उसे धीरे से खींचकर एक सुरक्षित, छोटे कोण पर वापस ले आता है। यह सुनिश्चित करता है कि रोबोट कभी भी एक जंगली, खतरनाक छलांग न लगाए, जिससे उसकी यात्रा सुचारू और स्थिर बनी रहे।

परिणाम: अधिक कुशलता से सीखना

टीम ने इन AI मॉडलों की एक श्रृंखला पर इस नए नुस्खे का परीक्षण किया, जो 1 बिलियन से 14 बिलियन पैरामीटर्स (रोबोट के "मस्तिष्क के आकार") तक विस्तृत है। उन्होंने अपने नए nGPT मॉडलों की तुलना पुराने तरीकों से प्रशिक्षित मानक GPT मॉडलों से की।

परिणाम प्रभावशाली थे। नए nGPT मॉडल लगातार मानक मॉडलों की तुलना में कम त्रुटि दर (जिसे "वैलिडेशन लॉस" द्वारा मापा जाता है) प्राप्त करते हैं। विशेष रूप से, 14-बिलियन-पैरामीटर वाला nGPT मॉडल उसी कौशल स्तर तक पहुँच गया जो मानक 14-बिलियन मॉडल का है, लेकिन इसके लिए उसे लगभग आधे प्रशिक्षण टोकन (टेक्स्ट की मात्रा जिसे मॉडल पढ़ता है) की आवश्यकता पड़ी। दूसरे शब्दों में, उसी मंजिल तक पहुँचने के लिए, nGPT मॉडल को मानक मॉडल की तुलना में लगभग आधा टेक्स्ट पढ़ने की आवश्यकता थी।

पेपर यह सुझाव देता है कि यह सुधार इन सभी नए नियमों के एक साथ मिलकर काम करने के कारण आया है, न कि केवल एक अकेले ट्रिक के कारण। उन्होंने अपने "स्मार्ट गेट" के लिए एक विशिष्ट सेटिंग (जिसे शार्पनेस पैरामीटर aa कहा जाता है) का भी परीक्षण किया और पाया कि एक नरम गेट (a=0.5a=0.5) सख्त गेट की तुलना में थोड़ा बेहतर काम करता है, लेकिन सबसे बड़ी जीत पूरे नए प्रशिक्षण सिस्टम से आई, न कि केवल गेट से।

इसका क्या अर्थ है

लेखक इस बात को ध्यान में रखते हुए सावधानी बरतते हैं कि उन्होंने इन नियमों के हर संभावित संस्करण को आज़माया नहीं है (उन्होंने "पूर्ण एब्लेशन स्टडी" नहीं की है), इसलिए ऐसी बेहतर सेटिंग्स हो सकती हैं जिन्हें उन्होंने अभी तक नहीं खोजा है। हालाँकि, जो परिणाम उन्होंने पाए वे ठोस हैं: AI को एक पूर्ण गोले पर चलने के लिए मजबूर करके और कदम उठाने के अधिक स्मार्ट, नियंत्रित तरीके का उपयोग करके, हम इन विशाल मॉडलों को काफी कम डेटा और समय का उपयोग करके स्मार्ट बना सकते हैं। यह एक व्यावहारिक नुस्खा है जो बताता है कि हम बेहतर AI बना सकते हैं, जिसके लिए हमें उन्हें पूरा इंटरनेट खिलाने की आवश्यकता नहीं है, बल्कि केवल उसका एक बहुत अधिक कुशल हिस्सा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →