Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
Molt एक कॉम्पैक्ट, PyTorch-नेटिव ओपन-सोर्स फ्रेमवर्क है जिसे एजेंटिक सुदृढीकरण लर्निंग (reinforcement learning) अनुसंधान को सरल बनाने के लिए डिज़ाइन किया गया है, जो प्रदर्शन से समझौता किए बिना एंड-टू-एंड एल्गोरिदम संशोधनों को सक्षम बनाता है, अत्याधुनिक Megatron-आधारित स्टैक्स के साथ सांख्यिकीय समानता सुनिश्चित करता है और प्रशिक्षण निरंतरता एवं कोडबेस स्पष्टता सुनिश्चित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल सवालों के जवाब ही नहीं देते, बल्कि वास्तव में साहसिक कार्य (adventures) पर निकलते हैं, पहेलियाँ सुलझाते हैं, कोड लिखते हैं, और यहाँ तक कि स्मार्ट बनने के लिए गेम भी खेलते हैं। यह एजेंटिक रीइन्फोर्समेंट लर्निंग (Agentic Reinforcement Learning) का रोमांचक क्षितिज है। इसे एक वीडियो गेम कैरेक्टर को स्क्रिप्ट देने के बजाय, उसे गेम खेलने देने, गलतियाँ करने देने और मिलने वाले रिवॉर्ड्स से सीखने देने जैसा समझें। लक्ष्य ऐसे AI एजेंट बनाना है जो अपने आप सोच सकें, टूल्स का उपयोग कर सकें और जटिल, बहु-चरणीय कार्यों को संभाल सकें।
हालाँकि, इन स्मार्ट एजेंटों को बनाना वर्तमान में एक रेस कार को 200 मील प्रति घंटे की रफ्तार से चलते समय ठीक करने की कोशिश करने जैसा है। इन एजेंटों को प्रशिक्षित करने के लिए शोधकर्ता जिन सॉफ्टवेयर टूल्स का उपयोग करते हैं, वे विशाल, जटिल और बड़े औद्योगिक-स्तर के कारखानों के लिए बनाए गए हैं। यदि कोई शोधकर्ता एक नया विचार आज़माना चाहता है—जैसे कि एजेंट को अपनी गलती से कैसे सीखने के तरीके को बदलना—तो उन्हें अक्सर उलझे हुए कोड की कई परतों में खुदाई करनी पड़ती है, जैसे कि ऊन के एक विशाल गोले को सुलझाना। यह प्रयोग करने की प्रक्रिया को धीमा और निराशाजनक बना देता है। बड़ा सवाल यह है: क्या हम एक ऐसा प्रशिक्षण तंत्र बना सकते हैं जो सबसे बड़े सुपरकंप्यूटरों के लिए पर्याप्त तेज़ और शक्तिशाली हो, लेकिन एक अकेले शोधकर्ता के लिए समझने और बदलने में इतना सरल और साफ भी हो कि वह एक दोपहर में इसे कर सके?
यह पेपर मोल्ट (Mlt) पेश करता है, जो ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया एक नया प्रशिक्षण ढांचा (framework) है। लेखक, जो NVIDIA की एक टीम है, तर्क देते हैं कि शक्तिशाली AI को प्रशिक्षित करने के लिए आपको एक विशाल, जटिल मशीन की आवश्यकता नहीं है; आपको बस एक अधिक स्वच्छ और पठनीय मशीन की आवश्यकता है। उन्होंने मोल्ट को "पायटॉर्च-नेटिव" (PyTorch-native) फ्रेमवर्क के रूप में बनाया है, जिसका अर्थ है कि यह सबसे लोकप्रिय AI कोडिंग टूल्स की भाषा बोलता है, जिससे सब कुछ एक ही स्थान पर रहता है।
पेपर का मुख्य निष्कर्ष यह है कि मोल्ट अविश्वसनीय रूप से कुशल है। यह इतना छोटा है कि एक मानव शोधकर्ता (या यहाँ तक कि एक AI कोडिंग असिस्टेंट भी) पूरे कोडबेस को पढ़ सकता है और शुरू से अंत तक समझ सकता है कि एजेंट कैसे सीखता है। अन्य प्रणालियों की तुलना में बहुत छोटा और सरल होने के बावजूद, लेखकों ने इसके प्रदर्शन को मापा और पाया कि यह आज के सबसे उन्नत, भारी-भरकम सिस्टम के सांख्यिकीय रूप से तुलनीय (statistically comparable) है। एक आमने-सामने के परीक्षण में, मोल्ट ने एक जटिल प्रतिस्पर्धी जितनी ही तेज़ी से एक AI मॉडल को प्रशिक्षित किया, जिससे यह सिद्ध हुआ कि आपको सरलता के लिए गति का त्याग करने की आवश्यकता नहीं है।
पेपर स्पष्ट रूप से इस विचार का खंडन करता है कि अच्छे शोध के लिए "हाइपरस्केल" जटिलता आवश्यक है। वे इस धारणा को खारिज करते हैं कि शोधकर्ताओं को एक प्रयोग चलाने के लिए हज़ारों लाइनों के भ्रमित करने वाले कोड को विरासत में लेना ही होगा। इसके बजाय, वे दिखाते हैं कि कोड को साफ और मुख्य एल्गोरिदम पर केंद्रित रखकर, आप वही परिणाम प्राप्त कर सकते हैं। वे इस विचार को भी खारिज करते हैं कि "टोकन ड्रिफ्ट" (जहाँ कंप्यूटर एक शब्द बनाता है लेकिन प्रशिक्षण के दौरान उसका एक अलग संस्करण गिनता है) स्वीकार्य है; मोल्ट यह सुनिश्चित करता है कि AI को ठीक उन्हीं टोकन पर प्रशिक्षित किया जाए जो उसने उत्पन्न किए थे, जिससे छिपी हुई त्रुटियों को रोका जा सके।
संक्षेप में, मोल्ट एक "लीन" (lean) प्रशिक्षण लूप है जो शोधकर्ताओं को चीज़ों को खराब किए बिना तेज़ी से आगे बढ़ने देता है। यह एक चतुर सेटअप का उपयोग करता है जहाँ AI उत्तर उत्पन्न करता है, उन्हें एक सरल कतार (queue) के माध्यम से भेजता है, और तुरंत प्रशिक्षण देता है, और साथ ही हर कदम का सटीक रिकॉर्ड भी रखता है। लेखकों ने इसे एक विशाल 35-बिलियन-पैरामीटर वाले मॉडल पर मापा और यहाँ तक कि इसे 700-बिलियन-पैरामीटर वाले मॉडल पर भी काम करते हुए दिखाया, जो यह सुझाव देता है कि यह सरल दृष्टिकोण AI की सबसे बड़ी चुनौतियों तक स्केल हो सकता है बिना जटिल हुए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।